各大会は 4 つの観点で評価しています。勝率とゲーム指標はゲームログから機械的に計算する指標で、残りの 2 つは対話の質の評価です。人手評価と、ゲームごとにプレイヤーを順位付けする LLM ジャッジ(相対評価)があります。

  • 勝率: 勝ち数 ÷ 試合数を総合・役職別に出し、役職構成で加重した値も併記します。全大会で同じ定義です。
  • ゲーム指標: 追放・占い・護衛の対象になった頻度と、占い・投票で人狼を当てた頻度を、ランダムに行動した場合との比で表します(1.00 = ランダム)。
  • 人手評価: 評価者が抽出ログを読み、A〜E の評価項目(9 人村・13 人村は F チームプレイを追加)でプレイヤーを評価します。2024 冬季以降は順位付け、それ以前は 5 点満点の評点です。
  • LLM-as-a-Judge(相対評価): LLM が同じ評価項目でゲームごとにプレイヤーを順位付けし、チームごとに平均します。2025 国際大会から大会の評価として実施しており(2025 春季は大会後に参考値として実施)、モデルは大会ごとに異なります(下表)。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。

大会ごとの評価者・モデル

大会人手評価LLM 相対評価
2026 国際大会(INLG 2026)未実施1次: GPT-5.4
Gemini 2.5 Pro
Claude Sonnet 4.5
2次: GPT-5.6 Terra
Claude Sonnet 5
Gemini 3.1 Pro
gemma-4-31b
Qwen3.6-27b
Mistral-Small-3.2
EXAONE-4.5-33b
Seed-OSS-36b
2026 春季国内大会学生評価者 3 名Claude Sonnet 4.5
Gemini 2.5 Pro
gemma-4-31b
GPT-5.4
qwen3-6-27b
2025 国際大会(INLG 2025)学生評価者 4 名GPT-4o
GPT-5
2025 春季国内大会学生評価者 6 名GPT-4o
GPT-5
(大会後に実施)
2024 冬季国内大会学生評価者 4 名未実施
2024 国際大会(INLG 2024)審査員 4 名(日本語)/3 名(英語)未実施
2024 春季国内大会審査員 4 名未実施