各大会は 4 つの観点で評価しています。勝率とゲーム指標はゲームログから機械的に計算する指標で、残りの 2 つは対話の質の評価です。人手評価と、ゲームごとにプレイヤーを順位付けする LLM ジャッジ(相対評価)があります。
- 勝率: 勝ち数 ÷ 試合数を総合・役職別に出し、役職構成で加重した値も併記します。全大会で同じ定義です。
- ゲーム指標: 追放・占い・護衛の対象になった頻度と、占い・投票で人狼を当てた頻度を、ランダムに行動した場合との比で表します(1.00 = ランダム)。
- 人手評価: 評価者が抽出ログを読み、A〜E の評価項目(9 人村・13 人村は F チームプレイを追加)でプレイヤーを評価します。2024 冬季以降は順位付け、それ以前は 5 点満点の評点です。
- LLM-as-a-Judge(相対評価): LLM が同じ評価項目でゲームごとにプレイヤーを順位付けし、チームごとに平均します。2025 国際大会から大会の評価として実施しており(2025 春季は大会後に参考値として実施)、モデルは大会ごとに異なります(下表)。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
大会ごとの評価者・モデル
| 大会 | 人手評価 | LLM 相対評価 |
|---|---|---|
| 2026 国際大会(INLG 2026) | 未実施 | 1次: GPT-5.4 Gemini 2.5 Pro Claude Sonnet 4.5 2次: GPT-5.6 Terra Claude Sonnet 5 Gemini 3.1 Pro gemma-4-31b Qwen3.6-27b Mistral-Small-3.2 EXAONE-4.5-33b Seed-OSS-36b |
| 2026 春季国内大会 | 学生評価者 3 名 | Claude Sonnet 4.5 Gemini 2.5 Pro gemma-4-31b GPT-5.4 qwen3-6-27b |
| 2025 国際大会(INLG 2025) | 学生評価者 4 名 | GPT-4o GPT-5 |
| 2025 春季国内大会 | 学生評価者 6 名 | GPT-4o GPT-5 (大会後に実施) |
| 2024 冬季国内大会 | 学生評価者 4 名 | 未実施 |
| 2024 国際大会(INLG 2024) | 審査員 4 名(日本語)/3 名(英語) | 未実施 |
| 2024 春季国内大会 | 審査員 4 名 | 未実施 |