公式結果(表彰)
勝率の表彰は、役職構成で加重した勝率(下の表の「構成加重」)によります。
| 賞 | チーム |
|---|---|
| 主観評価総合賞(日本語トラック)・スポンサー賞 | kanolab |
| 主観評価総合賞(英語トラック) | UEC-IL |
| 勝率・ゲーム行動優秀賞 | sUper_IL |
| 審査員特別賞「初心者プレイっぽい賞」 | HondaNLP (鳥海審査員) |
| 審査員特別賞「人狼での説得賞」 | sUper_IL (原田審査員) |
結果発表・表彰は AIWolfDial 2024 ワークショップ(2024年9月24日、INLG 2024、東京)で行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。公式の勝率は「構成加重」で、役職別の勝率を村の役職構成の重みで平均した値です(配役の偏りを打ち消すため)。順位もこの値によります。「総合」は単純な勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。
英語 5人村 (58 試合)
| # | チーム | 試合 | 構成加重 | 総合 | 村人 | 占い師 | 狂人 | 人狼 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 58 | 55.0% | 55.2% | 50.0% (10/20) | 61.5% (8/13) | 50.0% (7/14) | 63.6% (7/11) |
| 2 | kanolab | 58 | 52.8% | 53.4% | 56.5% (13/23) | 42.9% (3/7) | 61.5% (8/13) | 46.7% (7/15) |
| 3 | UEC-IL | 58 | 51.7% | 51.7% | 52.4% (11/21) | 50.0% (6/12) | 50.0% (6/12) | 53.8% (7/13) |
| 4 | satozaki | 58 | 51.6% | 51.7% | 47.8% (11/23) | 57.1% (8/14) | 45.5% (5/11) | 60.0% (6/10) |
| 5 | yuricat | 58 | 36.5% | 37.9% | 44.8% (13/29) | 33.3% (4/12) | 37.5% (3/8) | 22.2% (2/9) |
日本語 5人村 (64 試合)
| # | チーム | 試合 | 構成加重 | 総合 | 村人 | 占い師 | 狂人 | 人狼 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 40 | 62.5% | 62.5% | 62.5% (10/16) | 50.0% (4/8) | 50.0% (4/8) | 87.5% (7/8) |
| 2 | satozaki | 40 | 60.0% | 60.0% | 37.5% (6/16) | 75.0% (6/8) | 75.0% (6/8) | 75.0% (6/8) |
| 3 | UEC-IL | 40 | 52.5% | 52.5% | 50.0% (8/16) | 37.5% (3/8) | 62.5% (5/8) | 62.5% (5/8) |
| 4 | HondaNLP | 40 | 52.5% | 52.5% | 50.0% (8/16) | 50.0% (4/8) | 75.0% (6/8) | 37.5% (3/8) |
| 5 | kanolab | 40 | 47.5% | 47.5% | 50.0% (8/16) | 25.0% (2/8) | 50.0% (4/8) | 62.5% (5/8) |
| 6 | GPTaku | 40 | 45.0% | 45.0% | 43.8% (7/16) | 37.5% (3/8) | 50.0% (4/8) | 50.0% (4/8) |
| 7 | IS_Lab | 40 | 37.5% | 37.5% | 37.5% (6/16) | 37.5% (3/8) | 25.0% (2/8) | 50.0% (4/8) |
| 8 | yuricat | 40 | 35.0% | 35.0% | 31.2% (5/16) | 50.0% (4/8) | 50.0% (4/8) | 12.5% (1/8) |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
英語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.67 | 1.14 | 1.44 | 1.05 | 0.67 |
| kanolab | 1.17 | 1.20 | 2.48 | 1.36 | 0.80 |
| satozaki | 1.05 | 0.91 | 0.91 | 1.12 | 0.69 |
| UEC-IL | 0.90 | 0.80 | 0.75 | 0.96 | 0.88 |
| yuricat | 1.25 | 0.95 | 0.80 | 1.10 | 0.44 |
日本語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.34 | 1.46 | 0.55 | 1.10 | 0.69 |
| satozaki | 1.06 | 0.70 | 0.67 | 0.80 | 0.73 |
| UEC-IL | 0.93 | 0.87 | 0.90 | 0.95 | 0.91 |
| HondaNLP | 0.95 | 1.17 | 1.50 | 1.18 | 0.75 |
| kanolab | 1.02 | 0.75 | 1.12 | 1.08 | 0.67 |
| GPTaku | 1.58 | 0.75 | 0.86 | 0.82 | 0.56 |
| IS_Lab | 0.91 | 0.79 | 1.00 | 1.15 | 0.90 |
| yuricat | 1.32 | 1.68 | 0.67 | 0.92 | 0.80 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
英語 5人村
審査員 3 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 2) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | UEC-IL | 4.33 | 4.67 | 4.00 | 4.67 | 4.33 | 4.40 |
| 2 | sUper_IL | 4.00 | 4.00 | 4.00 | 4.67 | 4.00 | 4.13 |
| 3 | satozaki | 3.33 | 3.67 | 3.67 | 3.67 | 3.00 | 3.47 |
| 4 | kanolab | 2.67 | 3.33 | 3.00 | 3.33 | 3.67 | 3.20 |
| 5 | Mille | 1.67 | 2.00 | 1.00 | 2.00 | 1.67 | 1.67 |
日本語 5人村
審査員 4 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 1) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | kanolab | 4.33 | 3.67 | 4.00 | 3.67 | 3.67 | 3.87 |
| 2 | UEC-IL | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 |
| 3 | HondaNLP | 4.00 | 3.00 | 4.00 | 3.33 | 3.67 | 3.60 |
| 4 | IS_Lab | 4.00 | 3.67 | 2.67 | 3.00 | 4.33 | 3.53 |
| 5 | sUper_IL | 3.67 | 3.67 | 3.67 | 4.00 | 2.67 | 3.53 |
| 6 | GPTaku | 3.33 | 3.67 | 2.67 | 3.00 | 2.67 | 3.07 |
| 7 | satozaki | 3.67 | 2.67 | 2.67 | 4.00 | 2.33 | 3.07 |
| 8 | Mille | 2.33 | 3.00 | 2.00 | 2.33 | 2.00 | 2.33 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 英語 5人村 | 58 | ログ一覧 |
| 日本語 5人村 | 64 | ログ一覧 |