2024 国際大会(INLG 2024)
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 主観評価総合賞(日本語トラック)・スポンサー賞 | kanolab |
| 主観評価総合賞(英語トラック) | UEC-IL |
| 勝率・ゲーム行動優秀賞 | sUper_IL |
| 審査員特別賞「初心者プレイっぽい賞」 | HondaNLP (鳥海審査員) |
| 審査員特別賞「人狼での説得賞」 | sUper_IL (原田審査員) |
結果発表・表彰は AIWolfDial 2024 ワークショップ(2024年9月24日、INLG 2024、東京)で行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
英語 5人村 (58 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 58 | 55.2% | 50.0% (10/20) | 61.5% (8/13) | 50.0% (7/14) | 63.6% (7/11) | 55.0% |
| 2 | kanolab | 58 | 53.4% | 56.5% (13/23) | 42.9% (3/7) | 61.5% (8/13) | 46.7% (7/15) | 52.8% |
| 3 | satozaki | 58 | 51.7% | 47.8% (11/23) | 57.1% (8/14) | 45.5% (5/11) | 60.0% (6/10) | 51.6% |
| 4 | UEC-IL | 58 | 51.7% | 52.4% (11/21) | 50.0% (6/12) | 50.0% (6/12) | 53.8% (7/13) | 51.7% |
| 5 | yuricat | 58 | 37.9% | 44.8% (13/29) | 33.3% (4/12) | 37.5% (3/8) | 22.2% (2/9) | 36.5% |
日本語 5人村 (64 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 40 | 62.5% | 62.5% (10/16) | 50.0% (4/8) | 50.0% (4/8) | 87.5% (7/8) | 62.5% |
| 2 | satozaki | 40 | 60.0% | 37.5% (6/16) | 75.0% (6/8) | 75.0% (6/8) | 75.0% (6/8) | 60.0% |
| 3 | UEC-IL | 40 | 52.5% | 50.0% (8/16) | 37.5% (3/8) | 62.5% (5/8) | 62.5% (5/8) | 52.5% |
| 4 | HondaNLP | 40 | 52.5% | 50.0% (8/16) | 50.0% (4/8) | 75.0% (6/8) | 37.5% (3/8) | 52.5% |
| 5 | kanolab | 40 | 47.5% | 50.0% (8/16) | 25.0% (2/8) | 50.0% (4/8) | 62.5% (5/8) | 47.5% |
| 6 | GPTaku | 40 | 45.0% | 43.8% (7/16) | 37.5% (3/8) | 50.0% (4/8) | 50.0% (4/8) | 45.0% |
| 7 | IS_Lab | 40 | 37.5% | 37.5% (6/16) | 37.5% (3/8) | 25.0% (2/8) | 50.0% (4/8) | 37.5% |
| 8 | yuricat | 40 | 35.0% | 31.2% (5/16) | 50.0% (4/8) | 50.0% (4/8) | 12.5% (1/8) | 35.0% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
英語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.67 | 1.14 | 1.44 | 1.05 | 0.67 |
| kanolab | 1.17 | 1.20 | 2.48 | 1.36 | 0.80 |
| satozaki | 1.05 | 0.91 | 0.91 | 1.12 | 0.69 |
| UEC-IL | 0.90 | 0.80 | 0.75 | 0.96 | 0.88 |
| yuricat | 1.25 | 0.95 | 0.80 | 1.10 | 0.44 |
日本語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.34 | 1.46 | 0.55 | 1.10 | 0.69 |
| satozaki | 1.06 | 0.70 | 0.67 | 0.80 | 0.73 |
| UEC-IL | 0.93 | 0.87 | 0.90 | 0.95 | 0.91 |
| HondaNLP | 0.95 | 1.17 | 1.50 | 1.18 | 0.75 |
| kanolab | 1.02 | 0.75 | 1.12 | 1.08 | 0.67 |
| GPTaku | 1.58 | 0.75 | 0.86 | 0.82 | 0.56 |
| IS_Lab | 0.91 | 0.79 | 1.00 | 1.15 | 0.90 |
| yuricat | 1.32 | 1.68 | 0.67 | 0.92 | 0.80 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
英語 5人村
審査員 3 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 2) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | UEC-IL | 4.33 | 4.67 | 4.00 | 4.67 | 4.33 | 4.40 |
| 2 | sUper_IL | 4.00 | 4.00 | 4.00 | 4.67 | 4.00 | 4.13 |
| 3 | satozaki | 3.33 | 3.67 | 3.67 | 3.67 | 3.00 | 3.47 |
| 4 | kanolab | 2.67 | 3.33 | 3.00 | 3.33 | 3.67 | 3.20 |
| 5 | Mille | 1.67 | 2.00 | 1.00 | 2.00 | 1.67 | 1.67 |
日本語 5人村
審査員 4 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 1) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | kanolab | 4.33 | 3.67 | 4.00 | 3.67 | 3.67 | 3.87 |
| 2 | UEC-IL | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 |
| 3 | HondaNLP | 4.00 | 3.00 | 4.00 | 3.33 | 3.67 | 3.60 |
| 4 | IS_Lab | 4.00 | 3.67 | 2.67 | 3.00 | 4.33 | 3.53 |
| 5 | sUper_IL | 3.67 | 3.67 | 3.67 | 4.00 | 2.67 | 3.53 |
| 6 | GPTaku | 3.33 | 3.67 | 2.67 | 3.00 | 2.67 | 3.07 |
| 7 | satozaki | 3.67 | 2.67 | 2.67 | 4.00 | 2.33 | 3.07 |
| 8 | Mille | 2.33 | 3.00 | 2.00 | 2.33 | 2.00 | 2.33 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 英語 5人村 | 58 | ログ一覧 |
| 日本語 5人村 | 64 | ログ一覧 |
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 主観評価総合賞(日本語トラック)・スポンサー賞 | kanolab |
| 主観評価総合賞(英語トラック) | UEC-IL |
| 勝率・ゲーム行動優秀賞 | sUper_IL |
| 審査員特別賞「初心者プレイっぽい賞」 | HondaNLP (鳥海審査員) |
| 審査員特別賞「人狼での説得賞」 | sUper_IL (原田審査員) |
結果発表・表彰は AIWolfDial 2024 ワークショップ(2024年9月24日、INLG 2024、東京)で行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
英語 5人村 (58 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 58 | 55.2% | 50.0% (10/20) | 61.5% (8/13) | 50.0% (7/14) | 63.6% (7/11) | 55.0% |
| 2 | kanolab | 58 | 53.4% | 56.5% (13/23) | 42.9% (3/7) | 61.5% (8/13) | 46.7% (7/15) | 52.8% |
| 3 | satozaki | 58 | 51.7% | 47.8% (11/23) | 57.1% (8/14) | 45.5% (5/11) | 60.0% (6/10) | 51.6% |
| 4 | UEC-IL | 58 | 51.7% | 52.4% (11/21) | 50.0% (6/12) | 50.0% (6/12) | 53.8% (7/13) | 51.7% |
| 5 | yuricat | 58 | 37.9% | 44.8% (13/29) | 33.3% (4/12) | 37.5% (3/8) | 22.2% (2/9) | 36.5% |
日本語 5人村 (64 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | sUper_IL | 40 | 62.5% | 62.5% (10/16) | 50.0% (4/8) | 50.0% (4/8) | 87.5% (7/8) | 62.5% |
| 2 | satozaki | 40 | 60.0% | 37.5% (6/16) | 75.0% (6/8) | 75.0% (6/8) | 75.0% (6/8) | 60.0% |
| 3 | UEC-IL | 40 | 52.5% | 50.0% (8/16) | 37.5% (3/8) | 62.5% (5/8) | 62.5% (5/8) | 52.5% |
| 4 | HondaNLP | 40 | 52.5% | 50.0% (8/16) | 50.0% (4/8) | 75.0% (6/8) | 37.5% (3/8) | 52.5% |
| 5 | kanolab | 40 | 47.5% | 50.0% (8/16) | 25.0% (2/8) | 50.0% (4/8) | 62.5% (5/8) | 47.5% |
| 6 | GPTaku | 40 | 45.0% | 43.8% (7/16) | 37.5% (3/8) | 50.0% (4/8) | 50.0% (4/8) | 45.0% |
| 7 | IS_Lab | 40 | 37.5% | 37.5% (6/16) | 37.5% (3/8) | 25.0% (2/8) | 50.0% (4/8) | 37.5% |
| 8 | yuricat | 40 | 35.0% | 31.2% (5/16) | 50.0% (4/8) | 50.0% (4/8) | 12.5% (1/8) | 35.0% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
英語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.67 | 1.14 | 1.44 | 1.05 | 0.67 |
| kanolab | 1.17 | 1.20 | 2.48 | 1.36 | 0.80 |
| satozaki | 1.05 | 0.91 | 0.91 | 1.12 | 0.69 |
| UEC-IL | 0.90 | 0.80 | 0.75 | 0.96 | 0.88 |
| yuricat | 1.25 | 0.95 | 0.80 | 1.10 | 0.44 |
日本語 5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| sUper_IL | 0.34 | 1.46 | 0.55 | 1.10 | 0.69 |
| satozaki | 1.06 | 0.70 | 0.67 | 0.80 | 0.73 |
| UEC-IL | 0.93 | 0.87 | 0.90 | 0.95 | 0.91 |
| HondaNLP | 0.95 | 1.17 | 1.50 | 1.18 | 0.75 |
| kanolab | 1.02 | 0.75 | 1.12 | 1.08 | 0.67 |
| GPTaku | 1.58 | 0.75 | 0.86 | 0.82 | 0.56 |
| IS_Lab | 0.91 | 0.79 | 1.00 | 1.15 | 0.90 |
| yuricat | 1.32 | 1.68 | 0.67 | 0.92 | 0.80 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
英語 5人村
審査員 3 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 2) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | UEC-IL | 4.33 | 4.67 | 4.00 | 4.67 | 4.33 | 4.40 |
| 2 | sUper_IL | 4.00 | 4.00 | 4.00 | 4.67 | 4.00 | 4.13 |
| 3 | satozaki | 3.33 | 3.67 | 3.67 | 3.67 | 3.00 | 3.47 |
| 4 | kanolab | 2.67 | 3.33 | 3.00 | 3.33 | 3.67 | 3.20 |
| 5 | Mille | 1.67 | 2.00 | 1.00 | 2.00 | 1.67 | 1.67 |
日本語 5人村
審査員 4 名の 5 段階評価(AIWolfDial 2024 概要論文 Table 1) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | kanolab | 4.33 | 3.67 | 4.00 | 3.67 | 3.67 | 3.87 |
| 2 | UEC-IL | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 | 3.67 |
| 3 | HondaNLP | 4.00 | 3.00 | 4.00 | 3.33 | 3.67 | 3.60 |
| 4 | IS_Lab | 4.00 | 3.67 | 2.67 | 3.00 | 4.33 | 3.53 |
| 5 | sUper_IL | 3.67 | 3.67 | 3.67 | 4.00 | 2.67 | 3.53 |
| 6 | GPTaku | 3.33 | 3.67 | 2.67 | 3.00 | 2.67 | 3.07 |
| 7 | satozaki | 3.67 | 2.67 | 2.67 | 4.00 | 2.33 | 3.07 |
| 8 | Mille | 2.33 | 3.00 | 2.00 | 2.33 | 2.00 | 2.33 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 英語 5人村 | 58 | ログ一覧 |
| 日本語 5人村 | 64 | ログ一覧 |
ログの見方
「ログ一覧」を開くと、正常に終了したゲームのログ(.log ファイル)が一覧で表示されます。ファイル名の先頭はゲーム開始時刻、続く部分は参加チーム名です。
- ブラウザで閲覧する: 見たいログの行にある「viewerで見る」列の「▶ 開く」を押すと、aiwolf-nlp-viewer がそのログを読み込んで開きます。
- ファイルを保存する: 「ダウンロード」列の「⬇ 保存」を押すと、ログファイルをダウンロードできます。ファイル名をクリックした場合は、ログの本文がそのままテキストで表示されます。
- フォルダごとまとめて保存する: 一覧の「Parent directory/」で一つ上の階層に移動し、フォルダ(
successなど)の行にある「⬇ zip」を押すと、そのフォルダの全ファイルをブラウザ内で zip にまとめてダウンロードできます(ファイル数の確認ダイアログが出ます)。
viewer の使い方はリンクページの「ログ閲覧ツール」にまとめています。