2024 春季国内大会
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 総合最優秀賞 | kanolab (勝率(平均・村人・占い師・狂人)、主観評価(平均・A・D・E)) |
| 総合優秀賞 次点 | UEC-IL (勝率(人狼)、主観評価(平均)) |
| 総合優秀賞 3位 | satozaki (勝率(占い師)、主観評価(B・C)) |
| 審査員特別賞「裏切らない者賞」 | satozaki (大槻審査員) |
| 審査員特別賞「説得賞」 | kanolab (片上審査員) |
| 審査員特別賞「逆転勝利賞」 | ガッツだぜ!! (原田審査員) |
結果発表・表彰は 2024 年度人工知能学会全国大会の企画セッション「KS-8 人狼知能コンテスト2024国内大会自然言語部門」で行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
5人村 (62 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | kanolab | 62 | 64.5% | 70.8% (17/24) | 66.7% (8/12) | 64.3% (9/14) | 50.0% (6/12) | 64.5% |
| 2 | ガッツだぜ!! | 62 | 53.2% | 66.7% (16/24) | 46.2% (6/13) | 33.3% (4/12) | 53.8% (7/13) | 53.3% |
| 3 | UEC-IL | 62 | 51.6% | 61.5% (16/26) | 50.0% (6/12) | 25.0% (3/12) | 58.3% (7/12) | 51.3% |
| 4 | GPTaku | 62 | 50.0% | 54.2% (13/24) | 61.5% (8/13) | 50.0% (6/12) | 30.8% (4/13) | 50.1% |
| 5 | satozaki | 62 | 38.7% | 38.5% (10/26) | 66.7% (8/12) | 33.3% (4/12) | 16.7% (2/12) | 38.7% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| kanolab | 0.77 | 1.02 | 0.80 | 1.32 | 0.64 |
| ガッツだぜ!! | - | - | - | - | - |
| UEC-IL | 1.22 | 1.22 | 1.00 | 0.91 | 0.75 |
| GPTaku | 1.33 | 0.78 | 1.53 | 1.61 | 0.81 |
| satozaki | 1.01 | 0.82 | 0.92 | 1.16 | 0.40 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
5人村
審査員 4 名の 5 段階評価(評価シートの集計値) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | UEC-IL | 3.50 | 3.25 | 3.00 | 3.25 | 3.75 | 3.35 |
| 2 | kanolab | 3.75 | 2.75 | 2.75 | 3.50 | 4.00 | 3.35 |
| 3 | satozaki | 3.00 | 3.75 | 3.50 | 3.25 | 2.25 | 3.15 |
| 4 | ガッツだぜ!! | 2.75 | 2.50 | 1.75 | 2.50 | 1.75 | 2.25 |
| 5 | GPTaku | 3.00 | 2.00 | 1.50 | 2.25 | 2.25 | 2.20 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 5人村 | 62 | ログ一覧 |
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 総合最優秀賞 | kanolab (勝率(平均・村人・占い師・狂人)、主観評価(平均・A・D・E)) |
| 総合優秀賞 次点 | UEC-IL (勝率(人狼)、主観評価(平均)) |
| 総合優秀賞 3位 | satozaki (勝率(占い師)、主観評価(B・C)) |
| 審査員特別賞「裏切らない者賞」 | satozaki (大槻審査員) |
| 審査員特別賞「説得賞」 | kanolab (片上審査員) |
| 審査員特別賞「逆転勝利賞」 | ガッツだぜ!! (原田審査員) |
結果発表・表彰は 2024 年度人工知能学会全国大会の企画セッション「KS-8 人狼知能コンテスト2024国内大会自然言語部門」で行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
5人村 (62 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | kanolab | 62 | 64.5% | 70.8% (17/24) | 66.7% (8/12) | 64.3% (9/14) | 50.0% (6/12) | 64.5% |
| 2 | ガッツだぜ!! | 62 | 53.2% | 66.7% (16/24) | 46.2% (6/13) | 33.3% (4/12) | 53.8% (7/13) | 53.3% |
| 3 | UEC-IL | 62 | 51.6% | 61.5% (16/26) | 50.0% (6/12) | 25.0% (3/12) | 58.3% (7/12) | 51.3% |
| 4 | GPTaku | 62 | 50.0% | 54.2% (13/24) | 61.5% (8/13) | 50.0% (6/12) | 30.8% (4/13) | 50.1% |
| 5 | satozaki | 62 | 38.7% | 38.5% (10/26) | 66.7% (8/12) | 33.3% (4/12) | 16.7% (2/12) | 38.7% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| kanolab | 0.77 | 1.02 | 0.80 | 1.32 | 0.64 |
| ガッツだぜ!! | - | - | - | - | - |
| UEC-IL | 1.22 | 1.22 | 1.00 | 0.91 | 0.75 |
| GPTaku | 1.33 | 0.78 | 1.53 | 1.61 | 0.81 |
| satozaki | 1.01 | 0.82 | 0.92 | 1.16 | 0.40 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
5人村
審査員 4 名の 5 段階評価(評価シートの集計値) 5 点満点の評点(高いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | UEC-IL | 3.50 | 3.25 | 3.00 | 3.25 | 3.75 | 3.35 |
| 2 | kanolab | 3.75 | 2.75 | 2.75 | 3.50 | 4.00 | 3.35 |
| 3 | satozaki | 3.00 | 3.75 | 3.50 | 3.25 | 2.25 | 3.15 |
| 4 | ガッツだぜ!! | 2.75 | 2.50 | 1.75 | 2.50 | 1.75 | 2.25 |
| 5 | GPTaku | 3.00 | 2.00 | 1.50 | 2.25 | 2.25 | 2.20 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 5人村 | 62 | ログ一覧 |
ログの見方
「ログ一覧」を開くと、正常に終了したゲームのログ(.log ファイル)が一覧で表示されます。ファイル名の先頭はゲーム開始時刻、続く部分は参加チーム名です。
- ブラウザで閲覧する: 見たいログの行にある「viewerで見る」列の「▶ 開く」を押すと、aiwolf-nlp-viewer がそのログを読み込んで開きます。
- ファイルを保存する: 「ダウンロード」列の「⬇ 保存」を押すと、ログファイルをダウンロードできます。ファイル名をクリックした場合は、ログの本文がそのままテキストで表示されます。
- フォルダごとまとめて保存する: 一覧の「Parent directory/」で一つ上の階層に移動し、フォルダ(
successなど)の行にある「⬇ zip」を押すと、そのフォルダの全ファイルをブラウザ内で zip にまとめてダウンロードできます(ファイル数の確認ダイアログが出ます)。
viewer の使い方はリンクページの「ログ閲覧ツール」にまとめています。