2024 冬季国内大会

この大会のページを開く →

公式結果(表彰)

賞チーム
平均勝率 1 位(Macro・Micro2)UEC-IL
平均勝率 1 位(Micro)kanolab
主観評価 1 位(平均・C 一貫性)UEC-IL
主観評価 1 位(B 文脈)kanolab
主観評価 1 位(D ゲーム行動・E 多様性)CanisLupus

結果発表・表彰は言語処理学会第31回年次大会(2025年3月10日〜13日、長崎)のテーマセッションで行いました。

勝率

本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。

5人村 (210 試合)

#チーム試合総合村人占い師狂人人狼構成加重
1UEC-IL15256.6%61.3% (38/62)58.6% (17/29)41.9% (13/31)60.0% (18/30)56.6%
2kanolab15156.3%54.8% (34/62)64.5% (20/31)46.4% (13/28)60.0% (18/30)56.1%
3Mille15451.3%56.5% (35/62)46.7% (14/30)56.2% (18/32)40.0% (12/30)51.2%
4sUper_IL14750.3%50.0% (29/58)57.1% (16/28)40.0% (12/30)54.8% (17/31)50.4%
5CanisLupus14749.7%57.6% (34/59)44.8% (13/29)53.3% (16/30)34.5% (10/29)49.6%
6barneko14546.9%49.1% (28/57)58.1% (18/31)42.9% (12/28)34.5% (10/29)46.7%
7satozaki15444.2%46.7% (28/60)46.9% (15/32)41.9% (13/31)38.7% (12/31)44.2%

ゲーム指標

ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。

5人村

チーム追放されやすさ占われやすさ占い精度投票精度狂人の人狼回避
UEC-IL0.881.120.540.950.73
kanolab0.811.171.041.220.66
Mille1.320.800.831.250.83
sUper_IL0.960.931.171.110.70
CanisLupus1.141.231.371.410.67
barneko0.920.881.101.000.79
satozaki0.990.901.051.070.62

人手評価(相対評価)

評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。

5人村

学生評価者 4 名による抽出ログ 11 ゲームの順位付け(言語処理学会 2025 概要論文 表3) 順位平均(低いほど良い)。

#チーム発話表現の自然さ文脈を踏まえた対話一貫性・論理行動整合キャラクター性総合
1UEC-IL2.672.582.122.712.082.43
2CanisLupus2.643.323.322.251.572.62
3barneko2.502.892.712.543.502.83
4kanolab2.792.432.363.393.292.85
5Mille3.252.982.832.882.522.89
6sUper_IL2.383.002.772.753.732.92
7satozaki3.362.663.342.892.823.01

LLM-as-a-Judge(相対評価)

LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。

この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。

対戦ログ

本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。

トラック試合ログ
5人村210ログ一覧

公式結果(表彰)

賞チーム
平均勝率 1 位(Macro・Micro2)UEC-IL
平均勝率 1 位(Micro)kanolab
主観評価 1 位(平均・C 一貫性)UEC-IL
主観評価 1 位(B 文脈)kanolab
主観評価 1 位(D ゲーム行動・E 多様性)CanisLupus

結果発表・表彰は言語処理学会第31回年次大会(2025年3月10日〜13日、長崎)のテーマセッションで行いました。

勝率

本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。

5人村 (210 試合)

#チーム試合総合村人占い師狂人人狼構成加重
1UEC-IL15256.6%61.3% (38/62)58.6% (17/29)41.9% (13/31)60.0% (18/30)56.6%
2kanolab15156.3%54.8% (34/62)64.5% (20/31)46.4% (13/28)60.0% (18/30)56.1%
3Mille15451.3%56.5% (35/62)46.7% (14/30)56.2% (18/32)40.0% (12/30)51.2%
4sUper_IL14750.3%50.0% (29/58)57.1% (16/28)40.0% (12/30)54.8% (17/31)50.4%
5CanisLupus14749.7%57.6% (34/59)44.8% (13/29)53.3% (16/30)34.5% (10/29)49.6%
6barneko14546.9%49.1% (28/57)58.1% (18/31)42.9% (12/28)34.5% (10/29)46.7%
7satozaki15444.2%46.7% (28/60)46.9% (15/32)41.9% (13/31)38.7% (12/31)44.2%

ゲーム指標

ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。

5人村

チーム追放されやすさ占われやすさ占い精度投票精度狂人の人狼回避
UEC-IL0.881.120.540.950.73
kanolab0.811.171.041.220.66
Mille1.320.800.831.250.83
sUper_IL0.960.931.171.110.70
CanisLupus1.141.231.371.410.67
barneko0.920.881.101.000.79
satozaki0.990.901.051.070.62

人手評価(相対評価)

評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。

5人村

学生評価者 4 名による抽出ログ 11 ゲームの順位付け(言語処理学会 2025 概要論文 表3) 順位平均(低いほど良い)。

#チーム発話表現の自然さ文脈を踏まえた対話一貫性・論理行動整合キャラクター性総合
1UEC-IL2.672.582.122.712.082.43
2CanisLupus2.643.323.322.251.572.62
3barneko2.502.892.712.543.502.83
4kanolab2.792.432.363.393.292.85
5Mille3.252.982.832.882.522.89
6sUper_IL2.383.002.772.753.732.92
7satozaki3.362.663.342.892.823.01

LLM-as-a-Judge(相対評価)

LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。

この大会では LLM-as-a-Judge による相対評価を実施していません(2025 国際大会から実施)。

対戦ログ

本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。

トラック試合ログ
5人村210ログ一覧

ログの見方

「ログ一覧」を開くと、正常に終了したゲームのログ(.log ファイル)が一覧で表示されます。ファイル名の先頭はゲーム開始時刻、続く部分は参加チーム名です。

  • ブラウザで閲覧する: 見たいログの行にある「viewerで見る」列の「▶ 開く」を押すと、aiwolf-nlp-viewer がそのログを読み込んで開きます。
  • ファイルを保存する: 「ダウンロード」列の「⬇ 保存」を押すと、ログファイルをダウンロードできます。ファイル名をクリックした場合は、ログの本文がそのままテキストで表示されます。
  • フォルダごとまとめて保存する: 一覧の「Parent directory/」で一つ上の階層に移動し、フォルダ(success など)の行にある「⬇ zip」を押すと、そのフォルダの全ファイルをブラウザ内で zip にまとめてダウンロードできます(ファイル数の確認ダイアログが出ます)。

viewer の使い方はリンクページの「ログ閲覧ツール」にまとめています。