2025 春季国内大会
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 5人村 主観評価 1 位 | CamelliaDragons |
| 5人村 主観評価 2 位 | SunameLLi |
| 5人村 主観評価 3 位 | CanisLupus |
| 5人村 勝率 1 位 | CanisLupus |
| 5人村 勝率 2 位 | sunamelli |
| 5人村 勝率 3 位 | osawalab |
| 13人村 主観評価 1 位 | CamelliaDragons |
| 13人村 主観評価 2 位 | SunameLLi |
| 13人村 主観評価 3 位 | GAIT |
| 13人村 勝率上位 | SunameLLi |
| 13人村 勝率上位 | CamelliaDragons |
| 13人村 勝率 3 位 | kanolab |
結果発表・表彰は 2025 年度人工知能学会全国大会(2025年5月30日、大阪)の企画セッションで行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
5人村 (180 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | CanisLupus | 99 | 64.6% | 71.1% (27/38) | 63.6% (14/22) | 68.2% (15/22) | 47.1% (8/17) | 64.2% |
| 2 | sunamelli | 100 | 56.0% | 58.5% (24/41) | 50.0% (9/18) | 40.0% (8/20) | 71.4% (15/21) | 55.7% |
| 3 | osawalab | 99 | 54.5% | 67.5% (27/40) | 50.0% (11/22) | 31.2% (5/16) | 52.4% (11/21) | 53.7% |
| 4 | CamelliaDragons | 99 | 52.5% | 60.5% (26/43) | 55.6% (10/18) | 36.8% (7/19) | 47.4% (9/19) | 52.1% |
| 5 | ai168wolf | 101 | 52.5% | 68.3% (28/41) | 50.0% (10/20) | 40.0% (8/20) | 35.0% (7/20) | 52.3% |
| 6 | mille | 100 | 51.0% | 47.4% (18/38) | 68.4% (13/19) | 59.1% (13/22) | 33.3% (7/21) | 51.1% |
| 7 | kanolab | 102 | 47.1% | 56.1% (23/41) | 55.0% (11/20) | 35.0% (7/20) | 33.3% (7/21) | 47.1% |
| 8 | GPTaku | 100 | 47.0% | 46.3% (19/41) | 75.0% (15/20) | 36.8% (7/19) | 30.0% (6/20) | 46.9% |
| 9 | GAIT | 100 | 40.0% | 48.6% (18/37) | 57.1% (12/21) | 22.7% (5/22) | 25.0% (5/20) | 40.4% |
13人村 (13 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 騎士 | 霊媒師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | kanolab-a | 13 | 69.2% | 50.0% (3/6) | 100.0% (1/1) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (3/3) | 69.2% |
| 2 | CamelliaDragons | 13 | 69.2% | 83.3% (5/6) | 0.0% (0/1) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (3/3) | 69.2% |
| 3 | kanolab-b | 13 | 61.5% | 71.4% (5/7) | - | 0.0% (0/1) | 0.0% (0/2) | - | 100.0% (3/3) | 66.2% |
| 4 | SunameLLi-C | 13 | 61.5% | 33.3% (2/6) | 100.0% (1/1) | 100.0% (1/1) | 50.0% (1/2) | 100.0% (1/1) | 100.0% (2/2) | 65.4% |
| 5 | SunameLLi-B | 13 | 53.8% | 50.0% (3/6) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (3/3) | 53.8% |
| 6 | SunameLLi-A | 13 | 53.8% | 50.0% (3/6) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 66.7% (2/3) | 53.8% |
| 7 | CanisLupus-B | 13 | 38.5% | 33.3% (2/6) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 66.7% (2/3) | 38.5% |
| 8 | CanisLupus-A | 13 | 38.5% | 33.3% (2/6) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 66.7% (2/3) | 38.5% |
| 9 | GAIT | 13 | 38.5% | 20.0% (1/5) | 50.0% (1/2) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 33.3% (1/3) | 36.1% |
| 10 | mille | 13 | 38.5% | 16.7% (1/6) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 33.3% (1/3) | 38.5% |
| 11 | kanolab | 13 | 30.8% | 16.7% (1/6) | 0.0% (0/1) | 100.0% (1/1) | - | 100.0% (1/1) | 25.0% (1/4) | 31.2% |
| 12 | kanolab-c | 13 | 23.1% | 28.6% (2/7) | 0.0% (0/1) | 0.0% (0/1) | - | 100.0% (1/1) | 0.0% (0/3) | 22.6% |
| 13 | CanisLupus-C | 13 | 15.4% | 0.0% (0/5) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 0.0% (0/2) | 33.3% (1/3) | 15.4% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| CanisLupus | 0.99 | 1.03 | 1.09 | 1.34 | 0.86 |
| sunamelli | 0.65 | 1.15 | 0.70 | 1.37 | 0.75 |
| osawalab | 0.82 | 1.02 | 1.16 | 1.34 | 0.55 |
| CamelliaDragons | 0.72 | 1.07 | 1.73 | 1.63 | 0.60 |
| ai168wolf | 1.04 | 1.10 | 1.02 | 1.03 | 0.88 |
| mille | 1.00 | 0.59 | 1.63 | 1.37 | 0.55 |
| kanolab | 1.37 | 1.02 | 1.43 | 1.26 | 0.70 |
| GPTaku | 1.50 | 1.09 | 0.86 | 0.78 | 0.75 |
| GAIT | 0.95 | 0.92 | 1.76 | 1.56 | 0.46 |
13人村
| チーム | 追放されやすさ | 占われやすさ | 守られやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|---|
| kanolab-a | 0.93 | 1.26 | - | 1.91 | 0.93 | 1.00 |
| CamelliaDragons | 0.51 | 0.59 | 2.08 | 1.53 | 1.92 | 1.00 |
| kanolab-b | 0.48 | 1.32 | 0.40 | - | 1.58 | - |
| SunameLLi-C | 0.37 | 0.61 | 0.94 | 0.75 | 1.50 | 0.50 |
| SunameLLi-B | 0.58 | 0.68 | 0.40 | - | 1.11 | 0.50 |
| SunameLLi-A | 0.40 | 0.80 | 0.93 | 1.10 | 1.42 | 1.00 |
| CanisLupus-B | 1.67 | 1.97 | 0.50 | 1.91 | 0.94 | 0.50 |
| CanisLupus-A | 0.83 | 1.57 | 0.81 | 2.34 | 0.92 | 0.25 |
| GAIT | 0.58 | 1.13 | 1.92 | 0.94 | 0.94 | 0.33 |
| mille | 3.61 | 1.25 | - | 4.00 | 0.69 | 0.50 |
| kanolab | 1.85 | 1.07 | 1.55 | 1.91 | 1.00 | 1.00 |
| kanolab-c | 1.20 | 0.36 | - | 1.17 | 1.07 | 1.00 |
| CanisLupus-C | 1.26 | 0.39 | 2.16 | 1.90 | 1.33 | 0.75 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
5人村
順位平均(低いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 2.22 | 1.94 | 2.00 | 2.48 | 1.96 | 2.12 |
| 2 | Sunamelli | 2.17 | 2.42 | 2.23 | 1.87 | 2.33 | 2.20 |
| 3 | CanisLupus | 2.95 | 2.86 | 2.57 | 2.42 | 2.36 | 2.63 |
| 4 | kanolab | 2.37 | 2.72 | 2.97 | 3.02 | 3.10 | 2.84 |
| 5 | osawalab | 2.79 | 2.75 | 3.02 | 2.96 | 3.29 | 2.96 |
| 6 | GAIT | 3.61 | 3.89 | 3.53 | 3.31 | 3.33 | 3.53 |
| 7 | GPTaku | 3.06 | 3.42 | 3.83 | 4.14 | 3.61 | 3.61 |
| 8 | ai168wolf | 4.10 | 3.71 | 3.58 | 3.90 | 3.31 | 3.72 |
| 9 | mille | 4.53 | 3.94 | 4.00 | 3.47 | 4.50 | 4.09 |
13人村
順位平均(低いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | チームプレイ | 総合 |
|---|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 4.22 | 3.97 | 4.45 | 4.23 | 3.97 | 4.48 | 4.22 |
| 2 | SunameLLi-A | 5.45 | 6.57 | 6.15 | 5.60 | 5.12 | 6.25 | 5.86 |
| 3 | SunameLLi-C | 5.40 | 5.93 | 6.35 | 5.98 | 6.00 | 6.10 | 5.96 |
| 4 | GAIT | 6.48 | 6.10 | 6.68 | 6.55 | 6.85 | 6.27 | 6.49 |
| 5 | SunameLLi-B | 5.65 | 6.33 | 6.50 | 6.78 | 6.85 | 6.83 | 6.49 |
| 6 | kanolab-c | 7.35 | 6.93 | 7.18 | 6.25 | 7.27 | 7.15 | 7.02 |
| 7 | CanisLupus-B | 7.45 | 7.42 | 6.80 | 6.43 | 6.92 | 7.57 | 7.10 |
| 8 | kanolab-a | 7.38 | 6.78 | 6.43 | 8.13 | 7.90 | 7.00 | 7.27 |
| 9 | CanisLupus-C | 7.15 | 7.55 | 7.42 | 7.33 | 7.95 | 7.62 | 7.50 |
| 10 | kanolab | 7.48 | 7.55 | 8.07 | 8.08 | 6.77 | 7.45 | 7.57 |
| 11 | CanisLupus-A | 8.40 | 7.90 | 7.12 | 7.22 | 7.45 | 7.37 | 7.58 |
| 12 | kanolab-b | 7.53 | 7.73 | 7.63 | 8.37 | 7.12 | 7.43 | 7.63 |
| 13 | mille | 11.07 | 10.47 | 10.18 | 9.78 | 10.78 | 9.62 | 10.32 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
5人村
使用モデル: GPT-4o・GPT-5 の 2 モデル平均(大会の評価には含まれず、2025 国際大会と同じジャッジで大会後に実施)
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | Sunamelli | 1.70 | 1.70 | 2.30 | 1.50 | 1.60 | 1.76 |
| 2 | CamelliaDragons | 1.67 | 1.78 | 2.11 | 2.22 | 2.11 | 1.98 |
| 3 | osawalab | 1.38 | 2.12 | 3.62 | 3.12 | 2.50 | 2.55 |
| 4 | CanisLupus | 2.86 | 2.86 | 2.29 | 2.86 | 1.86 | 2.55 |
| 5 | GAIT | 3.50 | 3.50 | 2.33 | 3.50 | 3.33 | 3.23 |
| 6 | kanolab | 3.50 | 3.00 | 3.50 | 3.00 | 3.30 | 3.26 |
| 7 | GPTaku | 3.06 | 3.42 | 3.83 | 4.14 | 3.61 | 3.61 |
| 8 | mille | 4.33 | 3.94 | 2.17 | 4.00 | 4.83 | 3.85 |
| 9 | ai168wolf | 4.62 | 4.50 | 4.25 | 3.50 | 4.12 | 4.20 |
13人村
使用モデル: GPT-4o・GPT-5 の 2 モデル平均(大会の評価には含まれず、2025 国際大会と同じジャッジで大会後に実施)
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | チームプレイ | 総合 |
|---|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 3.90 | 3.10 | 4.80 | 5.40 | 3.10 | 3.90 | 4.03 |
| 2 | SunameLLi-A | 3.00 | 4.80 | 5.70 | 4.70 | 5.10 | 4.10 | 4.57 |
| 3 | SunameLLi-B | 2.60 | 5.50 | 5.90 | 5.40 | 4.90 | 5.20 | 4.92 |
| 4 | SunameLLi-C | 3.70 | 4.10 | 6.30 | 6.70 | 5.30 | 4.90 | 5.17 |
| 5 | CanisLupus-B | 7.70 | 6.90 | 4.90 | 6.30 | 4.70 | 7.90 | 6.40 |
| 6 | GAIT | 7.10 | 6.90 | 6.00 | 5.90 | 7.50 | 6.70 | 6.68 |
| 7 | CanisLupus-A | 8.10 | 6.60 | 5.50 | 5.80 | 7.60 | 7.50 | 6.85 |
| 8 | CanisLupus-C | 8.30 | 7.00 | 5.10 | 7.50 | 7.20 | 8.10 | 7.20 |
| 9 | kanolab-c | 8.90 | 8.20 | 8.30 | 6.90 | 7.90 | 7.70 | 7.98 |
| 10 | kanolab-a | 8.20 | 7.80 | 8.90 | 9.00 | 8.00 | 7.50 | 8.23 |
| 11 | kanolab-b | 8.40 | 8.70 | 8.60 | 8.20 | 8.80 | 7.40 | 8.35 |
| 12 | kanolab | 8.60 | 9.40 | 10.60 | 8.60 | 8.40 | 10.10 | 9.28 |
| 13 | mille | 12.50 | 12.00 | 10.40 | 10.60 | 12.50 | 10.00 | 11.33 |
この大会では LLM 相対評価は大会の評価には含まれておらず、2025 国際大会と同じジャッジで大会後に実施した参考値です。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 5人村 | 180 | ログ一覧 |
| 13人村 | 13 | ログ一覧 |
公式結果(表彰)
| 賞 | チーム |
|---|---|
| 5人村 主観評価 1 位 | CamelliaDragons |
| 5人村 主観評価 2 位 | SunameLLi |
| 5人村 主観評価 3 位 | CanisLupus |
| 5人村 勝率 1 位 | CanisLupus |
| 5人村 勝率 2 位 | sunamelli |
| 5人村 勝率 3 位 | osawalab |
| 13人村 主観評価 1 位 | CamelliaDragons |
| 13人村 主観評価 2 位 | SunameLLi |
| 13人村 主観評価 3 位 | GAIT |
| 13人村 勝率上位 | SunameLLi |
| 13人村 勝率上位 | CamelliaDragons |
| 13人村 勝率 3 位 | kanolab |
結果発表・表彰は 2025 年度人工知能学会全国大会(2025年5月30日、大阪)の企画セッションで行いました。
勝率
本戦で正常に終了した全ゲームのログから集計しています。「総合」は勝ち数 ÷ 試合数、役職別の欄はその役職で戦ったときの勝率と(勝ち数 / 試合数)です。「構成加重」は役職別勝率を村の役職構成で平均し直した値で、配役の偏りを打ち消した勝率です。
5人村 (180 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|
| 1 | CanisLupus | 99 | 64.6% | 71.1% (27/38) | 63.6% (14/22) | 68.2% (15/22) | 47.1% (8/17) | 64.2% |
| 2 | sunamelli | 100 | 56.0% | 58.5% (24/41) | 50.0% (9/18) | 40.0% (8/20) | 71.4% (15/21) | 55.7% |
| 3 | osawalab | 99 | 54.5% | 67.5% (27/40) | 50.0% (11/22) | 31.2% (5/16) | 52.4% (11/21) | 53.7% |
| 4 | CamelliaDragons | 99 | 52.5% | 60.5% (26/43) | 55.6% (10/18) | 36.8% (7/19) | 47.4% (9/19) | 52.1% |
| 5 | ai168wolf | 101 | 52.5% | 68.3% (28/41) | 50.0% (10/20) | 40.0% (8/20) | 35.0% (7/20) | 52.3% |
| 6 | mille | 100 | 51.0% | 47.4% (18/38) | 68.4% (13/19) | 59.1% (13/22) | 33.3% (7/21) | 51.1% |
| 7 | kanolab | 102 | 47.1% | 56.1% (23/41) | 55.0% (11/20) | 35.0% (7/20) | 33.3% (7/21) | 47.1% |
| 8 | GPTaku | 100 | 47.0% | 46.3% (19/41) | 75.0% (15/20) | 36.8% (7/19) | 30.0% (6/20) | 46.9% |
| 9 | GAIT | 100 | 40.0% | 48.6% (18/37) | 57.1% (12/21) | 22.7% (5/22) | 25.0% (5/20) | 40.4% |
13人村 (13 試合)
| # | チーム | 試合 | 総合 | 村人 | 占い師 | 騎士 | 霊媒師 | 狂人 | 人狼 | 構成加重 |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | kanolab-a | 13 | 69.2% | 50.0% (3/6) | 100.0% (1/1) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (3/3) | 69.2% |
| 2 | CamelliaDragons | 13 | 69.2% | 83.3% (5/6) | 0.0% (0/1) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (3/3) | 69.2% |
| 3 | kanolab-b | 13 | 61.5% | 71.4% (5/7) | - | 0.0% (0/1) | 0.0% (0/2) | - | 100.0% (3/3) | 66.2% |
| 4 | SunameLLi-C | 13 | 61.5% | 33.3% (2/6) | 100.0% (1/1) | 100.0% (1/1) | 50.0% (1/2) | 100.0% (1/1) | 100.0% (2/2) | 65.4% |
| 5 | SunameLLi-B | 13 | 53.8% | 50.0% (3/6) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (3/3) | 53.8% |
| 6 | SunameLLi-A | 13 | 53.8% | 50.0% (3/6) | 0.0% (0/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 66.7% (2/3) | 53.8% |
| 7 | CanisLupus-B | 13 | 38.5% | 33.3% (2/6) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 66.7% (2/3) | 38.5% |
| 8 | CanisLupus-A | 13 | 38.5% | 33.3% (2/6) | 0.0% (0/1) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 66.7% (2/3) | 38.5% |
| 9 | GAIT | 13 | 38.5% | 20.0% (1/5) | 50.0% (1/2) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 33.3% (1/3) | 36.1% |
| 10 | mille | 13 | 38.5% | 16.7% (1/6) | 100.0% (1/1) | 0.0% (0/1) | 100.0% (1/1) | 100.0% (1/1) | 33.3% (1/3) | 38.5% |
| 11 | kanolab | 13 | 30.8% | 16.7% (1/6) | 0.0% (0/1) | 100.0% (1/1) | - | 100.0% (1/1) | 25.0% (1/4) | 31.2% |
| 12 | kanolab-c | 13 | 23.1% | 28.6% (2/7) | 0.0% (0/1) | 0.0% (0/1) | - | 100.0% (1/1) | 0.0% (0/3) | 22.6% |
| 13 | CanisLupus-C | 13 | 15.4% | 0.0% (0/5) | 100.0% (1/1) | 0.0% (0/1) | 0.0% (0/1) | 0.0% (0/2) | 33.3% (1/3) | 15.4% |
ゲーム指標
ゲームログから機械的に計算した振る舞いの指標で、対話品質とは独立です。各値はランダムに行動した場合との比(1.00 = ランダム)です。「追放されやすさ」「占われやすさ」「守られやすさ」は他のプレイヤーから狙われた頻度の比で、追放・占いは低いほど疑われにくかったことを示します。「占い精度」「投票精度」は人狼を当てた頻度の比で、高いほど良い値です。「狂人の人狼回避」は狂人のときに人狼以外へ投票した割合です。
5人村
| チーム | 追放されやすさ | 占われやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|
| CanisLupus | 0.99 | 1.03 | 1.09 | 1.34 | 0.86 |
| sunamelli | 0.65 | 1.15 | 0.70 | 1.37 | 0.75 |
| osawalab | 0.82 | 1.02 | 1.16 | 1.34 | 0.55 |
| CamelliaDragons | 0.72 | 1.07 | 1.73 | 1.63 | 0.60 |
| ai168wolf | 1.04 | 1.10 | 1.02 | 1.03 | 0.88 |
| mille | 1.00 | 0.59 | 1.63 | 1.37 | 0.55 |
| kanolab | 1.37 | 1.02 | 1.43 | 1.26 | 0.70 |
| GPTaku | 1.50 | 1.09 | 0.86 | 0.78 | 0.75 |
| GAIT | 0.95 | 0.92 | 1.76 | 1.56 | 0.46 |
13人村
| チーム | 追放されやすさ | 占われやすさ | 守られやすさ | 占い精度 | 投票精度 | 狂人の人狼回避 |
|---|---|---|---|---|---|---|
| kanolab-a | 0.93 | 1.26 | - | 1.91 | 0.93 | 1.00 |
| CamelliaDragons | 0.51 | 0.59 | 2.08 | 1.53 | 1.92 | 1.00 |
| kanolab-b | 0.48 | 1.32 | 0.40 | - | 1.58 | - |
| SunameLLi-C | 0.37 | 0.61 | 0.94 | 0.75 | 1.50 | 0.50 |
| SunameLLi-B | 0.58 | 0.68 | 0.40 | - | 1.11 | 0.50 |
| SunameLLi-A | 0.40 | 0.80 | 0.93 | 1.10 | 1.42 | 1.00 |
| CanisLupus-B | 1.67 | 1.97 | 0.50 | 1.91 | 0.94 | 0.50 |
| CanisLupus-A | 0.83 | 1.57 | 0.81 | 2.34 | 0.92 | 0.25 |
| GAIT | 0.58 | 1.13 | 1.92 | 0.94 | 0.94 | 0.33 |
| mille | 3.61 | 1.25 | - | 4.00 | 0.69 | 0.50 |
| kanolab | 1.85 | 1.07 | 1.55 | 1.91 | 1.00 | 1.00 |
| kanolab-c | 1.20 | 0.36 | - | 1.17 | 1.07 | 1.00 |
| CanisLupus-C | 1.26 | 0.39 | 2.16 | 1.90 | 1.33 | 0.75 |
人手評価(相対評価)
評価者が抽出した対戦ログを読み、ゲームごとにプレイヤーを評価項目別に評価した結果をチームごとに平均したものです。2024 冬季以降は順位付け(順位平均、低いほど良い)、2024 春季と 2024 国際大会は 5 点満点の評点(高いほど良い)です。13 人村ではエントリ(チーム-A、チーム-B など)ごとに評価しています。
5人村
順位平均(低いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 2.22 | 1.94 | 2.00 | 2.48 | 1.96 | 2.12 |
| 2 | Sunamelli | 2.17 | 2.42 | 2.23 | 1.87 | 2.33 | 2.20 |
| 3 | CanisLupus | 2.95 | 2.86 | 2.57 | 2.42 | 2.36 | 2.63 |
| 4 | kanolab | 2.37 | 2.72 | 2.97 | 3.02 | 3.10 | 2.84 |
| 5 | osawalab | 2.79 | 2.75 | 3.02 | 2.96 | 3.29 | 2.96 |
| 6 | GAIT | 3.61 | 3.89 | 3.53 | 3.31 | 3.33 | 3.53 |
| 7 | GPTaku | 3.06 | 3.42 | 3.83 | 4.14 | 3.61 | 3.61 |
| 8 | ai168wolf | 4.10 | 3.71 | 3.58 | 3.90 | 3.31 | 3.72 |
| 9 | mille | 4.53 | 3.94 | 4.00 | 3.47 | 4.50 | 4.09 |
13人村
順位平均(低いほど良い)。
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | チームプレイ | 総合 |
|---|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 4.22 | 3.97 | 4.45 | 4.23 | 3.97 | 4.48 | 4.22 |
| 2 | SunameLLi-A | 5.45 | 6.57 | 6.15 | 5.60 | 5.12 | 6.25 | 5.86 |
| 3 | SunameLLi-C | 5.40 | 5.93 | 6.35 | 5.98 | 6.00 | 6.10 | 5.96 |
| 4 | GAIT | 6.48 | 6.10 | 6.68 | 6.55 | 6.85 | 6.27 | 6.49 |
| 5 | SunameLLi-B | 5.65 | 6.33 | 6.50 | 6.78 | 6.85 | 6.83 | 6.49 |
| 6 | kanolab-c | 7.35 | 6.93 | 7.18 | 6.25 | 7.27 | 7.15 | 7.02 |
| 7 | CanisLupus-B | 7.45 | 7.42 | 6.80 | 6.43 | 6.92 | 7.57 | 7.10 |
| 8 | kanolab-a | 7.38 | 6.78 | 6.43 | 8.13 | 7.90 | 7.00 | 7.27 |
| 9 | CanisLupus-C | 7.15 | 7.55 | 7.42 | 7.33 | 7.95 | 7.62 | 7.50 |
| 10 | kanolab | 7.48 | 7.55 | 8.07 | 8.08 | 6.77 | 7.45 | 7.57 |
| 11 | CanisLupus-A | 8.40 | 7.90 | 7.12 | 7.22 | 7.45 | 7.37 | 7.58 |
| 12 | kanolab-b | 7.53 | 7.73 | 7.63 | 8.37 | 7.12 | 7.43 | 7.63 |
| 13 | mille | 11.07 | 10.47 | 10.18 | 9.78 | 10.78 | 9.62 | 10.32 |
LLM-as-a-Judge(相対評価)
LLM ジャッジがゲームごとにプレイヤーを評価項目別に順位付けし、チームごとに平均したものです(低いほど良い)。使用したモデルは大会ごとに異なり、各トラックの表の上に記載しています。ジャッジの実装は aiwolf-nlp-llm-judge として公開しています。
5人村
使用モデル: GPT-4o・GPT-5 の 2 モデル平均(大会の評価には含まれず、2025 国際大会と同じジャッジで大会後に実施)
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | 総合 |
|---|---|---|---|---|---|---|---|
| 1 | Sunamelli | 1.70 | 1.70 | 2.30 | 1.50 | 1.60 | 1.76 |
| 2 | CamelliaDragons | 1.67 | 1.78 | 2.11 | 2.22 | 2.11 | 1.98 |
| 3 | osawalab | 1.38 | 2.12 | 3.62 | 3.12 | 2.50 | 2.55 |
| 4 | CanisLupus | 2.86 | 2.86 | 2.29 | 2.86 | 1.86 | 2.55 |
| 5 | GAIT | 3.50 | 3.50 | 2.33 | 3.50 | 3.33 | 3.23 |
| 6 | kanolab | 3.50 | 3.00 | 3.50 | 3.00 | 3.30 | 3.26 |
| 7 | GPTaku | 3.06 | 3.42 | 3.83 | 4.14 | 3.61 | 3.61 |
| 8 | mille | 4.33 | 3.94 | 2.17 | 4.00 | 4.83 | 3.85 |
| 9 | ai168wolf | 4.62 | 4.50 | 4.25 | 3.50 | 4.12 | 4.20 |
13人村
使用モデル: GPT-4o・GPT-5 の 2 モデル平均(大会の評価には含まれず、2025 国際大会と同じジャッジで大会後に実施)
| # | チーム | 発話表現の自然さ | 文脈を踏まえた対話 | 一貫性・論理 | 行動整合 | キャラクター性 | チームプレイ | 総合 |
|---|---|---|---|---|---|---|---|---|
| 1 | CamelliaDragons | 3.90 | 3.10 | 4.80 | 5.40 | 3.10 | 3.90 | 4.03 |
| 2 | SunameLLi-A | 3.00 | 4.80 | 5.70 | 4.70 | 5.10 | 4.10 | 4.57 |
| 3 | SunameLLi-B | 2.60 | 5.50 | 5.90 | 5.40 | 4.90 | 5.20 | 4.92 |
| 4 | SunameLLi-C | 3.70 | 4.10 | 6.30 | 6.70 | 5.30 | 4.90 | 5.17 |
| 5 | CanisLupus-B | 7.70 | 6.90 | 4.90 | 6.30 | 4.70 | 7.90 | 6.40 |
| 6 | GAIT | 7.10 | 6.90 | 6.00 | 5.90 | 7.50 | 6.70 | 6.68 |
| 7 | CanisLupus-A | 8.10 | 6.60 | 5.50 | 5.80 | 7.60 | 7.50 | 6.85 |
| 8 | CanisLupus-C | 8.30 | 7.00 | 5.10 | 7.50 | 7.20 | 8.10 | 7.20 |
| 9 | kanolab-c | 8.90 | 8.20 | 8.30 | 6.90 | 7.90 | 7.70 | 7.98 |
| 10 | kanolab-a | 8.20 | 7.80 | 8.90 | 9.00 | 8.00 | 7.50 | 8.23 |
| 11 | kanolab-b | 8.40 | 8.70 | 8.60 | 8.20 | 8.80 | 7.40 | 8.35 |
| 12 | kanolab | 8.60 | 9.40 | 10.60 | 8.60 | 8.40 | 10.10 | 9.28 |
| 13 | mille | 12.50 | 12.00 | 10.40 | 10.60 | 12.50 | 10.00 | 11.33 |
この大会では LLM 相対評価は大会の評価には含まれておらず、2025 国際大会と同じジャッジで大会後に実施した参考値です。
対戦ログ
本戦の対戦ログを公開しています。正常に終了したゲームのみを掲載しています。
| トラック | 試合 | ログ |
|---|---|---|
| 5人村 | 180 | ログ一覧 |
| 13人村 | 13 | ログ一覧 |
ログの見方
「ログ一覧」を開くと、正常に終了したゲームのログ(.log ファイル)が一覧で表示されます。ファイル名の先頭はゲーム開始時刻、続く部分は参加チーム名です。
- ブラウザで閲覧する: 見たいログの行にある「viewerで見る」列の「▶ 開く」を押すと、aiwolf-nlp-viewer がそのログを読み込んで開きます。
- ファイルを保存する: 「ダウンロード」列の「⬇ 保存」を押すと、ログファイルをダウンロードできます。ファイル名をクリックした場合は、ログの本文がそのままテキストで表示されます。
- フォルダごとまとめて保存する: 一覧の「Parent directory/」で一つ上の階層に移動し、フォルダ(
successなど)の行にある「⬇ zip」を押すと、そのフォルダの全ファイルをブラウザ内で zip にまとめてダウンロードできます(ファイル数の確認ダイアログが出ます)。
viewer の使い方はリンクページの「ログ閲覧ツール」にまとめています。