1. 「AIに聞けば正確」という前提の誤り
汎用の大規模言語モデル(LLM)にポーカーのハンドを説明させ、アドバイスを求める使い方は すでに珍しくない。しかし、汎用LLMは次の単語を予測するように訓練された言語モデル であり、ソルバー(PioSolver・GTO Wizard等)のようにゲーム木を数値的に探索して 均衡を計算する専用アルゴリズムとは、根本的に異なる仕組みで動いている。 この違いを見落とすと、「もっともらしい日本語で説明してくれる」ことと 「戦術的に正しい」ことを混同してしまう。
2. 実例 — ChatGPTが起こした具体的な誤り
統計学者Nate Silver氏が2025年に実施した検証では、ChatGPTに実際のポーカーハンド進行を 逐次説明させ意思決定させた結果、複数のカテゴリで明確な誤りが確認されている。 具体的には、A♦2♣で複数人の強いベットに対しコールする——「史上最も-EVなプレイの一つ」——という プリフロップ判断ミス、ボード Q♠Q♦4♣4♥5♠ でポケット99を持つプレイヤーが実際には Q-Q-9-9の上位ツーペアで勝っているにもかかわらずQ-Q-4-4同士の2人にポットを分配する 勝者誤判定、スタック管理の継続的な失敗(未来のアクションを先取りしてチップを減算する等)、 フラッシュドローが外れた際に不釣り合いに大きい額でブラフする頻度の偏りが確認されている (出典: Nate Silver氏の検証記事(natesilver.net))。 これらは単発の言い間違いではなく、「もっともらしい説明文を生成する能力」と 「盤面状態を正確に追跡し数値的に正しい判断を下す能力」が別物であることを 具体的に示す事例群である。
3. 根本原因としての「学習データの偏り」
この種の誤りが起きやすい根本的な理由は、モデルの訓練に使われた文章データの性質にある。 インターネット上に存在するポーカー戦術に関する文章の大半は、ソルバー出力そのものではなく、 体験談・ブログ・フォーラムの議論・「大胆なブラフが決まった」という劇的な語り口の 記事である。LLMはこうしたテキストの統計的なパターンを学習するため、 「よく語られる戦術論」と「頻度・比率まで厳密に正しいGTO戦術」が異なる場合、 前者に引きずられやすい。加えて、LLMは元々数値の大小比較そのものを取り違える 既知の弱点を持つことが複数の研究で報告されており、ポーカーが要求する 「厳密な数値比較の連続」という作業形式そのものとも相性が悪い。
誠実性の注記: 「学習データが偏っているから汎用LLMは弱い」という説明は 根本原因の一つとして妥当だが、唯一の原因ではない。ソルバー出力で個別に訓練された 専用モデル(研究段階のものを含む)はハンド評価の一致率を大きく改善させる報告もあり、 「LLMという技術そのものがポーカーに不向き」ではなく「汎用の訓練データのままではポーカーに 不向き」という、データの質に起因する問題として捉えるのがより正確である (※編集部の評価)。
4. AIの戦術発言をどう検証するか
- 単発の主張を鵜呑みにしない: 「AIがこう言っていた」という戦術論は、 ソルバー出力・公式ベンチマーク等の一次資料と突き合わせるまでは仮説として扱う。
- 信頼度を段階づけて扱う: 断定・推測・未確認を分けて評価する姿勢 (確認済み/推測/未確認、という三段階の格付け)は、AI主張の検証手法として そのままポーカー戦術の検証にも転用できる。
- 複雑なタスクほど誤りが積み重なる: 単純なハンド評価は比較的正確でも、 複数ストリート・複数プレイヤーの状態を同時に追跡するタスクでは誤りが複合的に増える傾向が 報告されている。AIに聞くなら、タスクを単純な質問に分解する方が精度が上がりやすい。
本コラムは数理解説であり、トーナメント会場でのデバイス・ツール利用を推奨するものではありません。
出典
Nate Silver — "ChatGPT is shockingly bad at poker" (2025-05-21):
https://www.natesilver.net/p/chatgpt-is-shockingly-bad-at-poker