プロンプトを2回繰り返す研究結果:効く条件と効かない読み方
2025年の論文が示したプロンプト反復の結果を、非推論設定・評価対象・統計基準・長文時の例外まで含めて読み直します。
読了目安:2分

「同じ質問を2回書けば、どのAIでも正答率が上がる」とは言えません。2025年12月公開の論文Prompt Repetition Improves Non-Reasoning LLMsは、特定のモデル、ベンチマーク、プロンプト形式を使い、主にモデルへ推論を促さない設定で比較した研究です。
何を比較した研究か
入力<QUERY>を<QUERY><QUERY>へ変え、7モデルと7ベンチマークを複数の配置で評価しています。モデルにはGemini 2.0 Flash系、GPT-4o系、Claude 3系、DeepSeek V3が含まれ、実験API呼び出しは2025年2〜3月に行われました。
| 条件 | 論文の結果 | 読み方 |
|---|---|---|
| 推論を促さない | 70のモデル・ベンチマーク組で47勝、0敗 | 残りは統計上の勝敗が付かない。全出力が改善した意味ではない |
| 段階的思考を促す | 28組で5勝、1敗、22中立 | 推論設定では効果が小さく、常に有利ではない |
| 長い入力 | 一部Claude条件で遅延増加 | 入力が2倍になるコストとコンテキスト上限を無視できない |
ここでの「勝敗」は論文が採用したMcNemar検定と有意水準に基づきます。47種類の実生活課題で成功を保証した、という数字ではありません。
なぜ改善する可能性があるのか
論文は、因果言語モデルでは前のトークンが後のトークンを参照できても逆方向には参照できない点に着目しています。クエリ全体を繰り返すと、2回目の各部分は1回目の全体を前方文脈として持てます。これは提案された説明であり、個別回答が正しくなることを保証する検査ではありません。
試すなら同じ問題で比較する
- 正解を判定できる自分の課題を20件以上用意する。
- モデル、設定、温度、出力形式を固定する。
- 通常入力と2回反復を同じ課題で比較する。
- 正答率だけでなく、入力トークン、遅延、形式違反も記録する。
- 効果がなければ採用しない。
本番処理へ入れる前に、機密情報を重複送信する影響や入力上限も確認します。
向かない場面
- すでに長く、コンテキスト上限へ近い入力
- 正解を評価できず、改善したか判断できない創作
- 推論モデルが質問を十分に読み直す設定
- 二重入力が外部ツールの二重実行と誤解される設計
結論
プロンプト反復は、論文で有望だった限定的な入力変換です。万能な精度向上法ではありません。対象モデルと課題を固定した評価で、品質、コスト、遅延を比較してから採用してください。
確認した一次情報
主要な主張については、本文中にも対応する資料へのリンクを残しています。
- Prompt Repetition Improves Non-Reasoning LLMsarXiv · research-paper · 確認: 2026-07-26