Thinking設定を使うべきか?正解付き3問で比較する方法
旧GPT-5 Thinkingの固定ガイドを訂正し、現在のChatGPTで推論設定を正解付き課題により比較する手順を示します。
読了目安:2分

この記事が初回公開された2025年にはGPT-5 Thinkingという名称が使われていましたが、OpenAIの退役案内では2026年2月にChatGPTから退役しています。現在の画面にあるThinkingや推論時間の設定を評価する場合、旧モデル名ではなく実測で判断します。
比較条件を固定する
同じ新規チャット、同じ入力、同じ添付、同じツール条件で通常設定と推論設定を試します。会話履歴やメモリの影響を混ぜません。
設定:
開始・終了時刻:
正解数:
制約違反:
確認不能な主張:
再実行で変わった点:
課題1:情報抽出
10行程度の自作文章を用意し、「日付、担当、期限だけを抽出し、原文にない項目は追加しない」と依頼します。正解表と完全一致するか確認します。
単純抽出で差がないなら、長い推論を常用する理由は弱くなります。
課題2:制約付き計画
予算、期限、使用禁止の手段を明示した小さな計画を依頼します。達成案の魅力より、全制約を守ったかを採点します。
予算5,000円、30分以内、外部アカウント作成なしで、
資料の誤字を確認する手順を作ってください。
前提が不足する場合は推測せず質問してください。
課題3:小さなバグ修正
原因が既知の短いコードとテストを用意します。提案だけでなく、テストが通るか、無関係な変更がないかを確認します。実行できない場合は、その制約を明示できるかも採点します。
判断基準
- 正解数またはテスト合格が増えたか
- 禁止事項や形式制約への違反が減ったか
- 根拠のない断定が減ったか
- 増えた時間に見合う差か
OpenAIは、モデルの回答に誤りや存在しない引用が含まれ得ると説明しています。推論設定でも重要な事実は一次情報へ戻ります。
結論
Thinkingという名称だけで「賢い」「常に正確」と判断しません。抽出、制約付き計画、バグ修正を同じ条件で比較し、正確性、違反、時間を記録します。現在の設定名はModel Release Notesと自分の画面で確認してください。
確認した一次情報
主要な主張については、本文中にも対応する資料へのリンクを残しています。
- Retiring GPT-4o and other ChatGPT modelsOpenAI Help Center · official-help · 確認: 2026-07-26
- Does ChatGPT tell the truth?OpenAI Help Center · official-help · 確認: 2026-07-26
- Model Release NotesOpenAI Help Center · official-release-note · 確認: 2026-07-26