Claude Opus 5徹底レビューOpus 4.8・Fable 5・GPT-5.6 Solと比較して分かった本当の進化

2026年7月24日公開のClaude Opus 5を、公式System Cardのベンチマーク、Opus 4.8・Fable 5・GPT-5.6 Solとの比較、料金、初期口コミ、実務での使い勝手、安全性まで徹底検証。

複数のコード・文書・科学・画面操作を統合して扱うClaude Opus 5を表現した抽象ビジュアル
テクノロジー
公開日: 2026年7月25日
読了時間: 16
著者: ぽちょ研究所
読了時間: 16

結論:Opus 5は「安いFable」ではなく、日常実務の新しい主力である

2026年7月24日、AnthropicはClaude Opus 5を公開した。日本では7月25日から使えるようになった新モデルで、Claudeの全有料プラン、Claude Code、Claude APIに展開されている。API価格は入力100万トークンあたり5ドル、出力25ドル。前世代のOpus 4.8から据え置きで、Fable 5のちょうど半額である。

先に結論を言うと、Opus 5は単なる「Opus 4.8の小幅更新」ではない。実コード修正、PC操作、業務自動化、長期の知識労働、未知の問題を解く力が大きく伸びた。Anthropicの公式System Cardでは、Opus 4.8と比較してFrontierBenchが21.1%から43.3%、SWE-bench Multimodalが38.4%から59.4%、AutomationBenchが17.0%から26.0%、ARC-AGI-3が1.5%から30.2%へ上がっている。値札は同じでも、任せられる仕事の幅は明らかに違う。

さらに意外なのは、Fable 5との関係である。SWE-bench Pro、DeepSWE、医療評価などではFable 5がまだ上だが、FrontierBench、OSWorld 2.0、GDPval-AA、AA-Briefcase、AutomationBenchではOpus 5が上回る。したがって「Opus 5はFable 5まで届かないのか」という問いへの答えは、最高難度の一部では届かないが、日常のエージェント業務ではすでに超えている、となる。

GPT-5.6 Solに対しても一方的な優劣ではない。Opus 5はFrontierBench、FrontierCode、OSWorld 2.0、GDPval-AA、AA-Briefcase、ARC-AGI-3で優位だが、SolはDeepSWEとARC-AGI-2で上回る。モデルの強さが一つの総合点に収束する時代ではなく、「どの種類の仕事を、どのハーネスと推論量で解かせるか」が勝敗を決める時代になった。

何が変わったのか:価格は据え置き、思考は標準でオン

Opus 5のAPI IDは claude-opus-5。コンテキストウィンドウは標準で100万トークン、最大出力は12.8万トークン、信頼できる知識カットオフと学習データのカットオフはともに2026年5月である。Claude APIだけでなく、Amazon Bedrock、Google Cloud、Microsoft Foundryでも利用できる。

項目Claude Opus 5Claude Opus 4.8Claude Fable 5GPT-5.6 Sol
入力価格 / 100万token$5$5$10$5
出力価格 / 100万token$25$25$50$30
コンテキスト1M1M1M1.05M
最大出力128k128k128k128k
主な位置づけ複雑なコーディング・企業実務従来のOpus主力最高難度の長期エージェント汎用フロンティア・Codex
標準の推論Adaptive thinkingオン明示設定が必要常時オンReasoning設定

最も重要なAPI上の変更は、Adaptive thinkingが標準で有効になったことだ。Opus 4.8では thinking: {"type": "adaptive"} を明示しない限り思考なしで動いていたが、Opus 5は各ターンで「考えるべきか、どこまで考えるか」を自動判断する。effortlowmediumhighxhighmax の5段階で、Claude APIとClaude Codeの既定値は high である。

ほかにも、会話中にツールを追加・削除してもプロンプトキャッシュを維持できるベータ機能、推奨フォールバックをAnthropic側に任せる fallbacks: "default"、キャッシュ可能な最小プロンプト長の1,024から512トークンへの短縮が入った。Claude API限定のFast modeは約2.5倍の速度と引き換えに、料金も入力10ドル・出力50ドルへ倍増する。

ベンチマーク総覧:Opus 4.8からどこまで精度が上がったのか

以下は、AnthropicのClaude Opus 5 System Cardに掲載された同一表の主要値である。原則としてOpus 5はAdaptive thinking・max effort・5試行平均。太字は4モデル中の首位を示す。

評価Opus 5Opus 4.8Fable 5GPT-5.6 Sol
SWE-bench Pro79.269.280.064.6
SWE-bench Multilingual89.584.486.6非掲載
SWE-bench Multimodal59.438.454.1非掲載
DeepSWE v1.168.859.069.772.7
FrontierCode 1.1 Main53.446.553.547.5
FrontierBench v0.143.321.133.834.4
BrowseComp90.884.387.490.4
HLE with tools64.757.963.9非掲載
OSWorld 2.070.655.766.162.6
GDPval-AA v2(Elo)1861159317471736
AA-Briefcase(Elo)1720134615741505
AutomationBench26.017.017.418.1
ARC-AGI-290.472.1非掲載92.5
ARC-AGI-330.21.5非掲載7.8

数字の読み方で重要なのは、平均的に数ポイント上がっただけではないことだ。FrontierBenchは実際のソフトウェア課題を最後まで解くエージェント評価で、Opus 4.8の約2.05倍。SWE-bench Multimodalはスクリーンショットやデザイン仕様を含むコード修正で、21ポイント上昇した。AutomationBenchはCRM、Slack、Google Workspaceなどをまたぐ業務フローの完遂率で、相対的に約53%改善している。

ARC-AGI-3は特に劇的だ。ルールも目的も説明されない新しいゲーム環境を探索し、人間基準の行動効率で解く評価で、Opus 4.8の1.52%に対しOpus 5は30.16%。GPT-5.6 Solの7.78%に対しても約3.9倍である。ただし、ARC-AGI-3は新しく半非公開の評価であり、Opus 5はhigh、Solはmax、Opus 4.8もhighと設定がそろっていない。驚くべき差ではあるが、これだけで「一般知能が4倍」と言うのは誤りである。

Opus 4.8との実務差:生成よりも「検証して完了する力」が伸びた

Opus 5の改善は、きれいな文章やコードを一発で出す能力より、作業中に自分の不足へ気づき、道具を作り、検証してから終える能力に表れている。

Anthropicが紹介したFrontierBenchの例では、モデルは機械部品の画像からFreeCADモデルを再構築するよう求められたが、画像を直接見る手段を与えられていなかった。Opus 5はそこで止まらず、生のピクセルから形状を抽出するコンピュータビジョン処理を自作し、部品を再構築した。同じ条件の他モデルは5回試しても成功しなかったという。

別の事例では、実在するパッケージマネージャーのバグに対して、コミュニティの修正が見落としていた境界条件まで直した。市場データフィードの開発では、検証用のライブフィードがないと分かると、自分でテストハーネスを作ってパーサーを確かめた。重要なのは知識量ではなく、「証拠がないなら検証手段を作る」行動が増えたことである。

第三者の早期評価も似た傾向を報告している。BoxではOpus 4.8比で総合8%、データ分析11%、デューデリジェンス17%の改善。ある金融モデリング評価では平均9ポイント高く、ツール呼び出しとターン数は3分の1減り、所要時間は60%短縮した。Legal Agent Benchmarkの利用者は、Opus 4.8のmaxと同等の品質を平均26%少ないトークンで出せたとしている。ただし、これらはAnthropicの発表ページに掲載された顧客評価であり、完全に独立した再現試験ではない。

Fable 5までは行かないのか:もう超えた領域と、まだ届かない領域

「Fable 5があるのにOpus 5を出す意味は何か」と感じるのは自然である。Fable 5は入力10ドル・出力50ドルで、Anthropicが現在も「一般公開した中で最も高能力」と位置づけるMythos-classモデルだ。しかし実測表では、Opus 5がFable 5に勝つ項目の方が多い。

Opus 5が上Fable 5が上ほぼ同等
FrontierBench 43.3 vs 33.8SWE-bench Pro 79.2 vs 80.0FrontierCode 53.4 vs 53.5
OSWorld 70.6 vs 66.1DeepSWE 68.8 vs 69.7HLE no tools 56.3 vs 56.5
GDPval-AA 1861 vs 1747HealthBench Professional 59.8 vs 66.0Toolathlon Pass@1 80.6 vs Mythos 79.3
AA-Briefcase 1720 vs 1574生物・サイバーの最高難度CursorBenchは最大0.5ポイント差
AutomationBench 26.0 vs 17.4最高難度の長期・曖昧な推論SWE-bench Proは0.8ポイント差

日常のPC操作、企業成果物、業務自動化、一般的なエージェント型コーディングでは、Opus 5はFable 5を半額で超えるか、ほぼ同等に達した。Anthropic自身も、OSWorld 2.0ではFable 5の最高結果を約3分の1強の費用で上回り、CursorBench 3.2ではmax effortでFable 5のピークから0.5ポイント以内と説明している。

それでもFable 5が不要になったわけではない。SWE-bench Proではわずかに首位を守り、DeepSWEや医療評価でも上である。初期の利用者からは、Fable 5の方が曖昧な原因調査で早合点が少なく、長い推論の筋を保ちやすいという報告もある。Anthropicの公式な使い分けも、普段の複雑なコーディングと企業業務はOpus 5、最高能力が必要なワークロードはFable 5のままだ。

したがって実務上は、Opus 5を標準にして、問題の定義そのものが難しい調査、失敗費用が極端に高い長期タスク、専門的な医療・科学推論だけFable 5へ上げるのが合理的である。従来の「Opus 4.8を日常、Fable 5を難所」という境界は、かなりFable側へ押し込まれた。

GPT-5.6 Solとの比較:Claudeが強い仕事、Codexが強い仕事

GPT-5.6 Solは、Opus 5と同じ入力5ドル、出力は30ドルで、1.05Mコンテキストを持つ。価格帯はほぼ同じだが、公式の同一表では強みが分かれる。

仕事の種類Opus 5GPT-5.6 Sol読み方
実コード課題 FrontierBench43.334.4Opusが約26%高い
コード品質 FrontierCode53.447.5Opusが上、Fableと同等
長期コード DeepSWE68.872.7Solが上
ウェブ調査 BrowseComp90.890.4ほぼ互角
PC操作 OSWorld 2.070.662.6Opusが8ポイント上
知識成果物 GDPval-AA18611736Opusが125 Elo上
長期業務 AA-Briefcase17201505Opusが215 Elo上
新規問題 ARC-AGI-330.27.8Opusが約3.9倍
ARC-AGI-290.492.5Solがわずかに上

この表だけならOpus 5の圧勝に見えるが、注意点がある。競合値の一部は各社の公開結果や異なるハーネスから集められており、全モデルをAnthropicが完全に同じ条件で走らせたわけではない。またGPT-5.6 SolはCodexという実行環境、Ultraを含む推論制御、複数エージェントの並列化と組み合わせたときに強みが変わる。既存のGPT-5.6評価でも、Terminal-Bench、ブラウジング、コンピュータ操作、科学タスク、少ない出力で成果物をまとめる効率が強みとして出ていた。

使い分けを一文で言うなら、曖昧な要求から仕様を固め、文書・UI・コードをまたいで検証し、完成物まで運ぶならOpus 5が魅力的である。明確な開発タスクをCodexのツール環境で分解し、複数の調査や実装を並列化し、短い反復を高速に回すならGPT-5.6 Solが有力だ。API単価だけでなく、完成までの出力トークン、再試行、ツール呼び出し、人間のレビュー時間まで測る必要がある。

実際の使い勝手:プロンプトはそのままでも動くが、古い「念押し」は外す

人間が調査、実装、画面確認、文書確認、再検証のAI作業を監督する様子

Opus 5の価値は出力の一発勝負ではなく、調査・実装・確認をつないで完了まで進めるところにある。

Anthropicによれば、Opus 4.8向けの既存プロンプトはOpus 5でも概ねそのまま機能する。ただし、以前のモデルを補うために入れた「必ず最後に検証する」「別エージェントで再確認する」といった指示は外した方がよい場合がある。Opus 5は指示なしでも検証するため、同じ命令を重ねると過剰確認になり、時間とトークンを浪費するからだ。

逆に明示した方がよいのは、範囲と文章量である。Opus 5はエージェント作業の途中経過をよく語り、以前のOpusより1メッセージが長くなりやすい。ファイルへ書く報告書も長文化しやすい。Anthropicは、回答を短くしたければ effort を下げるのではなく、簡潔さをプロンプトで直接指定するよう案内している。effort は思考量を変えるレバーであり、表示文章の長さを確実には制御しない。

もう一つの癖は、考えすぎると依頼範囲を広げることだ。FrontierCodeではhighを超えると、頼まれていないリファクタリングまで行い、マージ可能な最小差分を求める採点で失点した。Anthropicは「タスク範囲内に留まる」という短い指示で多くが回復したとしている。大規模リポジトリでは、対象ファイル、禁止事項、変更してよい境界、完了条件を明示した方がよい。

実務の出発点としては、日常作業を low または medium、難しい障害調査や設計を high、失敗費用が高い一回限りの仕事を xhigh、本当に必要な最終難所だけ max とする。公式ベンチマークの多くはmaxだが、GDPval-AAではxhighがmaxより出力を25%減らしながら他モデルを上回り、AutomationBenchではmediumが24%を0.89ドル/件で達成した。常にmaxが最良の費用対効果ではない。

初日の口コミ:驚きと不満が同時に出ている

公開からまだ一日であり、口コミは統計ではない。それでも初期反応は、Opus 5の性格を理解する手掛かりになる。

好意的な反応では、「Opus 4.8より明らかに速く、コードも良い」「Low effortがSonnet 5 HighやOpus 4.8 Highより良い」「長時間タスクを回しても週間使用量が思ったほど減らない」という声がある。別の利用者は同じ複雑な不具合を新規チャットで比較し、Opus 5、Fable 5、Opus 4.6、Sonnet 4.6、Opus 4.8の順だったと報告した。単一の私的テストだが、Opus 5 Lowが新しい費用対効果の甘い点になる可能性は、公式のコスト曲線とも整合する。

一方、否定的な報告も重要だ。1年以上同じ大規模プロジェクトを複数モデルで開発している利用者は、Opus 5のコード自体は正しいが、原因調査でコメントを事実と誤認し、フラグの既定値について結論を二転三転させたと述べた。Fable 5に監査させるとさらに複数の推論ミスが見つかり、曖昧な調査ではFableの方が信頼できたという。別のAPI利用者は、同じeffortでOpus 5がOpus 4.8の約2倍の出力トークンを使い、mediumとhighが32k上限に到達したと報告している。ただし、試行1回・1種類のタスクで、成果物の採点前という大きな制約がある。

CodeRabbitによる約100種類の実在PRエラーパターンの3回試験では、Opus 5 xhighは指摘の精度が高い一方、検出範囲が狭く、全体の出力はノイズも多かった。コード生成では設計判断が良くOpus 4.8より明確に上だが、Fable 5より遅く、セキュリティ関連では慎重すぎるという評価だった。ここから見えるのは、Opus 5が「どの設定でも万能」なのではなく、タスクとeffortにより精度・網羅性・長さが動くモデルだということだ。

安全性と限界:最も整合的だが、サイバーでは意図的に最高峰ではない

Anthropicの自動行動監査では、Opus 5の総合的な不整合行動スコアは2.3で、Opus 4.8、Sonnet 5、Fable 5より低かった。欺瞞的行動、悪用への誘導、取り返しのつきにくい行動を避ける点でも、同社は過去最も整合的なモデルと位置づけている。

ただし能力の安全性には意図的な上限がある。AnthropicはOpus 4.8と同様、Opus 5をサイバータスクへ特化訓練していない。一般能力の上昇で脆弱性の発見はMythos 5に近づいたが、脆弱性を実際の攻撃へ変えるexploit開発ではMythos 5より大幅に低い。生物研究と攻撃的サイバーでも最高峰を更新していない。

これは一般の開発者には必ずしも欠点ではない。Fable 5のような30日保持を前提とする特別な安全運用や、広いフォールバック設計を避けながら、高い一般性能を提供できるからだ。一方、正当なセキュリティ研究では拒否や過剰な慎重さが残る。最高難度の防御的サイバー用途は招待制のMythos 5、日常のコード監査と安全な修正はOpus 5という分担になる。

性能面の限界も残る。SWE-bench Proは79.2%であり、約5件に1件は解けない。AutomationBenchは首位でも26%で、複雑な業務自動化の約4分の3は完遂できない。OSWorld 2.0も70.6%である。モデルが「自分で検証する」ようになっても、人間による権限設計、差分レビュー、テスト、外部送信と本番変更の承認はまだ必要だ。

どれを選ぶべきか:2026年7月時点の実務判断

状況推奨モデル / 設定理由
日常のコード修正・レビュー・文書作成Opus 5 low〜medium高い基礎性能を低コストで使える
曖昧な不具合調査・設計・大規模変更Opus 5 high〜xhigh原因調査、ツール利用、自己検証が強い
最高難度の長期推論・医療・科学判断Fable 5一部の天井と慎重な推論がまだ上
Codexでの並列実装・Terminal中心の反復GPT-5.6 Sol実行環境、並列化、DeepSWEで強い
大量の定型処理Sonnet 5 / GPT-5.6 Terra・LunaOpus/Solの推論費を払う必要がない
正当な最先端サイバー研究Mythos 5(招待制)Exploit能力は意図的に別モデルへ分離

個人のClaude利用では、まずOpus 5を標準にしてよい。Opus 4.8を選び続ける理由は、既存システムの回帰リスクを避けたい場合や、Opus 5の長文化をまだ調整できていない場合に限られてくる。API移行ではモデルIDの変更だけでなく、思考が標準でオンになること、手動extended thinkingと一部sampling設定が使えないこと、返答と成果物が長くなりやすいことを確認したい。

Fable 5は「常に一番良い回答が返るプレミアム版」ではなくなった。高価でも正当化しやすいのは、問題設定が曖昧で、推論の早合点が重大な損失につながり、Opus 5で詰まった場合である。GPT-5.6 Solも同様に、単体ベンチマークだけでなくCodexという作業環境込みで評価すべきだ。

導入後は、自社の代表タスクを少なくとも数十件用意し、成功率だけでなく、修正回数、所要時間、出力トークン、ツール呼び出し、人間のレビュー時間、重大な見落としを記録する。effortを上げれば必ず良くなるとは限らず、同じモデルでもlowとmaxで別製品のように費用特性が変わる。

まとめ:モデルの世代交代より、「検証するエージェント」への交代

Claude Opus 5の本質は、ベンチマークの数字が数ポイント増えたことではない。画像を見られなければ見るための道具を作り、検証データがなければテストハーネスを用意し、画面を作ればデスクトップとモバイルで確認し、誤りを見つければ自分で修正する。答えを生成するモデルから、完了条件を満たすまで作業を続けるモデルへ近づいた。

Opus 4.8との比較では、同価格で明確な世代交代である。Fable 5との比較では、最高難度の一部を除き、半額のOpus 5が実務の主役を奪った。GPT-5.6 Solとの比較では、Opus 5が未知問題、PC操作、知識成果物で強く、Solは長期コードとCodexの並列実行環境に強みを残す。

2026年7月25日時点の結論は明快だ。Claudeを仕事で使うなら、Opus 5を新しい基準にしてよい。Fable 5は難所の上位エスカレーション、GPT-5.6 Solは別の強力な実行系であり、Opus 4.8は互換性確認のための旧基準になる。 ただし発売初日の口コミはまだ予備的である。数週間後に見える安定性、混雑時の速度、使用量、長いセッションでの推論品質は、継続して検証する必要がある。

参考文献

  1. Introducing Claude Opus 5 — Anthropic
  2. Claude Opus 5 System Card — Anthropic
  3. What’s new in Claude Opus 5 — Claude Platform Docs
  4. Models overview — Claude Platform Docs
  5. Prompting Claude Opus 5 — Claude Platform Docs
  6. Introducing Claude Fable 5 and Claude Mythos 5 — Anthropic
  7. GPT-5.6 Sol — OpenAI
  8. Claude Opus 5 provider performance — Artificial Analysis
  9. Claude Opus 5 benchmarks for AI code review — CodeRabbit
  10. Opus 5 first impressions vs Fable — Reddit
  11. Claude Opus 5 early efficiency discussion — Reddit
  12. Claude Opus 5 vs Opus 4.8 token-use test — Reddit

関連記事

Claude Fable 5 と Claude Opus 4.8 の比較カバー画像
2026年7月8日

Claude Fable 5 と Claude Opus 4.8 徹底比較|「Opusの上」のFable 5は本当に使う価値があるのか【2026年7月8日時点】

2026年6月に登場し、米国の輸出管理で一時停止まで経験したClaude Fable 5と、実務の主力Claude Opus 4.8を、料金・ベンチマーク・安全分類器・使い分けまで、2026年7月8日時点の公開情報で徹底比較します。

テクノロジー続きを読む
GPT-5.6 Sol・Terra・Lunaの三層を表すカバー画像
2026年7月11日

GPT-5.6 Sol徹底解説|Sol・Terra・Lunaの三層とPro / Max / Ultraの使い分け【2026年7月時点】

2026年7月9日に一般提供されたGPT-5.6を、Sol・Terra・Lunaの三層、推論量の操作体系、Pro / Max / Ultraの違い、Claude Fable 5・Opus 4.8との比較、新ChatGPTデスクトップアプリの統合状況まで、図解つきで整理します。最上位を選ぶより、仕事に計算資源をどう配分するかが重要です。

テクノロジー続きを読む
AI core surrounded by borders and cloud infrastructure
2026年6月15日

AIにも国境が引かれた日|「知能」は輸出管理されるのか

Claude Fable 5とClaude Mythos 5の停止を起点に、AIモデルの重み、輸出管理、サイバー防衛、技術主権、そして「危険な知恵」を誰が管理するのかを考える長編考察です。

テック続きを読む
2026年5月24日

OpenAI裁判で見えた、善意の組織が巨大企業になる瞬間

OpenAIをめぐるマスク氏の訴訟を入口に、非営利の理想、巨額資本、Anthropic、DeepSeek、Gemini、Copilotまで含めてAI企業統治の矛盾を整理します。

テクノロジー続きを読む
2026年4月2日

Claude Code流出が暴いたものは、ソースコードそのものではなく「AIエージェントの設計図」だった

2026年3月末のClaude Code流出をもとに、エージェント競争の本質がモデル単体ではなく作業基盤設計へ移った背景を分析します。

テクノロジー続きを読む