Claude Opus 5 公開!Fable 5 の“半額”で最上位級

Claude Opus 5 公開:Fable 5 の“半額”で最上位級

AI Claude Opus 5 公開!Fable 5 の“半額”で最上位級

Claude Opus 5、まず何が起きたのかを3行で

こんにちは。今回は、生成AI界隈が一気にざわついたニュースを、できるだけ落ち着いて整理していきますね。

米国時間 2026年7月24日(日本時間 7月25日)、Anthropic が最新の大規模言語モデル「Claude Opus 5」を公開しました。すでに全プラットフォームで利用可能で、API のモデル名は claude-opus-5、知識のカットオフは 2026年5月とされています。

要点を3行にすると、こうなります。上位モデル Fable 5 に迫る知能を、およそ半額の価格帯で提供すること。価格は前世代 Opus 4.8 から据え置きで、入力 100万トークンあたり 5ドル、出力 25ドルであること。そして、強さの出方に明確な「偏り」があること。この3つ目が、実は一番おもしろいところです。

価格と提供プラン:Opus が「毎日使うモデル」になった

まず、お財布に直結する部分から見ていきましょう。

Claude Opus 5 の API 価格は、入力 100万トークンあたり 5ドル、出力 100万トークンあたり 25ドル。前世代の Opus 4.8 とまったく同額です。上位の Fable 5 は入力 10ドル/出力 50ドルなので、定価でちょうど 2倍の開きがあります。競合の OpenAI「GPT-5.6 Sol」は入力 5ドル/出力 30ドルという水準です。

個人向けでは、Claude Max の新しい標準モデルとなり、Claude Pro では利用できる最上位モデルになりました。無料プランでは使えません。ここ、地味に大きな変化です。かつて Opus は「重くて高いから、ここぞという時だけ」という位置づけでしたが、Anthropic 自身が「毎日使えるように設計した」と明言しています。

さらに、通常の約 2.5倍の速度で動く「Fast モード」もリサーチプレビューとして提供されます。こちらは基本価格の 2倍、Claude Code では利用クレジット経由で使えます。

effort 設定という新しい“つまみ”

今回の発表を読むうえで欠かせないのが、effort(推論にどれだけ手間をかけるか)という設定です。low、medium、high、xhigh、max の 5段階があり、既定値は high。Claude Code では max の上に ultracode も選べます。

Anthropic が公開したグラフの大半は、単一のスコアではなく、この effort を軸にした「コスト対性能の曲線」です。つまり今回のメッセージは「うちが一番賢い」ではなく「同じ予算での歩留まりが違う」なんですね。ここを読み違えると、期待値がずれてしまいます。

主要ベンチマークを一覧で比較する

公式が公開した 12指標を、横並びで整理しました。数値はすべて Anthropic 公式発表に基づきます。

評価領域(ベンチマーク)Opus 5Fable 5Opus 4.8GPT-5.6 SolOpus 5 の順位
エージェント型ターミナルコーディング(Frontier-Bench v0.1)43.3%33.7%21.1%34.4%1位
ナレッジワーク(GDPval-AA v2)18611747159317361位
新規問題解決(ARC-AGI-3)30.2%計測なし1.5%7.8%1位
エージェント型検索(BrowseComp)90.8%87.4%84.3%90.4%1位
学際推論・ツールなし(HLE)56.3%56.5%49.8%計測なし2位
学際推論・ツールあり(HLE)64.7%63.9%57.9%計測なし1位
コンピュータ操作(OSWorld 2.0)70.6%66.1%55.7%62.6%1位
エージェント型コーディング(DeepSWE v1.1)68.8%69.7%59.0%72.7%3位
エージェント型コーディング(FrontierCode v1.1 Main)53.4%53.5%46.5%47.5%2位(実質同点)
業務ワークフロー(Zapier AutomationBench)26.0%17.4%17.0%18.1%1位
法務(Legal Agent Benchmark, Held-out)11.7%13.3%10.4%2.5%2位
ヘルス(HealthBench Professional)59.8%57.4%60.5%3位(1位は Mythos 5 の 66.0%)
バイオ・hard(BioMysteryBench)49.4%46.5%42.4%計測なし1位

加えて、CursorBench 3.2 では最大 effort 時に Fable 5 のピークスコアとの差が 0.5% 以内に収まり、タスク単価は半分だったとされています。

勝ち方には、はっきりした偏りがある

表を「横」ではなく「縦」に読むと、見えてくるものがあります。

Opus 5 が大差をつけたのは、Frontier-Bench(Fable 5 に 9.6ポイント差)、AutomationBench(2位群に 8ポイント以上差)、OSWorld 2.0(4.5ポイント差)、ARC-AGI-3(2位の約 4倍)の 4つ。この 4つに共通するのは、いずれも「1回の応答で終わらないタスク」だという点です。複数ステップを踏み、環境に触れ、途中結果を見て方針を変え、失敗したらやり直す。そういう仕事です。

逆に、DeepSWE や FrontierCode といった単発寄りのコーディング指標では、Fable 5 や GPT-5.6 Sol とほぼ横並び。つまり、チャット窓で関数を 1つ書かせるような使い方が中心なら、体感の差は小さい可能性が高いということですね。

象徴的なのが、公式が紹介した事例です。機械部品の図面から 3D の FreeCAD モデルを再構築する課題で、Opus 5 は図面を直接「見る」手段を与えられていませんでした。そこでモデルは、自前でコンピュータビジョンのパイプラインを書き、生のピクセルから幾何形状を抽出して解いてしまったそうです。同条件で 5回試行しても、他社モデルは解けなかったとされています。行き詰まったときに手段を増やして粘る。この挙動が、長い作業ほど効いてくるわけです。

順位より「絶対値」を見ると、期待値が現実に戻る

ここは、社内で AI 導入を進める方にこそ読んでほしいところです。

「AutomationBench で 1.5倍」という表現は正しいのですが、中身は 17% が 26% になったという話です。4問に 1問しか通っていません。法務にいたっては、1位の Fable 5 でも 13.3%、Opus 5 は 11.7%。1割強しか解けていない世界です。

つまり「もう業務プロセスをまるごと任せられる」という水準ではありません。下書きを作らせて人が確認する、という前提はまだ変わらないんですね。ベンチマーク名だけを見て強い弱いを判断せず、条件と絶対値をセットで見る。これが今回いちばん大事な読み方だと思います。

「半額で Fable 5 級」の正確な意味

このキャッチコピー、誤解を生みやすいので補足します。

公式が示しているのは、同じ設定同士を 1対1 で並べた比較ではなく、effort を動かしたときのコストと性能の曲線です。CursorBench 3.2 の「最大 effort 時に Fable 5 のピークの 0.5% 以内、タスク単価は半分」というのは、「同じ条件で半額」ではなく「Fable 5 のピークに追いつく地点まで持ち上げても、まだ半分のコストで済む」という意味になります。

また、Frontier-Bench の実行では、Opus 5 と Fable 5 が安全性の分類器で拒否した場合のフォールバック先として Opus 4.8 が使われた、と脚注に明記されています。掲載スコアはフォールバック分を含んだ実効値である点も、公平に押さえておきたいところです。

安全性は「止める」から「振り替える」へ

今回、運用に直接効く変更が入りました。

サイバーセキュリティ関連では、Opus 5 の分類器は Fable 5 より緩く設定され、介入頻度は約 85% 減少する見込みとされています。ソースコードの脆弱性発見は許可される一方、バイナリを対象とした脆弱性スキャン、ペネトレーションテスト、エクスプロイト生成はブロックされます。Claude.ai、Claude Code、Claude Cowork でフラグが立ったリクエストは、既定で Opus 4.8 にフォールバックします。

能力面では、脆弱性の「発見」については Mythos 5 に近づいた一方、それを実際の攻撃手段に変える「エクスプロイト開発」では大きく引き離されたまま、と明記されています。Anthropic が意図的にサイバータスクで学習させていないことの結果だそうです。

バイオロジー側は逆方向で、Fable 5 でブロックされる要求が、今後は Opus 4.8 ではなく Opus 5 にルーティングされます。科学研究用途では、一般提供モデルの中で最も高性能になったということですね。

アラインメント面では、自動行動監査での総合的な逸脱スコアが 2.3 と、Opus 4.8、Sonnet 5、Fable 5 を下回る最良値を記録。「これまでで最もアラインメントの取れたモデル」と評価されています。長時間の自動実行を任せる前提で見ると、この項目はスコアや速度と同じくらい実務的な意味を持ちます。

一方で弱点も正直に開示されています。確信がないのに自信を持って断定するケースが「驚くほど多く」確認され、事実に関するハルシネーション発生率は Opus 4.8 をわずかに上回るとのこと。回答が冗長になりがちな点も指摘されています。

歴史から見ると、これは「価格戦争の第3ラウンド」

少し引いた視点で見てみましょう。

Opus ティアは、かつて 100万トークンあたり入力 15ドル/出力 75ドルという、明確な「贅沢品」でした。それが 2025年秋の世代で一気に 5ドル/25ドルへ引き下げられ、以降 3世代にわたって据え置かれています。性能だけが上がり、価格は動かない。これは、フロンティアモデルの競争軸が「絶対性能」から「単位コストあたりの成果」へ移ったことの、はっきりした証拠だと思います。

競合の動きも同じ方向です。OpenAI が 2026年7月9日に一般提供を開始した GPT-5.6 Sol も、トークン効率の改善を前面に押し出していました。前世代の Opus 4.8 が公開されたのが 2026年5月下旬、Fable 5 が 6月ですから、わずか 2か月で世代が回っている計算になります。ユーザー側にとっては、「乗り換えるかどうか」より「乗り換えを前提にどう設計するか」が問われる時代に入った、ということですね。

今日からやるべき3つのこと

最後に、実務への落とし込みです。

1つ目は、effort を上げすぎないこと。グラフはどれも effort を上げるほどスコアもコストも伸びる形なので、いきなり xhigh や max で回すと、性能ではなく請求額に驚くことになります。基準は medium、難所だけ都度上げる運用が安全です。

2つ目は、載せ替えの優先順位づけ。効果が出やすいのは、長時間まわすエージェント、コンピュータ操作を伴う作業、複数ステップの業務フローの 3つ。単発のコード生成が中心のワークフローは、急いで切り替える理由が薄めです。

3つ目は、プロンプトの書き換え。公式のプロンプトガイドでは、Opus 5 は指示しなくても自ら作業を検証するため、従来の「最後に検証すること」という指示はむしろ過剰検証を招くとして削除を推奨しています。サブエージェントへの委任も積極的すぎるため、条件や上限を設けるよう促されています。簡潔さが必要なら、明示的に書きましょう。

よくある質問(FAQ)

Q1. Claude Opus 5 の料金はいくらですか。 A. 入力 100万トークンあたり 5ドル、出力 100万トークンあたり 25ドルです。Opus 4.8 と同額で、Fast モードを使う場合は基本料金の 2倍になります。

Q2. 無料プランでも使えますか。 A. 使えません。Claude Max では新しい標準モデル、Claude Pro では利用できる最上位モデルという位置づけです。

Q3. Opus 4.8 から乗り換えるべきですか。 A. 価格が同じで、公開されている全ベンチマークで Opus 4.8 を上回っているため、Opus ティアを使っているなら乗り換えない理由は基本的にありません。

Q4. Fable 5 と Opus 5、どちらを選べばいいですか。 A. 公開 12項目のうち、Fable 5 が明確に上回ったのは法務の 1項目のみでした。普段使いは Opus 5、外すと痛い判断のセカンドオピニオンに Fable 5、という使い分けが現実的です。

Q5. Mythos 5 との違いは何ですか。 A. Mythos は最上位ティアで、サイバーセキュリティやバイオ研究では依然として Mythos 5 が上とされています。Fable 5 はその一般提供版にあたる位置づけです。

Q6. effort はどの設定から試すべきですか。 A. 既定値は high ですが、コスト管理の観点では medium を基準にし、難所だけ xhigh や max に上げる運用が扱いやすいです。

Q7. ハルシネーションは減りましたか。 A. 事実に関するハルシネーション発生率は、Opus 4.8 をわずかに上回ると公式が明記しています。確信がないのに断定するケースも指摘されており、重要用途では裏取りが必要です。

Q8. セキュリティ業務で使えますか。 A. ソースコードの脆弱性発見は許可されますが、バイナリベースのスキャン、ペネトレーションテスト、エクスプロイト生成はブロックされます。業務上必要な企業・研究者向けには Cyber Verification Program が用意されています。

Q9. 安全分類器に引っかかるとエラーになりますか。 A. Claude.ai、Claude Code、Claude Cowork では既定で Opus 4.8 にフォールバックします。API でもベータ機能の自動フォールバックを有効にすれば、ブロックではなく別モデルへ回されます。

Q10. 業務を丸ごと自動化できますか。 A. まだ難しいです。業務ワークフロー評価の AutomationBench は最高の Opus 5 でも 26.0%、法務は 11.7% にとどまります。人が最終確認する前提を外さないことをおすすめします。


【 映像制作技術提供 】 CREATIVE HOUSE ( https://creative-house.jp/ )

>