新しいモデルが出るたびに、ベンチマークの数字が話題になります。
今回もそうでした。
2026年9月22日、Anthropic が Claude Opus 5.5 を公開しました。
この記事でわかること
- Claude Opus 5.5 の性能・費用・速度を、公式値で確認する
- 「40%安い」の正体は、単価ではなく「使うトークンが減ったこと」
- 公式のベンチマークには、7つの但し書きが付いている
- 見落とすと困る仕様変更が2つあります
Claude Opus 5.5 で、何が変わったのか
Anthropic の説明では「ほとんどの作業で Claude Fable 5.1 と同等の性能」で、「典型的な作業では Opus 5 より運用コストが40%低い」とされています。
公式ページに掲載されている数値は次のとおりです。いずれも Anthropic 自身の測定で、第三者が検証した数値ではありません。
| 測定項目 | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| エージェント型のコーディング (Terminal-Bench 4.0) |
66.4% | 55.8% | 52.3% |
| 知識労働 (GDPval-AA v2.1・Elo) |
1846 | 1735 | 1708 |
| コンピュータ操作 (OSWorld 2.0・partial) |
81.8% | 80.7% | 74.0% |
費用は、入力100万トークンあたり4ドル、出力20ドル。Opus 5 の5ドル・25ドルから、どちらも20%下がりました。キャッシュ読み出しは0.50ドルから0.20ドルへ、60%下がっています。公式ページには「エージェント作業やコーディング作業の費用の大半はキャッシュ読み出しが占める」と明記されているので、長時間セッションを回す使い方ほど効いてきます。
あわせて、出力速度が30%以上向上し、Pro・Max・Team などの5時間あたりの利用上限も引き上げられました。Sonnet 5.5 と Haiku 5.5 も数週間以内に続くとされています。
「40%安い」の正体は、単価ではありません
単価が下がったのは20%です。では、なぜ合計で40%になるのか。
実は、1つの作業に使うトークンそのものが減っています。なぜなら、同じ仕事をより少ない手数で終えるようになったからです。公式ページに掲載されている早期テスターの証言が、揃って同じことを言っています。
- Optiver「Opus 5 と同等の品質を、約半分のターン数・時間・出力トークンで。コストは40〜50%削減」
- GitHub「測定した中で最も少ないトークンと手数。VS Code では半分未満の手数で、Opus 5 より多く解決した」
- Box「Opus 5 の3分の1のトークン。回答は40%短いが、正確さは落ちていない」
- Kiro「約40%少ない呼び出し、半分のトークン」
そして、公式ページがいちばん強く書いているのはここです。
既定設定(medium)の Opus 5.5 が、最大設定の Opus 5 に、1タスクあたり約5分の1のコストで勝ちます。
― Anthropic「Introducing Claude Opus 5.5」(2026年9月22日/さぽマケによる要約)
Deloitte は「最低の effort 設定で、Opus 5 の high 設定より多くのバグを検出した(72%対56%)」、Rogo は「最低設定で、Opus 5 の high 設定を上回り、出力トークンは約60%少なかった」と報告しています。
つまり、これまで「全力設定で回す」のが前提だった作業を、既定のまま回せる可能性が出てきた、ということです。費用の話は、そこまで含めて読むほうが実態に近くなります。
公式のベンチマークには、7つの但し書きが付いています
上の表を、そのまま「10ポイント差」と読むのは早計です。公式ページの注釈には、次のように書かれています。
| # | 但し書きの内容 |
|---|---|
| 1 | 特記のない限り、Opus 5.5 の結果は「適応思考の max effort」。各モデルの最高スコアを並べた表 |
| 2 | Terminal-Bench だけ Opus 5.5 は xhigh、GPT-6 Astra は high での結果 |
| 3 | 標準誤差の明示。公開リーダーボードの Opus 5(51.8%)と自社再現(52.3%)の差は「ノイズの範囲内」と注記 |
| 4 | 安全機構が介入した場合、サイバー課題は Opus 4.8、生物学とLLM開発の課題は Opus 5 が実行。「Opus 5.5 のスコアを下げている可能性が高い」と自認 |
| 5 | AutomationBench は Zapier が実施・報告。フォールバックなしのため、安全機構の介入は失敗扱い |
| 6 | WANDR は Perplexity の公開設定と条件が異なるため、直接比較できないと明記 |
| 7 | GPT-6 Astra と GPT-5.6 Sol の数値は、OpenAI の自己申告 |
そのうえで、Anthropic は同じページにこう書いています。
この水準の能力になると、ベンチマークの差は、実際の違いを測る指針としては信頼性が下がることが分かってきました。私たち自身の利用では、Opus 5.5 と Claude Fable 5.1 の差は、これらの点数が示唆するほど大きくありません。
― 同上(さぽマケによる要約)
表で差をつけておきながら、同じページで「その差は見かけほどではない」と書いています。点数の比較ではなく、実際の作業で確かめてほしい、という意味に読めます。
出力の「書き方」も変わりました
性能・安全性・費用と並んで挙げられているのが、コミュニケーションの改善です。Anthropic はこれを「Opus 5 について最も多く寄せられた声の一つ」と認めたうえで直した、と書いています。
変わったとされているのは、大事な情報を先に置くようになったこと、専門用語や独特の言い回しが減ったこと、そしてこちらが渡した「文章の規則」に従うようになったことの3点です。公式ページには、同じ質問に対する Opus 5 と Opus 5.5 の出力が、実際に並べて掲載されています。
Anthropic は、これを「追いやすいということは、確かめやすいということでもある。実用上の利点であると同時に、安全上の利点でもある」という趣旨で説明しています。長い作業を任せるほど、検品の手間に直結する部分です。
見落とすと困る仕様変更が、2つあります
① 思考モードをオフにできなくなりました。Opus 5.5 は、thinking を無効にした状態では利用できません。速度や費用の都合でオフにする運用をしていた場合は、組み直しが必要です。
② 推論内容の保持(preserved thinking)が適用されます。API経由で、過去のやり取りを編集してモデルの推論を引き出す使い方が制限されます。適用対象は2026年8月31日以降に作成されたAPIアカウントで、Fable 5.1 と Opus 5.5 が対象です。既存の連携がある場合は、動作確認をしておくほうが安全です。
安全面では改善が報告されています。与えられた範囲を越えようとする挙動が Opus 5 や Claude Mythos 5.1 と比べて約85%少なかった、プロンプトインジェクション(読ませた文章に紛れた指示に従ってしまう問題)への耐性が最も高い水準だった、といった内容です。これも同社の測定によるものです。公式は同時に、Opus 5.5 には「自分が評価されていると疑っている兆候が見られる」とも書いており、テストの成績が実運用の安全性をそのまま保証するわけではない、と自ら但し書きを付けています。
結局、どう使い分けるか
現時点での、さぽマケの整理です。
- 既定のモデルは Opus 5.5 に寄せる。同じ作業を少ない手数で終えられる方向の変更のため
- effort を上げる癖を、いったん外してみる。既定のままで前世代の最大設定に並ぶ場面がある
- 入れ替えの判断は、発表当日の点数ではなく、実際の案件を2〜3本通してから決める
- API連携がある場合は、思考モードと推論保持の2点を先に確認する
草津市や守山市の店舗さんの原稿づくりのように、こちらが最終的に全部読んで手を入れる仕事では、手数と読みやすさがそのまま作業時間に跳ね返ります。点数の差より、そちらのほうが体感しやすいはずです。
まとめ
Claude Opus 5.5 は、性能が上がっただけのモデルではありません。費用の構造、出力の速さ、書き方まで含めた更新です。
実は、いちばん大きいのは「賢くなった」ことより「同じ仕事を、少ない手数で終えるようになった」ことだと考えています。なぜなら、単価が20%下がっただけでは、合計40%減にはならないからです。
そして公式自身が、ベンチマークに7つの但し書きを付けたうえで「点数の差は見かけほどではない」と書いています。点数で選ぶのではなく、自分の仕事で確かめて選ぶ。判断の置き場所が、一段ずれました。
新しいモデルが出るたびに全部を試し直すのは、現実的ではありません。まずは、いま一番時間を使っている作業を1つだけ選んで、同じ指示を既定設定のまま通してみるところからで十分です。
道具の入れ替えは、性能表を眺めていても決まりません。どの作業を任せていて、どこで手が止まっているのかが分かっていないと、比べる基準そのものが立たないためです。自社の使い方に合っているか判断がつかないときは、一度まとめて棚卸ししてみることをおすすめします。
出典・参考(最終確認:2026年9月24日)
※本文中の数値は、特記のない限り Anthropic 自身の測定によるものです。第三者が検証した数値ではありません。
※仕様・料金は変更される場合があります。最新情報は各公式サイトでご確認ください。