Claude Opus 5.5とは?性能・料金・ベンチマーク・旧モデルとの違いをわかりやすく解説【2026年9月最新】|トレジャーフットAI

Claude Opus 5.5とは?性能・料金・ベンチマーク・旧モデルとの違いをわかりやすく解説【2026年9月最新】

この記事の結論(30秒で読める要約)

Claude Opus 5.5(クロード・オーパス5.5)は、Anthropicが2026年9月22日に発表した「Claude 5.5ファミリー」最初のAIモデルです。ほとんどの作業で上位モデルのClaude Fable 5.1と同レベルの性能を持ち、Anthropicの検証では初期設定・一般的なワークロードでOpus 5より約40%安く動きます。出力速度はOpus 5より30%以上速く、料金は100万トークンあたり入力$4・出力$20。APIのモデル名は claude-opus-5-5 で、Claude.ai、Claude Platform、AWS、Google Cloud、Microsoft Azureで利用できます。

Contents

Claude Opus 5.5とは何か

Claude Opus 5.5は、Anthropic(アンソロピック)が開発した大規模言語モデル「Claude」シリーズの最新Opusモデルです。2026年9月22日に公開され、新しい「Claude 5.5ファミリー」の第1弾として位置づけられています。

公式発表では、このモデルを「ほとんどの作業でClaude Fable 5.1と同レベルの性能を発揮し、Opus 5より40%安く動作するモデル」と紹介しています。

そもそも「Opus」「Fable」とは?

Claudeにはいくつかの「階層(ティア)」があります。ざっくり整理すると次のとおりです。

階層 代表モデル 位置づけ
Fable(上位) Claude Fable 5.1 長時間のエージェント作業向けの高性能モデル。Opus 5.5より高コスト
Opus Claude Opus 5.5 高難度タスク向けの主力モデル
Sonnet Claude Sonnet 5 性能と速度・価格のバランス型
Haiku Claude Haiku 4.5 軽量・高速・低価格

つまりOpus 5.5は、「1つ上の階層(Fable 5.1)に近い頭の良さを、Opusの価格帯で使えるようにしたモデル」と理解するとわかりやすいです。

Opus 5.5の5つの特徴

1. Fable 5.1並みの性能

多くのベンチマークでOpus 5.5はFable 5.1と同等か、それ以上のスコアを記録しています。たとえばエージェント型コーディングの指標「Terminal-Bench 4.0」ではOpus 5.5が66.4%で、Fable 5.1(55.8%)を上回りました。一方でFable 5.1が上回る項目もありますが、Anthropicは「社内で実際に使った感覚では、両者の差はスコアが示すより小さい」と述べています。

2. Opus 5より約40%安く動く

Anthropicの検証によると、初期設定のまま一般的なワークロードで使った場合、Opus 5より約40%安くなります。理由は2つあります。

  • 単価そのものが下がった:入出力トークン単価が20%、キャッシュ読み込みが60%値下げ
  • 少ないトークン・少ない手順で終わる:同じタスクをより短い手順で解くため、使うトークン量自体が減った

この「単価の値下げ」と「使用量の削減」の掛け算で、約40%のコスト削減になります。

3. 出力が30%以上速い

Opus 5と比べて出力生成が30%以上高速化しました。さらに「Fastモード」を使えば最大2.5倍の速度で動かせます(料金は割高)。

4. 長時間の自律作業に強い

公式ページでは、次のような長時間タスクの成功例が紹介されています。

  • 68万行のコード移行を1日未満で完了(早期テスター)
  • Webサーバーの負荷分散ソフト「HAProxy」をC言語からRustへ書き換え:両モデルともHAProxy自身の回帰テストをほぼすべて通過したうえで、Fable 5.1の12時間に対しOpus 5.5は9.5時間で完了し、コストは51%少なかった
  • 20万行のコードベースの監査と修正を3時間未満で完了(早期テスター):Opus 5は20時間以上かかり、トークンも2.5倍使っていた
  • Webアプリの読み込み高速化タスクで40回中39回成功:Opus 5は改善幅が小さく、アプリの挙動まで変えてしまうことがあった
  • 6つのリポジトリにまたがる大規模タスクを夜間に放置で任せ、18時間以上作業を継続(Clio社の事例)

5. 文章がわかりやすく、簡潔

Opus 5.5は「一番大事な情報を最初に書く」傾向があり、Opus 5より読みやすい文章を書くと評価されています。冗長な出力も減り、Box社の検証では回答の冗長さが40%減ったと報告されています。

また、Anthropicが社内で行った決算分析のテストでは、Opus 5.5が作成したレポート18本のうち16本が品質基準をクリアしました。この基準は、数字や引用を1つでも捏造すれば不合格になる厳しいものです。

料金はいくら?Opus 5との比較

Claude Opus 5.5のAPI料金は、100万トークンあたり入力$4・出力$20です。Opus 5(入力$5・出力$25)から20%値下げされました。

項目(100万トークンあたり) Opus 5.5 Opus 5 差
入力トークン $4 $5 20%安い
出力トークン $20 $25 20%安い
キャッシュ読み込み $0.20 $0.50 60%安い
キャッシュ書き込み(有効期間5分) $5 $6.25 20%安い
Fastモード(入力/出力) $8/$40 — 最大2.5倍速

キャッシュ読み込みの値下げが重要な理由

コーディングやAIエージェントの作業では、同じコードや資料を何度も読み返すため、処理するトークンの多くが「キャッシュ読み込み」になります(公式ページでもこの点が明記されています)。ここが60%値下げされたことが、実際の請求額に大きく効きます。

計算例:エージェント型の開発作業1回分

仮に「キャッシュ読み込み1,000万トークン+入力100万トークン+出力50万トークン」を使う作業だとすると、次のようになります(本記事独自の試算です)。

Opus 5.5 Opus 5
キャッシュ読み込み(1,000万) $2.00 $5.00
入力(100万) $4.00 $5.00
出力(50万) $10.00 $12.50
合計 $16.00 $22.50

同じトークン量でも約29%安くなります。ただし、この試算はキャッシュ書き込み料金を含みません。公式の「約40%」は初期設定・一般的な作業での比較で、実際の削減率は作業内容やトークン量によって変わります。

有料プランの利用上限も拡大

Claude.aiのPro・Max・Team・シート制Enterpriseプランでは、5時間ごとの利用上限が引き上げられました。また、サブスクリプション利用者は「レート制限リセット」を保存しておき、好きなタイミングで使えるようになっています。

ベンチマーク結果の読み方

Opus 5.5は、コーディング・エージェント・知識労働の主要ベンチマークの多くでトップスコアを記録しています。以下は公式ページに掲載された比較表です。Opus 5.5の数値は、いずれも最大の努力レベル(max)で測定されています。

ベンチマーク 何を測るか Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol
Terminal-Bench 4.0 ターミナル操作を伴うエージェント型コーディング 66.4% 55.8% 52.3% 57.9% 37.3%
FrontierCode v1.1 難度の高いコーディング 54.4% 50.3% 48.0% 53.3% 47.5%
CursorBench 4.0 実際の開発環境に近いコーディング 57.8% 51.8% 46.6% — 41.7%
GDPval-AA v2.1 実務的な知識労働(Eloレーティング) 1846 1735 1708 1542 1588
AutomationBench 業務の自動化 40.0% 31.4% 26.9% 41.4% 28.8%
Humanity's Last Exam(ツールあり) 最難関レベルの学術問題 67.7% 65.6% 63.6% 57.2% —
Terminal-Bench-Science 0.1 科学分野のエージェント作業 58.7% 52.6% 29.0% 64.6% 22.4%
OSWorld 2.0 PC操作(コンピュータ・ユース) 81.8% 80.7% 74.0% — —
Chartography グラフ・図表の読み取り 89.0% 88.4% 83.4% — —

※OSWorld 2.0の数値には、公式の表で「partial」という注記が付いています。

ポイント解説

  • コーディング系で首位:Terminal-Bench、FrontierCode、CursorBenchの3つでトップ。
  • 「安く勝つ」のが特徴:初期設定の努力レベル(medium)でも、次のような結果が出ています。
    • FrontierCode:medium設定で54.6%を記録し、GPT-6 Astraの最高スコア(53.3%)を1タスクあたり約5分の1のコストで上回った
    • CursorBench:GPT-5.6 Solの最高スコア(41.7%)を、約3分の1のコストで11ポイント上回った
    • Terminal-Bench 4.0:medium設定で、Opus 5の最大設定を約5分の1のコストで上回り、GPT-6 Astraとは約40%のコストで同等
    • GDPval-AA:medium設定で、GPT-6 Astraの最大設定を約5分の1のコストで上回った
  • すべてで1位ではない:AutomationBenchとTerminal-Bench-ScienceではGPT-6 Astraが上です。用途によってはモデルを使い分ける価値があります。
  • 大規模データ収集でも優位:PerplexityのWANDRベンチマークでも、Fable 5.1やOpus 5を低いコストで上回ったと報告されています。

FrontierCodeは表の数値(max設定で54.4%)より、medium設定の数値(54.6%)のほうがわずかに高くなっています。努力レベルを上げれば必ずスコアが上がるわけではない、という点も覚えておくとよいでしょう。

注意:ベンチマークには誤差があります(Terminal-Bench 4.0のOpus 5.5は±2.6ポイント程度)。また、AutomationBenchはZapierが実施したもので、安全対策が作動したケースも「失敗」として数えられています。数値は目安として見るのが適切です。

Opus 5・Fable 5.1・GPTとの違い

Opus 5.5とOpus 5の違い

比較項目 Opus 5.5 Opus 5
総合性能 Fable 5.1並み Opus 5.5より下
一般的な作業コスト 約40%安い(初期設定) 基準
出力速度 30%以上速い 基準
トークン効率 同じ作業を少ない手順で完了 手順・トークンが多め
文章 簡潔で結論が先 やや冗長
プロンプトインジェクション耐性 検証したすべての環境で同等以上 基準
与えられた範囲を越えようとする行動 約85%少ない 基準

性能・速度・価格・安全性のほとんどでOpus 5.5が上回っており、Opus 5からの移行先として最有力です。ただし、サイバーセキュリティ関連の作業が初期設定ではOpus 4.8に振り分けられる点や、thinkingをオフにできない点など、仕様の違いは事前に確認しておきましょう(後述)。

Opus 5.5とFable 5.1の違い

  • 性能:ほとんどの作業でほぼ同等。ベンチマークでは差がある項目もありますが、Anthropicは「実際の使用感では、差はスコアが示すより小さい」としています。
  • コスト:Opus 5.5のほうが大幅に安い(HAProxyの移植例ではコスト51%減)。
  • 安全対策:サイバーセキュリティと生物学分野では、Fable 5.1と同等の安全対策が組み込まれています。

Opus 5.5とGPT-6 Astra/GPT-5.6 Solの違い

  • コーディング:Opus 5.5が優位。しかも同等以上の成績を、より低いコストで出せる点が強み。
  • 業務自動化・科学分野:AutomationBenchとTerminal-Bench-ScienceではGPT-6 Astraが上回る。
  • 総合的な知識労働(GDPval-AA):Opus 5.5が1846でトップ、GPT-6 Astraは1542。

実際の導入企業の評価

公式ページには、事前テストに参加した企業の声が多数掲載されています。代表的なものを整理しました。

企業 評価のポイント
GitHub 測定したモデルの中で最も少ない部類のトークンと手順で完了。Opus 5の半分以下の手順で、より多くのターミナル課題を解決
Stripe 積み重なった40本のプルリクエストを数日がかりでリベースする作業で、1つのOpus 5.5セッションが十数のセッションを指揮。40本すべてが翌日の午後にCIを通過
Quantium 以前は4日間で38回のプロンプトが必要だった複雑なコーディング作業が、3時間・11回のプロンプトで完了
Deloitte Consulting コードレビューでの既知のバグ検出率が72%(Opus 5はhigh設定で56%)。誤検知も少なく、出力量はごく一部
Optiver Opus 5と同品質を約半分のターン・時間・出力トークンで達成し、そのワークロードのコストを40〜50%削減
Hebbia 評価項目の網羅率86.6%(Opus 5は60.3%)。検索系の評価では同社過去最高の引用再現率
Box Opus 5の3分の1のトークンで、回答の冗長さを40%削減
Lovable 3分の1〜半分少ない手順で完了し、トークンも大幅に削減
Factory medium設定でOpus 5のhigh設定に匹敵し、出力トークンは20〜25%少ない
Walleye Capital 同社の指示文にあった分単位のインデックスが1つずれていることに気づき、自ら補正。これまでテストしたモデルで、ここまでできたものはなかった
LexisNexis 関連性の高い引用を一貫して特定し、法令の扱いにも強く、回答の構成も優れていた

共通しているのは、「少ない手順・少ないトークンで、より正確に終わらせる」という評価です。

安全性と利用上の注意点

安全性の改善点

  • 外部機関による事前評価:Frontier DesignやMETRなどの外部評価機関がリリース前にテスト。
  • 行動監査で過去最高スコア:約2,000の状況を使った自動行動監査で、これまでテストした中で最も良い結果。誠実さに関する指標の多くでも最高水準。
  • 取り返しのつかない操作をしにくい:最近のモデルと比べて、元に戻しにくい行動や、与えられた範囲を越えた行動をとる可能性が大幅に低下。範囲を越えようとする試みは、Opus 5やClaude Mythos 5.1より約85%少なくなりました。
  • プロンプトインジェクションに強い:検証したすべての環境でOpus 5と同等以上の耐性。

知っておきたい制限・仕様変更

  1. サイバーセキュリティ関連の作業の多くは、初期設定では「Opus 4.8」に振り分けられます。認定されたセキュリティ専門家向けの「Cyber Verification Program」は、今後数週間のうちにOpus 5.5にも対象が広がる予定です。
  2. 生物学関連の作業には制限があります。大学の研究室、スタートアップ、製薬会社などの審査を通った組織は、新設の「Life Sciences Verification Program」に申請することで利用できます。
  3. 「thinking(思考)」をオフにした状態では使えません。
  4. 「preserved thinking」を搭載しています。Fable 5.1で導入された蒸留対策で、モデルの推論過程を抜き出して他のAIの学習に使われることを防ぐ仕組みです。発表時点では、2026年8月31日以降に作成されたAPIアカウントに適用されます。
  5. EU AI法に対応するための電子透かし(ウォーターマーク)が入っています。
  6. ゼロデータ保持(Zero Data Retention)で利用できます。

Anthropic自身が認めている課題

公式ページでは、「すべての失敗を確実に見つける評価をつくることは、まだ解決されていない問題」であり、モデルが「評価されていることに気づいている兆候」があることも正直に記載されています。つまり、テスト結果が現実のあらゆる場面での振る舞いを完全に保証するわけではありません。

Opus 5.5の使い方・使える場所

使い方 詳細
Claude.ai(チャット) モデル選択からOpus 5.5を選ぶ
Claude API モデル名 claude-opus-5-5 を指定して呼び出す(Claude Platform)
Amazon Web Services AWS経由で利用可能
Google Cloud Google Cloud経由で利用可能
Microsoft Azure Azure経由で利用可能

努力レベル(effort)の選び方

Opus 5.5には low/medium/high/xhigh/max の努力レベルがあり、初期設定はmediumです。

  • 普段使い・コスト重視:medium(初期設定でも、他社モデルの最大設定を上回るベンチマークがある)
  • 難しい調査・大規模な改修:high〜max
  • 軽い質問・大量処理:low

Factory社は、Opus 5.5を「medium設定を標準にできた最初のモデル」と評価しています。

どんな人に向いているか

向いている人・用途

  • 大規模なコード移行、リファクタリング、コード監査をしたいエンジニア
  • AIエージェントを長時間自律的に動かしたい開発チーム
  • 決算分析、M&A分析、財務モデル作成などを行う金融・コンサル業務
  • 法令や判例に関する調査を行う法務担当者
  • Opus 5やFable 5.1のコストを下げたい企業

別の選択肢を検討したほうがよい場合

  • とにかく安く大量に処理したい:Sonnet 5やHaiku 4.5
  • セキュリティ診断や生物学研究が主な用途:各検証プログラムへの申請が必要

よくある質問(FAQ)

Q1. Claude Opus 5.5はいつ発表されましたか?

2026年9月22日です。Anthropicが「Claude 5.5ファミリー」最初のモデルとして発表しました。

Q2. Claude Opus 5.5の料金はいくらですか?

100万トークンあたり入力$4、出力$20です。キャッシュ読み込みは$0.20、キャッシュ書き込みは有効期間5分で$5。高速なFastモードは入力$8、出力$40です。

Q3. Opus 5.5とOpus 5は何が違いますか?

Opus 5.5はOpus 5より高性能で、Anthropicの検証では初期設定・一般的な作業で約40%安く、出力も30%以上速いモデルです。同じ作業を少ない手順・少ないトークンで終えられ、文章も簡潔になっています。

Q4. Opus 5.5とFable 5.1はどちらが優れていますか?

ほとんどの作業で性能はほぼ同等で、コストはOpus 5.5のほうが大幅に安いです。Terminal-Bench 4.0やCursorBenchなど、一部のベンチマークではOpus 5.5が上回っています。

Q5. Opus 5.5のAPIモデル名は何ですか?

claude-opus-5-5 です。Claude Platform、AWS、Google Cloud、Microsoft Azureで利用できます。

Q6. Opus 5.5はGPT-6より優れていますか?

コーディングと知識労働の多くのベンチマークではOpus 5.5がGPT-6 Astraを上回っています。FrontierCodeでは、medium設定でGPT-6 Astraの最高スコアを約5分の1のコストで超えました。ただしAutomationBenchや科学分野のベンチマークではGPT-6 Astraが上です。

Q7. Opus 5.5は無料で使えますか?

無料プランでは使えません。公式料金ページでは、OpusはFreeの対象外で、Pro・Max・Team・Enterpriseで利用できると案内されています(2026年9月24日確認)。

Q8. Opus 5.5でthinking(思考モード)をオフにできますか?

できません。Opus 5.5は、thinkingをオフにした状態では提供されていません。

Q9. Opus 5.5をサイバーセキュリティ用途に使えますか?

初期設定では、サイバーセキュリティ関連の作業の多くはOpus 4.8に振り分けられます。認定されたセキュリティ専門家向けの「Cyber Verification Program」は、今後数週間のうちにOpus 5.5にも対象が広がる予定です。

Q10. Opus 5.5のコンテキストウィンドウ(扱える文章量)はどれくらいですか?

発表ページには、コンテキストウィンドウや最大出力トークン数の記載はありません。最新の仕様は docs.claude.com のモデル一覧で確認してください。

まとめ

  • Claude Opus 5.5は、Fable 5.1並みの性能を持ち、Opus 5より約40%安く、30%以上速いモデル
  • 料金は100万トークンあたり入力$4・出力$20、キャッシュ読み込みは60%値下げの$0.20
  • コーディング系ベンチマーク(Terminal-Bench 4.0、FrontierCode、CursorBench)で首位
  • GitHub、Stripe、Deloitteなど多くの企業が「少ない手順で、より正確に」と評価
  • サイバーセキュリティ・生物学の分野には制限があり、thinkingはオフにできない
  • APIモデル名は claude-opus-5-5

Opus 5を使っている人にとっては、ほぼ全面的なアップグレードと言えます。まずは初期設定(medium)のまま試し、難しいタスクだけ努力レベルを上げる使い方がおすすめです。

出典:Introducing Claude Opus 5.5(Anthropic)(2026年9月22日公開) 本記事の数値は、試算の部分を除いてすべて上記の公式ページに基づいています。仕様や料金は変更される可能性があるため、最新情報は公式サイトで確認してください。

活動の日々

BLOG

PAGE TOP