2026年9月28日、Anthropicが「Claude Sonnet 5.5」を発表しました。Sonnet 5から性能を大きく伸ばし、出力速度は30%以上向上。入力・出力のtoken単価は据え置きながら、Anthropicの評価では1タスクあたり最大約30%低コストになっています。
注目したいのは、Sonnet 5.5が上位モデルのClaude Opus 5.5を追い越した、という話ではないことです。AnthropicはOpus 5.5を複雑で判断の難しい仕事向け、Sonnet 5.5をより速く低価格な補完モデルと位置づけています。上位・下位の役割は保ったまま、日常的な実務やコーディングでSonnetがOpusに近い結果を出す場面が広がった、というのが今回のポイントです。
この記事では、公式発表のベンチマーク、Vals AIとArtificial Analysisの公開評価、API価格を分けて見ながら、Sonnet 5.5とOpus 5.5、GPT-6 Astra・Sol・Lunaの使いどころを整理します。ベンチマークを単純な勝敗表にはせず、仕事の難しさ、速度、費用、reasoning effort(推論の強さの設定)を合わせて考えます。
Sonnet 5.5はOpus 5.5を超えたモデルではありません。上位のOpusを使わなくても十分な仕事の範囲を、より高速・低価格なSonnetで広げたモデルです。
複雑・曖昧・長時間。継続して慎重な判断が必要な仕事。
明確な実装・修正・素早い反復、文書・スライド・表計算資料。
Claude Sonnet 5.5の基本情報
Sonnet 5.5は、Anthropicが2026年9月28日に発表したClaude 5.5ファミリーのモデルです。Anthropicによると、Sonnet 5より出力が30%以上速く、同じtoken単価でより少ないtokenを使って仕事を終えられるため、社内評価では1タスクあたり最大約30%低コストになりました。これはAnthropicの評価結果であり、どの作業でも必ず同じ割合で安くなるという意味ではありません。
| モデル | API Input (100万token) | API Output (100万token) | コンテキスト / 最大出力 | 主な役割 |
|---|---|---|---|---|
| Claude 5.5ファミリー | ||||
| Claude Opus 5.5 | $4 | $20 | 1M / 128K token | 複雑で答えが決まっていない仕事、長時間のAgentic coding、知識労働 |
| Claude Sonnet 5.5 | $2 | $10 | 1M / 128K token | 日常の明確な作業、バグ修正、実装、資料作成。高速・低価格なOpusの補完 |
| GPT-6ファミリー | ||||
| GPT-6 Astra | $10 | $50 | 1.05M / 128K token | OpenAIの最上位モデル。難しい一連の作業や複雑な推論・調査・文書作成 |
| GPT-6 Sol | $2 | $10 | 1.05M / 128K token | 複雑なコーディングとAgentic workflow |
| GPT-6 Luna | $0.10 | $0.50 | 1.05M / 128K token | 範囲のはっきりした仕事や大量処理を低価格でこなす |
価格は標準APIの入力・出力token単価です。キャッシュ利用などの料金条件は別にあります。Sonnet 5.5のコンテキスト長は第三者のVals AIとArtificial Analysisの公開モデル情報、Opus 5.5はAnthropicのPlatform資料、GPT-6各モデルはOpenAI APIカタログで確認できます。サブスクリプションで使う場合は、APIの従量課金と利用枠が別なので、表の単価だけで月額プランの費用を推定することはできません。
出典:Anthropic「Introducing Claude Sonnet 5.5」、Anthropic「Introducing Claude Opus 5.5」、Claude Platform「Claude Opus 5.5」、OpenAI API Model Catalog、Vals AI「Claude Sonnet 5.5」。
Sonnet 5から何が変わった?
公式発表で目を引くのが、ターミナル上で複数手順の作業を進める能力を測るTerminal-Bench 4.0です。Anthropic公表値ではSonnet 5.5が70.6%、Sonnet 5が10.3%でした。大きな改善を示す結果ですが、この数字だけであらゆるコーディングや仕事が約7倍良くなったとは言えません。ベンチマークが測る作業、実行環境、モデルの設定が限られているためです。
Anthropicの比較表では、GDPval-AA v2.1がSonnet 5の1449からSonnet 5.5の1844へ、CursorBench 4.0が34.1%から55.5%へ上がっています。実務を模した知識労働や複数ファイルのコーディング課題でも前進が見られます。一方で、同じ表の数値は評価ごとに条件が異なり、Sonnet 5.5をいつも同一設定で測った一つの総合スコアではありません。
Opus 5.5を超えたわけではない
Sonnet 5.5とOpus 5.5を比べたAnthropicの主要8評価を見ると、Terminal-Bench 4.0ではSonnet 5.5が70.6%でOpus 5.5の66.4%を上回ります。しかし残る7項目ではOpus 5.5が上回っています。Anthropic自身も、Sonnetが一部の評価でOpusに匹敵する一方、複雑で答えが開かれた仕事や、長く続く判断が必要な仕事ではOpusが明確に強いと説明しています。
| 評価 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% |
| FrontierCode 1.1 Main | 52.1%(Xhigh) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
| AA-Briefcase v1.1 | 1811 | 1822 |
| Humanity's Last Exam | 64.5% | 67.7% |
| OSWorld 2.1 | 80.1% | 81.8% |
| Chartography | 61.6% | 64.4% |
つまり、この8項目の結果から「SonnetのほうがOpusより高性能」と一般化することはできません。反対に、Sonnetが明確に上回る評価もあります。たとえばTerminal-Benchは、限られたターミナル作業でSonnetの強さを示す材料です。どの種類の仕事を評価するかによって、見える差は変わります。
なお、FrontierCodeのSonnet値はreasoning effortによって異なり、表にはXhighの52.1%を記載しました。Anthropicの同じ発表ではMax設定で46.2%です。比較表の条件を確認せず、数字だけを横に並べないことも大切です。
出典:Anthropic「Sonnet 5.5 Performance」。
それでもSonnet 5.5が注目される理由
Opus 5.5のAPI標準単価は入力$4・出力$20、Sonnet 5.5は入力$2・出力$10です。Sonnetはtoken単価が半分で、Anthropicは出力速度もSonnet 5より30%以上速いとしています。明確な修正や実装、短い反復を何度も行う仕事で、Opus級に近い結果が必要なければ、Sonnetを選ぶことで待ち時間やAPI費用を抑えられる可能性があります。
ただし、token単価が半分なら仕事全体も必ず半額、というわけではありません。実際のタスク費用は、入力や出力の長さ、キャッシュ、reasoning effort、やり直しの回数、ツール呼び出しなどで変わります。Anthropicが述べる「最大約30%低コスト」はSonnet 5との比較であり、Opus 5.5との比較ではありません。
Sonnet 5.5とOpus 5.5の使い分け
直す場所や要件が比較的はっきりしたバグ修正、既存仕様に沿った実装、短い開発サイクル、文書・スライド・表計算資料の作成。
要件が曖昧な設計、大規模な移行や監査、複数の制約を整理し続ける必要がある長時間Agent作業、判断を積み重ねる知識労働。
これは用途の目安であり、同じ作業でも、コンテキストの渡し方やツール、必要な品質で結果は変わります。まずSonnetで進め、難所で判断が揺れる、変更範囲が広がる、何度も修正が必要になる、といった場合にOpusへ切り替える方法も考えられます。
GPT-6と比べるときは、役割と条件をそろえる
OpenAIはAstraを最も難しい一連の仕事向け、Solを複雑なコーディングやAgent型workflow向け、Lunaを範囲のはっきりした大量処理向けとして案内しています。これはOpenAIのモデル内での役割です。AnthropicのOpus / Sonnetの階層をそのまま重ねて、会社をまたいだ総合順位にすることはできません。
Sonnet 5.5とGPT-6 Solは、標準APIの入力$2・出力$10という単価が同じで、仕事の規模も近い範囲で比較しやすい組み合わせです。ただし単価が同じだから、速度・出力品質・タスク費用まで同じという意味ではありません。実際の仕事に近いテストを、同じ入力・ツール・effort・判定基準で比べるのが現実的です。
GPT-6 AstraはOpenAIの最上位モデルとして難しい端から端までの作業を担当し、API単価も高めです。一方、第三者評価でSonnetがAstraを上回る個別課題があったとしても、その課題の種類・測定条件の範囲に限った結果です。どちらかがモデル全体で上、と読み替えることはできません。
GPT-6 Lunaは、Sonnet 5.5やSolとは異なる価格帯です。入力$0.10・出力$0.50はSonnet 5.5 / Solの20分の1。大量処理や繰り返しの多い明確なタスクでは、最高性能を狙うよりも、必要な品質を低い費用で満たせるかが選択の軸になります。Lunaを一律に「性能が低いから不要」と見るのではなく、実際の作業で求める品質とコストを測って判断できます。
Claude 5.5
複雑・大規模・長時間・高度な判断
日常的な開発・修正・反復・資料作成
GPT-6
最難関のend-to-end work
complex coding / agentic workflows
focused / high-volume。コストを抑えたい定型処理
GPT-6ファミリーの違いを詳しく見たい方は、GPT-6 Astra・Sol・Lunaの比較記事もご覧ください。
出典:OpenAI「Introducing GPT-6 Sol and Luna」、OpenAI API「Model guidance」。
Vals AIの公開評価が示すこと
Vals AIのVals Indexでは、Sonnet 5.5は69.22%(±0.96)、Opus 5.5は69.69%(±0.94)でした。数値の差は小さく、示された誤差幅も重なっています。Vals Indexが集めたタスク群でSonnet 5.5がOpus 5.5にかなり近い結果だった、と読むのが適切です。「モデル性能がほぼ同じ」や「Sonnetが実質Opus」という意味ではありません。
同じValsの公開値ではGPT-6 Astraが66.61%、Solが62.57%(±0.95)、Lunaが58.45%(±1.11)です。またCode MigrationではSonnet 5.5が69.83%で、GPT-6 Astraの67.74%を上回る個別結果も掲載されています。これはValsのその評価での結果であって、モデル全体の序列ではありません。Vals Index自体も、金融・コーディング・法律などの仕事をまとめた一つの評価設計です。
| モデル | Vals Index |
|---|---|
| Claude | |
| Opus 5.5 | 69.69% ± 0.94 |
| Sonnet 5.5 | 69.22% ± 0.96 |
| GPT-6 | |
| Astra | 66.61% |
| Sol | 62.57% ± 0.95 |
| Luna | 58.45% ± 1.11 |
第三者のArtificial Analysisは別の評価セットと独自のIntelligence Indexを公開しています。Sonnet 5.5はeffort別にスコアが異なり、同社の計算による評価タスク費用にも大きな差があります。評価方法が違えば点数の意味も変わるため、Valsのスコアと混ぜて一つの順位表にするのではなく、それぞれが何を測り、どの設定で走らせたかを確認しましょう。
出典:Vals AI「Claude Sonnet 5.5」、Vals AI「GPT-6 Sol」、Vals AI「GPT-6 Luna」、Artificial Analysis「Claude Sonnet 5.5」。
ベンチマークだけではモデルを選べない
一つの評価で下位tierのモデルが上位tierを上回ることはあります。試験の作り、対象タスク、使ったツール、推論設定、試行回数が違うからです。また、短い正答を測る評価と、何時間も作業を続けて範囲を守りながら成果物を完成させる仕事では、必要な力も違います。
ベンチマークは候補を絞る手がかりです。最終的には、自分の仕事から代表的な課題を選び、正しさだけでなく、手戻り、処理時間、費用、指示の範囲を守れたかも確認して選ぶのがよいでしょう。
Maxにすれば必ず良くなるわけではない
AnthropicのFrontierCode 1.1では、Sonnet 5.5はMax effortで46.2%、Xhighで52.1%でした。最大の設定が最高得点ではありませんでした。Anthropicによると、MaxではClaude Codeのcode-review skillが多数のsubagentに処理を分けることがあり、タイムアウトや依頼範囲を越えた編集が発生して評価を下げたケースがありました。
これは「Maxは悪い」という話ではなく、推論を長くすれば常に良い成果になるわけではない、という例です。作業の難しさ、許容できる時間と費用、指示から逸れず完了することのどれを重視するかに合わせてeffortを選び、よくある仕事で確かめるのが実用的です。
まとめ:Sonnetの役割が広がり、Opusの出番も明確に
Claude Opus 5.5が上位モデルという関係は変わりません。複雑で答えが開かれた課題、長時間のAgent作業、継続的な判断では、AnthropicはOpus 5.5をより強い選択肢として案内しています。
今回大きく変わったのは、Sonnet 5.5がより速く、Sonnet 5と同じtoken単価で、Opusに近い評価結果を出す仕事の範囲が広がったことです。GPT-6を含めて選ぶときも、モデル名や単価だけで決めず、作業の難しさ、速度、API費用、reasoning effort、そして実際の成果物を合わせて比べてみてください。
コメント 0
まだコメントはありません。最初のコメントを書いてみませんか?