GPT-6 Astraに続いてSolとLunaが加わり、GPT-6は「最も高性能なモデルを選ぶ」だけでなく、「普段の仕事をどのモデルから始めるか」を考えやすい3段階になりました。この記事ではGPT-5.6 Sol / Terra / Lunaと比べ、公開ベンチマーク、API価格、筆者の実使用感を分けて見ていきます。

先に結論:筆者の現在の使い方では、GPT-6 Lunaを日常作業の最初の選択肢にするのが現実的です。Lunaで詰まる難しい調査や設計はSolへ、さらに難しい課題はAstraへ段階的に上げます。ただし、LunaがGPT-5.6 Terraをあらゆる仕事で上回ると証明されたわけではありません。

情報確認日:2026年9月26日。利用できるモデル、料金、契約プランの条件は変更されることがあります。

GPT-6シリーズの位置づけ

OpenAIはGPT-6を、能力とコストの異なるAstra、Sol、Lunaとして提供しています。Astraは難しい専門的な仕事で高い能力を狙うモデル、Solは能力と利用しやすさのバランス、Lunaは軽快さと低コストを重視したモデルです。SolとLunaはGPT-6 Astraの進歩を、より速く手頃なモデルへ広げる位置づけとされています。

GPT-5.6にもSol、Terra、Lunaがあり、公式ガイドではSolを複雑な専門作業向け、Terraを能力とコストのバランス、Lunaをコスト重視の高頻度利用向けと説明しています。世代間で同じ名前のモデルが一対一で置き換わるというより、各世代の中で能力と効率の段階が並んでいると考えると分かりやすいでしょう。

GPT-5.6からモデル階層はどう変わった?

GPT-5.6時代の筆者の使い分け

Luna:軽作業

Terra:普段の開発

Sol:難しい仕事

GPT-6時代の現在の使い分け

Luna:軽作業から普通の実務まで、まず任せる

Sol:Lunaでは厳しい仕事

Astra:本当に難しい仕事

これは筆者の仕事の進め方を表した図で、公式のモデル対応表ではありません。モデルの得意不得意はタスクや設定、使うツールによって変わります。

公開評価で分かること、分からないこと

OpenAIが公開した個別の評価では、GPT-6 LunaはDeepSWE v1.1の複雑なソフトウェア開発課題で、最大推論設定時に66.6%を記録しました。またOSWorld 2.0のオフライン評価について、GPT-6 Luna(max)がGPT-5.6 Sol(medium)を上回ったと発表しています。Computer Useの評価は画面を見て操作する課題を測るもので、一般的なコーディング能力や全タスクの優劣を直接示すものではありません。

こうした結果は、GPT-6 Lunaが単純作業専用ではなく、ソフトウェア開発やコンピューター操作にも高い能力を持つことを示す材料です。一方、公開評価だけからGPT-6 LunaとGPT-5.6 Terraをすべての仕事で順位づけすることはできません。タスク、推論設定、ツール、採点方法が違えば結果の意味も変わります。

記事向けの概算能力イメージ

※OpenAI公式スコアではありません。公開された複数の評価や実務特性を記事向けに整理した筆者の概算目安です。1〜2点差に科学的な意味はなく、タスク別の勝敗や公式の総合順位を表しません。

GPT-6 LunaはGPT-5.6 Terraを置き換えられる?

筆者が日常的に行っている開発作業では、GPT-6 LunaはGPT-5.6 Terraと同等クラス、用途によってはそれ以上に感じます。通常のコード実装、仕様が明確な修正、調査、テスト、実装後の動作確認、ブラウザ操作、Simulator操作、一般的な文章作成、データ処理では、TerraからLunaに変えて大きく性能が落ちたと感じる場面は今のところ多くありません。

これは筆者個人の使用感であり、同一課題を統制して比較した公開ベンチマークではありません。公式情報として言えるのは、GPT-6 Lunaが旧世代から能力を伸ばし、コーディングやComputer Useの公開評価でも高い結果を示していることです。筆者の体感と公式評価は別の種類の情報として読んでください。

実際に使ってみた筆者の印象

GPT-6 Lunaを使い始めて最も驚いたのは、「軽量モデルを使っている」という感覚がかなり薄いことです。これまで普段の開発ではGPT-5.6 Terraを選ぶことが多かったのですが、現在のところGPT-6 Lunaでも同程度に仕事を任せられる場面がかなり多いと感じています。用途によっては、GPT-5.6 Terra以上に感じることもあります。

それ以上に大きいのが、サブスクリプション利用時のコスト感です。GPT-5.6 Terraでは長時間使うと利用枠を多少意識していました。一方、筆者の現在の利用範囲では、GPT-6 Lunaに変えてから利用枠をほとんど意識しなくなりました。よほど大量・長時間の作業でなければ、使い放題に近い感覚で使えると思うほどです。

もちろん、GPT-6 Lunaに利用制限がないという意味ではありません。契約プランやタスク量、コンテキスト、推論設定、ツール利用、実行時間、サービス側の条件で変わります。これはあくまで筆者の使い方での感想です。

筆者自身は「まずLunaを使い、本当に必要なときだけSolやAstraへ上げる」運用を試しています。

実装後の動作確認ならLunaでも十分な場面が多い

仕様が決まった修正を実装し、ブラウザやSimulatorで画面を開き、決められた手順で動作を確認する作業は、原因をゼロから探す仕事とは別です。確認項目と期待結果がはっきりしているなら、画面操作やフォーム入力、表示の確認、結果の報告までをGPT-6 Lunaから始めるのは合理的です。

OpenAIはGPT-6 LunaについてComputer Use対応を案内し、OSWorld 2.0の評価結果も公表しています。これは実際の操作を任せる根拠の一つですが、環境によって操作の安定性は変わります。重要な変更は、結果を人が確認する運用も残しておきましょう。

原因不明の不具合調査ではSolやAstraへ

「何が原因か分からない」「再現条件が定まらない」「複数のSubsystemをまたいでいる」といった調査では、仮説を立て、ログやコードを広く追い、検証を重ねる必要があります。こうした長い推論や設計判断ではSolやAstraへ上げる価値があります。Lunaで何度も試して進まないときは、同じやり方を続けるよりモデルを上げた方が早く収束する場合があります。

つまり、Lunaを最初に選ぶことは、どんな仕事もLunaだけで完結させるという意味ではありません。仕事の難しさに合わせて上位モデルへ移る段階的な使い方です。

コーディングとComputer Useの公開評価

OpenAIの発表では、DeepSWE v1.1でGPT-6 Solが最大推論時に68.8%、GPT-6 Lunaが最大推論時に66.6%でした。OSWorld 2.0では、GPT-6 Luna(max)がGPT-5.6 Sol(medium)を上回ったとされています。これらはそれぞれ異なる条件とベンチマークでの結果なので、点数をそのまま普段の開発速度や正答率に読み替えることはできません。

実務では、コードを書く能力だけでなく、指示の理解、ツールの選び方、作業の粘り強さ、検証の質が結果を左右します。公開ベンチマークは選択の参考になりますが、自分のリポジトリや作業手順で試した感触もあわせて判断するのがよいでしょう。

API料金を比較

以下は100万トークンあたりの標準API価格です。GPT-5.6 Solの価格は公式Pricingページに掲載されたプロモーション価格(少なくとも2026年11月21日まで)を含みます。キャッシュ済み入力、長いコンテキスト、Fast modeなどは別料金になるため、実際の請求額は利用条件で変わります。

モデル入力 / 100万token出力 / 100万token位置づけ
GPT-6 Astra$10.00$50.00最も難しい作業を狙う
GPT-6 Sol$2.00$10.00高い能力と価格のバランス
GPT-6 Luna$0.10$0.50軽快さと大量利用
GPT-5.6 Sol$4.00$20.00複雑な専門作業
GPT-5.6 Terra$2.00$12.00能力と価格のバランス
GPT-5.6 Luna$0.20$1.20低コストの高頻度利用

入力10万token、出力2万tokenを使った場合の単純な試算です。キャッシュやツール料金などは含みません。

APIはトークンごとの従量課金です。ChatGPT Work / Codexのサブスクリプション利用枠とは別の仕組みです。

ChatGPT Work / Codexの利用枠はAPI料金とは別

ChatGPT Work / Codexでは契約プランに含まれる利用枠を使い、APIではトークン量などに応じて料金が発生します。API単価が安いからサブスクリプションで100倍使える、という関係ではありません。Workの利用量はCodexと同じ利用構造ですが、タスクや入力・出力の大きさ、推論設定、Fast modeなどによって変動します。

2026年9月26日時点で確認できた公式案内には、GPT-6 Sol / Lunaを含む6モデルすべてについて、同一条件で比較できる「Plusで5時間あたり何メッセージ」という公開値は見当たりませんでした。そのため、未公表の上限を推定した数字や、異なる条件の数字を同じグラフに並べることはしていません。最新の契約別条件はOpenAI Help CenterのWork / Codex利用案内で確認してください。

筆者の体感では、GPT-5.6 Terraを使っていた頃より、GPT-6 Lunaでは利用枠に対する心理的な制約が大幅に小さくなりました。「よほど重い使い方をしなければ使い放題に近い」と感じることもありますが、利用制限がなくなったわけではなく、他の利用者にも同じ体感が当てはまるとは限りません。

用途別にどのモデルを選ぶ?

作業まず試す難しいとき選び方の目安
定型文、Localization、データ変換GPT-6 LunaGPT-6 Sol大量処理や仕様が明確な作業から
文章作成、調査、通常のコード実装GPT-6 LunaGPT-6 SolまずLunaで試し、修正の往復が増えたら上げる
実装後のブラウザ / Simulator確認GPT-6 LunaGPT-6 Sol手順と期待結果を具体的に渡す
普通のバグ修正GPT-6 LunaGPT-6 Sol原因が見えていて局所的ならLunaから
原因不明、複数Subsystemの不具合GPT-6 SolGPT-6 Astra広い調査や長い推論が必要なとき
高度なアーキテクチャ判断、大規模監査GPT-6 SolGPT-6 Astra影響範囲や失敗コストが大きい仕事

GPT-6 Lunaをデフォルトにしていい?

筆者の答えは「多くの実務で、まずLunaから始めてよい」です。GPT-5.6時代はLunaを軽作業、Terraを普段使い、Solを難しい仕事に選ぶことが多くありました。いまはGPT-6 Lunaに普段の開発や動作確認もまず任せ、難しさに応じて上げる運用が、自分の作業では現実的になっています。

GPT-6 Luna
通常の実装、文章、調査、確認
↓ 必要ならGPT-6 Sol
複雑な調査、難しい修正
↓ さらに必要ならGPT-6 Astra
本当に難しい設計・根本原因調査

これはSolやAstraが不要という意味ではありません。簡単な変更に常に最上位モデルを使う必要も、難しい問題を軽量モデルだけで何度も試す必要もありません。Lunaで始めて、詰まったらSol、さらに難しければAstraへ上げることで、能力と利用枠のバランスを取りやすくなります。

「GPT-6 LunaはGPT-5.6 Terraの完全な上位互換」とは言えません。ただ、筆者が日常的に行う仕事では同等クラス、用途によってはそれ以上に感じられ、置き換え候補として十分に試す価値があります。軽量モデルの性能水準が上がったことで、上位モデルを常用しなくてもよい仕事が増えた可能性こそ、今回の世代交代で注目したい点です。

出典

公式の発表・価格・利用条件と、筆者による実使用の感想、記事向け概算スコアを本文中で区別しています。価格・サービス仕様は2026年9月26日に確認しました。