目次
連休に持っていく荷物は、少ないほど身軽だ。でも、肝心の道具を置いてきたら、現地で買い直すことになる。AIのモデル選びも、少し似ている。
2026年のシルバーウィーク、OpenAIのGPT-6 Sol・GPT-6 Lunaと、AnthropicのClaude Opus 5.5が登場した。公式の発表日表記はいずれも9月22日。日本から見た時刻とは区別するが、同じ日に並んだ三つの選択肢である。[1][2]
面白いのは、全員が同じ方向へ走っていないことだ。安く大量に働く道と、難しい仕事の完成度を上げる道。その違いを「どれが最強?」だけで片付けるには、今回の価格差は大きすぎる。
1. 結論:買うべきなのは「知能」より、合格する仕事
先に選び方を示そう。定型処理はLunaから、日常の開発はSolを基準に、複雑な成果物はOpus 5.5と比較する。最後は、合格した仕事一件あたりの総費用で決める。 これは公表仕様と評価から導く本記事の提案であり、三機種を同じ業務で実測したレビューではない。
Lunaは、高頻度の処理を小さな単価で回す候補。Solは、価格を抑えつつコーディングや複数手順の仕事を任せる候補。Opus 5.5は、長い開発作業や知識労働の完成度を重視するときの候補になる。メーカー自身の位置づけも、Solは複雑な開発・エージェント処理、Lunaは対象を絞った大量処理、Opusは長時間の開発・知識労働だ。[3][4][5]
ただし、メールを分類する人と、既存システムの移行を任せる人では「合格」が違う。前者は決まったラベルと形式が正しければよいかもしれない。後者は、動くコード、既存機能の維持、説明可能な差分まで必要だ。会話が気持ちよく続くことと、仕事が終わることも別である。
この記事は2026年9月23日確認時点の比較。公式仕様、外部の測定、筆者の試算・提案を区別する。発売直後のため、日常業務における長期安定性や日本語の細かな文体差まで、確定した順位としては扱わない。
2. 価格は1:20:40。ただし「何の料金か」が先
まずAPIの標準料金を見る。APIとは、アプリやプログラムからモデルを呼び出す従量課金の窓口だ。以下は米ドル、100万トークンあたり。トークンは文章を処理する単位で、日本語の文字数とは一対一で対応しない。
| モデル | 通常入力 | キャッシュ読込 | 出力 |
|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | $0.50 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 |
| Claude Opus 5.5 | $4.00 | $0.20 | $20.00 |
OpenAI側は入力272Kトークン以下のStandard料金。Opusは通常料金。税、地域指定、ツール利用、キャッシュ作成などは含めていない。料金表とモデル資料で確認した。[1][6][5]
通常入力と出力の単価は、Luna:Sol:Opusで1:20:40。同じ量を読み、同じ量を出すなら、SolはOpusの半額、LunaはOpusの40分の1になる。しかし、長く考えたり、何度もツールを呼んだりすれば、消費量自体が変わる。単価比は、そのまま請求額の比ではない。
もう一つ、キャッシュ読込ではSolとOpusが同じ$0.20だ。同じ長い資料を繰り返し渡す仕事では、通常入力の2倍差だけを見ていると判断を誤る。キャッシュとは、すでに処理した入力の一部を再利用する仕組みで、全部の入力に自動的に最安料金が当たるわけではない。
月額プランの比較に、この表を流用しない
ChatGPTやClaudeの月額プラン、CodexやClaude Codeの利用枠は、API単価と別の比較軸だ。APIが半額になったから月額料金も半額、あるいは使える回数が必ず倍、とは計算できない。 契約画面の対象モデル、上限、追加利用の扱いを見る必要がある。
個人で一日数回使うなら、数セントより「今のアプリから使いやすいか」「毎回説明し直さずに済むか」が効く。サービス側で一日何万回も呼ぶなら、単価と失敗率の小さな差が効く。同じコスパという言葉でも、家計とサービスの原価計算では主役が違う。
3. 精度はOpusが強い。ではSolとLunaを選ぶ理由は?
三者を同じ評価元で見るため、Artificial Analysisのモデルページを参照する。Intelligence Indexは複数の評価をまとめた指標で、正答率そのものではない。下表は各モデルのmax設定、OpusはDefault Fallbackありの掲載値だ。[7][8][9][10]
| モデル・評価条件 | Intelligence Index | 評価タスクあたり費用 |
|---|---|---|
| Luna・max | 37 | $0.07 |
| Sol・max | 48 | $1.06 |
| Opus 5.5・max/fallbackあり | 58 | $5.98 |
確認時点の指標ではOpusが上位で、費用も高い。58は「58%正解」ではなく、48に対して「約21%頭がよい」と割り算する数字でもない。 費用も、その評価群での加重平均であり、自分の議事録一件の相場ではない。maxという名前が同じでも、各社の計算量や時間が同じとは限らない。
ここで見えてくるのは、価格の段差が性能の段差よりずっと大きいこと。Lunaで満点を取れる仕事に、毎回Opusを使う必要はない。一方、Solでは重要な条件を落とす仕事に対して、単価だけでSolを選び続けるのも合理的ではない。
「6になったから全面勝利」とは言えない
Artificial Analysisの発売時分析では、GPT-6 Sol/Lunaは前世代と比べ、改善する評価と下がる評価が混在している。Codex環境のCoding Agent IndexはSolが55→57、Lunaが43→41。価格効率の改善と、全領域での能力向上は分けて読むべきだ。[11]
これは今回の面白いところだ。モデル更新の価値は、今まで解けなかった問題を解くことだけではない。以前は費用が合わず諦めた仕事を、毎日回せるようにすることにもある。商品説明の整形、問い合わせの仕分け、テスト候補の下書きなどでは、十分な品質を安く反復できる価値が大きい。
見栄えが似ていても、条件の抜けは拡大して見ないと分からない。精度は、仕事ごとの合格条件で測る。
ベンチマークの数字にも「撮影条件」がある
Anthropicの発表ではTerminal-Bench 4.0が66.4%。一方、Artificial Analysisの発売時分析は59.6%と報告している。これは同じ試験名なら全条件が同じ、とは限らないことを示す。Anthropic側はxhigh、標準誤差±2.6ポイントと記載し、安全措置が介入した課題では別モデルが担当する条件も説明している。別の評価環境の値を、一枚の表に無注記で混ぜてはいけない。[2][12]
総合指標から日本語メールの敬語、社内略語、曖昧な依頼への確認能力まで直接推定するのも危うい。読者が知りたい「精度」を、事実の正しさ、指示遵守、完成物の動作、文章の好みへ分けると、試すべきことが見える。
4. 1,000件で$2.50、$50、$100。その差は人の何分?
ここからは実測ではなく、単価を使ったモデル試算だ。1件につき通常入力10,000トークン、課金対象の出力3,000トークン、同じ仕事を1,000件処理すると仮定する。入力はキャッシュなし。出力には、課金される推論分も含めた総量を置く。検索・実行環境・地域指定・税・再試行・人の作業費はまだ含めない。[6][5][13]
| モデル | 1件の計算 | 1,000件のAPI費用 |
|---|---|---|
| Luna | 0.01 × $0.10 + 0.003 × $0.50 | $2.50 |
| Sol | 0.01 × $2 + 0.003 × $10 | $50.00 |
| Opus 5.5 | 0.01 × $4 + 0.003 × $20 | $100.00 |
数字だけならLunaの圧勝に見える。では、Lunaの結果を直すために、Solより合計2時間多く人が働いたらどうなるか。人の時間を仮に$30/時と評価すると、追加費用は$60。節約した$47.50を超える。
同じ仮定なら、LunaとSolの損益分岐は1,000件合計で95分、SolとOpusは100分だ。後者は1件平均6秒。Opusが本当にそれだけ確認時間を減らせるなら、API差額を回収できる。ただし「Opusなら必ず6秒減る」という実験結果ではない。各自が測るべき境界を計算しただけである。
この考え方は反対方向にも働く。出力を機械的に検証でき、人の手直しが不要な分類なら、安いモデルの強みはそのまま残る。高いモデルに変えれば必ずレビューが減るわけでもない。長すぎる回答によって、読む時間が増える可能性だってある。
使う式はシンプルでいい。
合格一件あたりの費用 =(API・ツール・再試行の費用 + 人の確認・修正費)÷ 合格件数
失敗した依頼を分母から消して費用もなかったことにしない。やり直して成功した一件は、二回分の費用を背負う。途中で放棄した仕事にもコストは残る。この式なら、速い返答だけで終わらないAI選びができる。
単価の節約は小さくても積み上がる。人が読み直す時間も、同じように積み上がる。
5. キャッシュ・長文・考える量で、値札の印象は変わる
キャッシュ主体ならSolとOpusの差は縮む
仮に1回の入力10万トークンのうち、9万がキャッシュ読込、1万が通常入力、出力が3,000トークンとする。既にキャッシュが存在する一回分の試算では、Solは$0.068、Opusは$0.118。差は約1.74倍で、通常入出力の2倍より小さい。キャッシュ作成費は別途必要で、保持期間内に再利用できることが条件だ。[6][5]
この差が重要なのは、長い仕様書や共通指示を繰り返すエージェントだ。一方、毎回まったく違う短文を処理するなら、キャッシュの恩恵を当てにしすぎない。割引率だけでなく、自分の入力の何割が実際にヒットしたかを見る。
同じ資料を何度も読む仕事では、再利用できる入力が費用を変える。ただし、保存と再利用には条件がある。
272Kを越えた長文は、別の値札になる
Sol/Lunaは入力272Kトークンを超えると、リクエスト全体の入力・キャッシュ料金が2倍、出力が1.5倍になる。超えた部分だけへの割増ではない。Solの通常入力は$4、出力は$15へ変わる。資料を大量に詰める運用では、最初の料金表だけで予算を組めない。[3][4][6]
公式のコンテキスト容量はSol/Lunaが1,050,000、Opusが1,000,000トークン、通常の最大出力はともに128,000。だが、大きな箱に入ることと、箱の中身を正しく使えることは違う。大量の資料から一つの例外を拾う仕事なら、投入量と回答の根拠を一緒に測ろう。[3][4][5]
「短い答えだったから安い」とも限らない
OpenAIでは、画面に見えない推論トークンも出力として課金される。結論が三行でも、内部で長く考えれば使用量は増える。最終文章の長さから請求額を推測せず、usageを見る。[13]
Opusについても、メーカーの「Opus 5比で実行費用約40%減」と、外部評価のmax設定での費用は同じ話ではない。Artificial Analysisは、maxで出力トークンが前世代の約1.6倍となり、タスク費用は前世代と同程度だったと報告する。対象業務と設定によって、値下げ分をより多くの思考に使うことがある。[2][12]
安さを調べる実験では、モデル名だけでなく推論設定も記録する。最高設定は「常に一番得」という意味ではない。簡単な仕事まで最長の思考を要求する必要があるか、先に疑ってみる価値がある。
6. 速さ、文章、開発体験──点数表に収まらない比較
速さには少なくとも三種類ある。返答が始まるまでの待ち時間、文字が流れる速度、仕事が完了するまでの時間だ。コードが勢いよく表示されても、その後に三度直せば、完成は遅い。別のタブで作業できる待ち時間と、画面の前で判断を待つ時間の負担も違う。
Opus 5.5のFast modeは、公式資料では出力速度が最大2.5倍、通常の2倍のトークン単価で提供される。「最大」は常時保証ではなく、出力速度の改善はそのまま作業全体の2.5倍速を意味しない。締切のある対話作業と、夜間に流す仕事では、払う価値が変わる。[14]
文章の比較では、好みを精度と混ぜないようにしたい。日本語の社内メールなら、禁止語を守るか、相手との距離感が合うか、不要な断言を足さないか。調査文なら、出典が存在するか、引用が主張を支えるか。コードなら、テストに通るだけでなく、依頼外の変更を増やしていないかを見る。
同じモデルでも、渡す資料、検索手段、編集ツール、テスト環境で仕事の結果は変わる。モデルをエンジンに例えるなら、エージェントのアプリは車体と運転装置だ。普段のアプリを丸ごと比べる実験と、同じツール環境でモデルだけ替える実験は、両方有益だが答える問いが違う。
APIを自作している人には、移行費用もある。Opus 5.5では思考の無効化ができず、強制的なツール指定など既存設定に破壊的変更がある。Sol/Lunaも、Chat Completionsでのfunction callingは推論設定noneに限られるため、推論とツールを組み合わせるならResponses APIの仕様を確認する。名前を一文字替えるだけで移行完了、と決めつけない。[15][3][4]
7. 仕事別の使い分け:安い入口と、難所を任せる先
ここからは測定済みの万能ランキングではなく、試す順番の提案だ。条件が固定され、合否を安く判定できる仕事ほど、Lunaから試す理由が強い。
| 仕事 | 最初に試す候補 | 合格を決めるもの |
|---|---|---|
| 分類・項目抽出・整形 | Luna | ラベル、必須項目、出力形式 |
| 日常のコード修正 | Sol | 再現テスト、既存機能、差分範囲 |
| 複雑な調査・資料作成 | Opus 5.5とSol | 根拠、条件漏れ、修正時間 |
| 大規模な移行・長時間の開発 | Opus 5.5とSol | 節目の成果、総費用、完了率 |
| 日本語の文章制作 | 三者を匿名で比較 | 事実、文体、編集の手間 |
たとえば問い合わせ処理なら、Lunaが分類し、曖昧な案件だけSolへ送る方法がある。ただし、AI本人の「自信があります」だけを通行証にしない。必須項目が欠けている、根拠箇所が見つからない、既知の例外条件に当たる、といった外から確認できる条件で振り分ける。
前章の1件入力1万・出力3,000トークンの仮定で、まず1,000件をLunaに通し、100件を同じ使用量でSolに再処理させるなら、API費用は$2.50+$5=$7.50。全件Solの$50より低い。これは検証器・振り分け・追加文脈の費用を除いた試算であり、正解率の保証はない。振り分けを間違えれば、安く間違いを量産する仕組みにもなる。
逆に、依頼そのものが曖昧で、一度の誤判断が後工程を大きく壊すなら、最初から強い候補を使う方がよい場合もある。安いモデルを前段に置くこと自体を目的にしない。段数を増やすほど、受け渡しと検証の仕事も増える。
すべての工程に同じ道具を使わなくていい。受け渡す条件と、最後の検品が仕事をつなぐ。
8. 連休明けに残すのは、推しモデルより「自分の試験」
新モデルの発表を追う楽しさと、日々の仕事で使い続ける判断は両立できる。シルバーウィークの締めくくりに、小さな比較セットを一つ作っておくと、次の新製品が出ても使い回せる。
本記事の提案は、実際の仕事20件を、各モデルで3回ずつ試すこと。 20件も3回も公式の推奨値ではなく、最初の偏りや偶然を見るための小規模な出発点だ。これで統計的な優劣が確定するわけではない。簡単なもの、判断が必要なもの、以前失敗したものを混ぜる。
- 同じ材料を渡す。 プロンプト、資料、ツール、時間上限を固定し、モデル名・推論設定・実行日を残す。
- 採点基準を先に書く。 必須条件、重大な誤り、許容できる修正の範囲を決め、できればモデル名を隠して採点する。
- 請求と人の時間を両方記録する。 入力・キャッシュ・出力、ツール費、再試行、確認と修正の分数を残す。
- 失敗を種類で分ける。 知識不足、指示の取りこぼし、ツール失敗、出力形式、単なる文体の好みを混ぜない。
- 合格する中で安い構成を選ぶ。 重大な失敗が残る用途は対象外にし、資料や検証方法を直してから再評価する。
発売日の勝者が、そのまま自分の仕事の勝者になるとは限らない。今回の三者がくれたのは、単一の王者というより、選べる予算と完成度の幅だ。
Lunaで十分な仕事を見つければ、AIを使える場所が増える。Solが安定して合格するなら、日常の相棒にできる。Opusが難しい仕事の修正時間を減らすなら、上乗せの料金には理由が生まれる。「一番賢いのはどれ?」の次に、「自分の仕事を、いくらで終わらせる?」と聞く。 そこから、比較が生活や仕事に役立つ道具になる。
本記事の画像はAI生成の概念表現。費用試算は記載した条件だけを用いた計算で、性能実測・料金保証・特定プランの利用枠を示すものではない。価格と提供条件は変更されうるため、導入時にはリンク先を確認してほしい。
参考文献・出典
- [1]OpenAI, API Changelog — September 22, 2026。発売日、API、272K以下の標準単価。2026-09-23確認。 ↩
- [2]Anthropic, Introducing Claude Opus 5.5。2026-09-22発表、メーカー評価・設定・費用削減の説明。2026-09-23確認。 ↩
- [3]OpenAI, GPT-6 Sol。仕様・推論設定・長文料金条件。2026-09-23確認。 ↩
- [4]OpenAI, GPT-6 Luna。仕様・用途・料金条件。2026-09-23確認。 ↩
- [5]Anthropic, Claude Opus 5.5 overview。単価、キャッシュ、コンテキスト、標準最大出力。2026-09-23確認。 ↩
- [6]OpenAI, API Pricing。Standardの短文・長文、キャッシュ等。2026-09-23確認。 ↩
- [7]Artificial Analysis, GPT-6 Sol (max)。Index 48、タスク費用$1.06。2026-09-23確認。 ↩
- [8]Artificial Analysis, GPT-6 Luna (max)。Index 37、タスク費用$0.07。2026-09-23確認。 ↩
- [9]Artificial Analysis, Claude Opus 5.5 — max, default fallback。Index 58、タスク費用$5.98。2026-09-23確認。 ↩
- [10]Artificial Analysis, Benchmarking methodology。評価方法と速度等の指標。2026-09-23確認。 ↩
- [11]Artificial Analysis, GPT-6 Sol and Luna push the cost efficiency frontier。2026-09-22の発売時分析。2026-09-23確認。 ↩
- [12]Artificial Analysis, Claude Opus 5.5 takes the top spot。2026-09-22の発売時分析、評価値と出力トークン。2026-09-23確認。 ↩
- [13]OpenAI, Reasoning models。推論トークンの課金とusage。2026-09-23確認。 ↩
- [14]Anthropic, Fast mode。出力速度と追加料金。2026-09-23確認。 ↩
- [15]Anthropic, Migrating to Claude Opus 5.5。移行時の破壊的変更。2026-09-23確認。 ↩

NEW NOVEL 2026/08/01
曇りグラス
磨くってのは、力じゃない。
『世界が少し遠くなった』第二巻。前作の一年後を描く、ここからでも読める五つの短編です。
Amazonで読む
自叙伝ドットコム
あなたの人生は書く価値がある。
AIにだから語れる、本当の自分がある。記憶の断片を拾い集め、ひとつの物語へ。
覗いてみる関連記事
AIにも国境が引かれた日|「知能」は輸出管理されるのか
Claude Fable 5とClaude Mythos 5の停止を起点に、AIモデルの重み、輸出管理、サイバー防衛、技術主権、そして「危険な知恵」を誰が管理するのかを考える長編考察です。
AIエージェントは「グレーなコード」をどこまで拒否するのか
OpenAI・Google・Anthropicのポリシーと実運用の差を踏まえ、SNS自動化のようなグレー領域でAIエージェントがどこで拒否し、どこで補助してしまうのかを整理します。
AIに見せていい情報、ダメな情報──社内コードと顧客ログの許可基準【実務ガイド】
通常の社内コードは何を満たせばAIに渡せる? 6つの合格条件、障害ログの加工例、顧客契約の判断表、稟議に使える承認文を用意。2026年9月19日時点の一次資料に基づき、許可・禁止・個別判断を分ける。
GPT-6 Astra登場──Codexで仕事を任せる力はどこまで変わったか【実力・比較・AGI論争】
初めてAstraを使って制作した記事。GPT-6 Astraの新機能、GPT-5.6系との違い、Fable 5.1・Opus 5との比較、ARC-AGI-3の評価条件、海外の賛否とアルトマンのAGI発言を、2026年9月6日時点の資料から読み解く。
FigmaはAI時代に消えるのか──設計・実装・議論の境界線が溶けた先【2026年版】
AIが動くUIを数分で作る2026年、Figmaは不要になるのか。Code Layers、Agent、MCP、業績、料金、StitchやCanvaなど競合まで検証し、残る設計と消える工程を整理します。
