AI · 2026年10月6日
他の言語でも公開 Português (Brasil)
2026年秋のAIモデル比較: 課題解決コストと性能指標の分析
2026年9月、AnthropicはClaude Fable 5.1を、OpenAIはGPT-6 Astraを発表し、他の企業も続いた。本記事は、これらのモデルの価格と速度を、製造元のデータ、独立した測定、および直接比較という3つの観点から整理する。
製造元のベンチマークは自社に有利な条件で設定されることがある。例えば、Grok 4.7のTerminal-Bench 4.0スコアは、xAIの報告では37.6%、独立したArtificial Analysisでは33%と異なる。独立した測定は条件を統一するが、総合指数はニッチな強みを平均化してしまう。直接比較は実務に近いが、サンプル数が極めて少ない。
価格設定はトークン単価ではなく、解決された1課題あたりのコストで評価すべきである。Sonnet 5.5は最大推論レベルで1課題7.67ドルと最も高価だが、これは4億2000万トークンの大量消費によるものである。一方、GPT-6.1 Solは52点の指数で1課題72セントと、50点以上のモデルの中で最もコストパフォーマンスが高い。GPT-6 Astraは1課題3.26ドルで、Opus 5.5の約半額である。
2026年10月3日時点のArtificial Analysis総合指数では、Claude Opus 5.5が58点で224モデル中1位、Sonnet 5.5が56点、Fable 5.1とGPT-6 Astraが53点、GPT-6.1 Solが52点、Grok 4.7が46点、DeepSeek V4.1 Flashが39点、GPT-6 Lunaが38点、DeepSeek V4 Proが36点となった。上位5モデルは2つの米企業に集中し、最大差は6点にすぎない。推論レベルの設定により、同一モデルの性能とコストは大きく変動するため、比較時は最高レベルでの結果を確認する必要がある。