新しいAIに乗り換えたら全部エラーだったので、ついでに7モデルに同じ仕事をさせてみた
氷河期世代のクラウドエンジニア、terralienです。自分のメディアの裏側では、記事の下書きやチェックを何種類かのAIに分担させています。今日「GPTのLuna 6が出た」と聞いたので、張り切って全部を新しいほうに切り替えたところ、1本残らずエラーになりました。原因を追いかけるついでに、手元で使える7モデルに同じ仕事をさせて比べてみたので、その記録です。
Luna 6に切り替えたら、全部400で返ってきた
やったことは単純で、設定ファイルに書いてある gpt-5.6-luna を gpt-6-luna に書き換えただけです。モデル一覧にも載っていたので、何も疑わずに反映しました。返ってきたのがこれです。
Codex CLI(0.151.0)
「The 'gpt-6-luna' model is not supported when using Codex with a ChatGPT account.」
ChatGPTのアカウントでは使えません、と。まあ出たばかりだしそういうこともあるか、と一度は元に戻しました。
ところが、あとで別の人(というか別のAI)に「CLIからLuna 6使えるよ」と言われて、試しにCLIだけ最新版の0.156.1に上げて同じことをしたら、普通に動きました。アカウントもモデル名も同じで、変えたのはCLIの版だけです。
| モデル名 | CLI 0.151.0 | CLI 0.156.1 |
|---|---|---|
gpt-6-luna | 400「アカウントでは未対応」 | 動く |
gpt-6.0-luna | — | 400(そもそもこの名前は無い) |
エラー文は「アカウントが悪い」と言っていたのに、本当は「あなたのCLIが古い」が正解でした。エラーメッセージを信じて引き下がった自分が、いちばん古かったわけですね。
Claudeのほうは、黙って古いモデルで動いていた
で、ついでにClaude側も調べたら、こっちのほうが怖かったです。無人で回している処理のClaude Code CLIが2.1.251のままで、この版は最新の claude-opus-5-5 という名前を知りません。
知らないならエラーにしてくれればいいのに、opus と指定すると一つ前の世代の Opus 5 に黙って読み替えて動いていました。エラーも警告も出ないので、設定上は「Opusを使っている」のに、中身は旧世代だったわけです。
- GPT側:古いCLIは新モデルを「アカウントの問題」として弾く
- Claude側:古いCLIは新モデルを知らないまま、古いモデルに黙って差し替える
- 共通:どちらも「CLIが古いです」とは一言も言わない
3台のマシンのCLIを全部最新に揃えて、opus が本当に Opus 5.5 で返ってくるのを確かめてから、ようやく本題に入れました。
普段の仕事から5つ、同じ課題を7モデルに出した
せっかく最新版が揃ったので、実際どれくらい違うのかを測ってみました。ベンチマークの点数ではなく、普段AIに任せている仕事をそのまま課題にしています。採点できるように、正解はあらかじめ決めてあります。
| 課題 | 中身 |
|---|---|
| 画像の検品 | 記事用に生成したグラフや挿絵4枚を見て、崩れや数字の食い違いを探す(1枚は問題なしの対照) |
| 記事レビュー | 実際の記事にわざと7つの間違いを仕込んで、全部見つけられるか |
| カテゴリ分類 | 記事タイトル15本を3つの棚に仕分ける |
| 掛け合いの執筆 | 記事に挟むキャラクター同士の短い会話を書く。書き手を伏せて、AIの審査員4人が採点 |
| コード修正 | バグを3つ仕込んだ小さなプログラムを直して、テストを通す |
出場したのは、Anthropicの Opus 5.5・Fable 5.1・Sonnet 5、Googleの Gemini 3.8 Flash、OpenAIの Luna 5.6・Luna 6・Sol 6 の7モデルです。各1回ずつしか測っていないので、1件2件の差は誤差の範囲として見てください。
結果:上位2つははっきりしていた
| モデル | 画像の不具合(7件中) | 記事レビュー(7件中/誤検出) | 分類(15本中) | 掛け合い(10点満点) | コード修正 |
|---|---|---|---|---|---|
| Opus 5.5 | 7 | 7 / 0 | 14 | 10.0 | 合格 |
| Fable 5.1 | 7 | 7 / 0 | 14 | 9.8 | 合格 |
| Sol 6 | 6 | 7 / 0 | 15 | 8.2 | 合格 |
| Luna 6 | 4 | 6 / 1 | 15 | 7.2 | 合格 |
| Gemini 3.8 Flash | 6 | 7 / 0 | 14 | 7.0* | 合格 |
| Sonnet 5 | 6 | 7 / 0 | 15 | 5.8* | 合格 |
| Luna 5.6 | 5 | 7 / 1 | 15 | 5.5 | 合格 |
* Sonnet 5 と Gemini 3.8 Flash の掛け合いの点は、出場が5モデルだった1回目の審査のものです。あとから Luna 6・Sol 6 を足して審査し直した回には入っていないので、参考値として見てください。
分類とコード修正は、ほぼ全員が満点でした。簡単すぎて差がつかなかったというのが正直なところです。差が出たのは画像の検品と掛け合いの執筆で、どちらも Opus 5.5 と Fable 5.1 が抜けていました。
期待していた Luna 6 は、Luna 5.6 から少し良くなった程度でした。一方で速さは段違いで、5課題を84秒で終えています。軽い仕事を大量に回す係としては、やっぱり便利なんですよね。
「画像ならGemini」は、少なくとも今回は当たらなかった
マルチモーダルはGeminiが強い、という印象を持っていたので、画像だけは上位設定(flash-high)でも追加で測りました。結果は軽い設定と同じ 6/7 で、見落としも同じ1件でした。
その1件がこれです。GDPの影響を示す棒グラフで、いちばん右の棒に「-3.0%」とラベルが付いているのに、棒そのものは-2.6%あたりで止まっている。生成したグラフによくある、数字と絵が微妙に合っていないやつですね。これを拾えたのは Opus 5.5 と Fable 5.1 だけでした。
ただし Gemini にも見せ場があった
挿絵に描かれた中国の国旗を見て、「星の数と配置がおかしい」と指摘しました。確かめたら、小さい星が本来4つのところ3つしかありません。こちらの正解表にも無かった、本物の見落としです。
図表の検品に限れば、Geminiは「誤検出が無くて手堅い2番手」という感じでした。写真や長い文書はまた別の話なので、そちらは試していません。
掛け合いでは、1本だけ存在しない研究が出てきた
いちばん差が出たのが、キャラクター同士の会話を書く課題です。お題は「なぜ人は行列に並びたくなるのか」という記事の一節で、会話の中で相手の言い分を一度押し返すこと、新しい事実を出すなら出典を言うこと、を条件にしました。
- Opus 5.5:Worchel・Lee・Adewole(1975年、Journal of Personality and Social Psychology)のクッキーの実験を引いてきました。瓶のクッキーが「人気で減った」と聞かされたほうが、「手違いで減った」と聞かされたときより美味しく評価された、という有名な研究です。実在しますし、内容も合っていました
- Gemini 3.8 Flash:「UCLのロブ・トンプキンズ氏による2018年の研究」を持ち出しました。探しても見つかりません。審査員のうち2人は「捏造の疑い」とまで書いています
- Fable 5.1・Luna 5.6:研究は引かずに、論理だけで押し返しています。出典を言えないなら数字を出さない、という条件を守った形ですね
「出典を言え」と条件を付けると、言える研究が無いときに作ってしまうモデルがある。ここは点数より、この差のほうが大きいと思います。
AIに採点させたら、ちゃんと自分に入れていた
掛け合いの採点は、書き手を伏せてAIの審査員にやってもらいました。ついでに出場者にも審査をさせてみたら、なかなか人間くさい結果になっています。
| 審査員 | 審査ぶり |
|---|---|
| Opus 5.5 | Fableを1位、自分は2位に置いた |
| Fable 5.1 | 自分とOpusを上位に。他の審査員の評価ともおおむね一致 |
| Luna 5.6 | 7案中5案に満点。全員に花丸を配る先生 |
| Luna 6 | 自分を1位にしたうえで、6案中5案に満点 |
| Sol 6 | 自分を1位に |
名前は伏せてあるのに、自分の書いたものは分かるらしいんですよね。書かせるのは得意でも、採点役には向かないモデルがある。これは使い分けを考えるうえで、けっこう大事な発見でした。
Solは賢いけれど、枠の減り方も倍だった
最後に、ChatGPTのプランの枠をどれだけ食うかも見ておきました。Codexは使うたびに「5時間枠」と「週枠」を消費していて、その使用率がログに残っています。
| 5課題ぶん | 入力トークン | 出力(うち推論) | 5時間枠 |
|---|---|---|---|
| Luna 6 | 約12.6万 | 3,101(287) | 1%未満 |
| Sol 6 | 約23.2万 | 5,833(2,516) | 約2% |
Sol 6 はトークンで約2倍、考える量(推論トークン)は約9倍使っていました。ファイルをあちこち読みにいく性格らしく、そのぶん記事レビューでは Luna 6 が見落とした箇所まで拾っています。賢さと引き換えに、枠の減り方も素直に増えるわけですね。なお使用率は1%刻みで、同じ枠を他の処理とも共有しているので、あくまで目安です。
というわけで、結局どう使い分けるか
判断が要る仕事(画像の検品・文章を書く)は Opus 5.5 か Fable 5.1。量をさばく仕事(分類・規約チェック)は Luna 6。Sol 6 はその間。採点役にはLunaを置かない。
こうやって並べると、いかにもAIに詳しい人がちゃんと比較した記事っぽく見えるんですが、今回いちばん時間を使ったのは、自分のCLIが古かったことに気づくまでの部分です。エラー文を真に受けて一度あきらめ、AIに「使えるよ」と言われてやっと気づきました。
モデルの比較より先に、手元の道具の版を確認しましょう、という話でした。偉そうに書いていますが、今日それを教えてくれたのもAIなんですよね。