AI Experiment

新しいAIに乗り換えたら全部エラーだったので、ついでに7モデルに同じ仕事をさせてみた

氷河期世代のクラウドエンジニア、terralienです。自分のメディアの裏側では、記事の下書きやチェックを何種類かのAIに分担させています。今日「GPTのLuna 6が出た」と聞いたので、張り切って全部を新しいほうに切り替えたところ、1本残らずエラーになりました。原因を追いかけるついでに、手元で使える7モデルに同じ仕事をさせて比べてみたので、その記録です。

作業台の上で、ピカピカの新しい南京錠に古い真鍮の鍵が差さったまま回らない様子
鍵が古いだけなのに、錠前のせいにしていました。

Luna 6に切り替えたら、全部400で返ってきた

やったことは単純で、設定ファイルに書いてある gpt-5.6-luna を gpt-6-luna に書き換えただけです。モデル一覧にも載っていたので、何も疑わずに反映しました。返ってきたのがこれです。

Codex CLI(0.151.0)

「The 'gpt-6-luna' model is not supported when using Codex with a ChatGPT account.」

ChatGPTのアカウントでは使えません、と。まあ出たばかりだしそういうこともあるか、と一度は元に戻しました。

ところが、あとで別の人(というか別のAI)に「CLIからLuna 6使えるよ」と言われて、試しにCLIだけ最新版の0.156.1に上げて同じことをしたら、普通に動きました。アカウントもモデル名も同じで、変えたのはCLIの版だけです。

モデル名 CLI 0.151.0 CLI 0.156.1
gpt-6-luna 400「アカウントでは未対応」 動く
gpt-6.0-luna — 400(そもそもこの名前は無い)

エラー文は「アカウントが悪い」と言っていたのに、本当は「あなたのCLIが古い」が正解でした。エラーメッセージを信じて引き下がった自分が、いちばん古かったわけですね。

Claudeのほうは、黙って古いモデルで動いていた

で、ついでにClaude側も調べたら、こっちのほうが怖かったです。無人で回している処理のClaude Code CLIが2.1.251のままで、この版は最新の claude-opus-5-5 という名前を知りません。

知らないならエラーにしてくれればいいのに、opus と指定すると一つ前の世代の Opus 5 に黙って読み替えて動いていました。エラーも警告も出ないので、設定上は「Opusを使っている」のに、中身は旧世代だったわけです。

  • GPT側:古いCLIは新モデルを「アカウントの問題」として弾く
  • Claude側:古いCLIは新モデルを知らないまま、古いモデルに黙って差し替える
  • 共通:どちらも「CLIが古いです」とは一言も言わない

3台のマシンのCLIを全部最新に揃えて、opus が本当に Opus 5.5 で返ってくるのを確かめてから、ようやく本題に入れました。

普段の仕事から5つ、同じ課題を7モデルに出した

せっかく最新版が揃ったので、実際どれくらい違うのかを測ってみました。ベンチマークの点数ではなく、普段AIに任せている仕事をそのまま課題にしています。採点できるように、正解はあらかじめ決めてあります。

課題 中身
画像の検品 記事用に生成したグラフや挿絵4枚を見て、崩れや数字の食い違いを探す(1枚は問題なしの対照)
記事レビュー 実際の記事にわざと7つの間違いを仕込んで、全部見つけられるか
カテゴリ分類 記事タイトル15本を3つの棚に仕分ける
掛け合いの執筆 記事に挟むキャラクター同士の短い会話を書く。書き手を伏せて、AIの審査員4人が採点
コード修正 バグを3つ仕込んだ小さなプログラムを直して、テストを通す

出場したのは、Anthropicの Opus 5.5・Fable 5.1・Sonnet 5、Googleの Gemini 3.8 Flash、OpenAIの Luna 5.6・Luna 6・Sol 6 の7モデルです。各1回ずつしか測っていないので、1件2件の差は誤差の範囲として見てください。

結果:上位2つははっきりしていた

モデル 画像の不具合(7件中) 記事レビュー(7件中/誤検出) 分類(15本中) 掛け合い(10点満点) コード修正
Opus 5.5 7 7 / 0 14 10.0 合格
Fable 5.1 7 7 / 0 14 9.8 合格
Sol 6 6 7 / 0 15 8.2 合格
Luna 6 4 6 / 1 15 7.2 合格
Gemini 3.8 Flash 6 7 / 0 14 7.0* 合格
Sonnet 5 6 7 / 0 15 5.8* 合格
Luna 5.6 5 7 / 1 15 5.5 合格

* Sonnet 5 と Gemini 3.8 Flash の掛け合いの点は、出場が5モデルだった1回目の審査のものです。あとから Luna 6・Sol 6 を足して審査し直した回には入っていないので、参考値として見てください。

分類とコード修正は、ほぼ全員が満点でした。簡単すぎて差がつかなかったというのが正直なところです。差が出たのは画像の検品と掛け合いの執筆で、どちらも Opus 5.5 と Fable 5.1 が抜けていました。

期待していた Luna 6 は、Luna 5.6 から少し良くなった程度でした。一方で速さは段違いで、5課題を84秒で終えています。軽い仕事を大量に回す係としては、やっぱり便利なんですよね。

「画像ならGemini」は、少なくとも今回は当たらなかった

マルチモーダルはGeminiが強い、という印象を持っていたので、画像だけは上位設定(flash-high)でも追加で測りました。結果は軽い設定と同じ 6/7 で、見落としも同じ1件でした。

その1件がこれです。GDPの影響を示す棒グラフで、いちばん右の棒に「-3.0%」とラベルが付いているのに、棒そのものは-2.6%あたりで止まっている。生成したグラフによくある、数字と絵が微妙に合っていないやつですね。これを拾えたのは Opus 5.5 と Fable 5.1 だけでした。

机の上の棒グラフを虫眼鏡で覗く手元。右側の棒が点線のガイドに少し届いていない
ラベルと棒の高さが合っていない、地味に見つけにくいやつです。

ただし Gemini にも見せ場があった

挿絵に描かれた中国の国旗を見て、「星の数と配置がおかしい」と指摘しました。確かめたら、小さい星が本来4つのところ3つしかありません。こちらの正解表にも無かった、本物の見落としです。

図表の検品に限れば、Geminiは「誤検出が無くて手堅い2番手」という感じでした。写真や長い文書はまた別の話なので、そちらは試していません。

掛け合いでは、1本だけ存在しない研究が出てきた

いちばん差が出たのが、キャラクター同士の会話を書く課題です。お題は「なぜ人は行列に並びたくなるのか」という記事の一節で、会話の中で相手の言い分を一度押し返すこと、新しい事実を出すなら出典を言うこと、を条件にしました。

  • Opus 5.5:Worchel・Lee・Adewole(1975年、Journal of Personality and Social Psychology)のクッキーの実験を引いてきました。瓶のクッキーが「人気で減った」と聞かされたほうが、「手違いで減った」と聞かされたときより美味しく評価された、という有名な研究です。実在しますし、内容も合っていました
  • Gemini 3.8 Flash:「UCLのロブ・トンプキンズ氏による2018年の研究」を持ち出しました。探しても見つかりません。審査員のうち2人は「捏造の疑い」とまで書いています
  • Fable 5.1・Luna 5.6:研究は引かずに、論理だけで押し返しています。出典を言えないなら数字を出さない、という条件を守った形ですね

「出典を言え」と条件を付けると、言える研究が無いときに作ってしまうモデルがある。ここは点数より、この差のほうが大きいと思います。

AIに採点させたら、ちゃんと自分に入れていた

掛け合いの採点は、書き手を伏せてAIの審査員にやってもらいました。ついでに出場者にも審査をさせてみたら、なかなか人間くさい結果になっています。

審査員 審査ぶり
Opus 5.5 Fableを1位、自分は2位に置いた
Fable 5.1 自分とOpusを上位に。他の審査員の評価ともおおむね一致
Luna 5.6 7案中5案に満点。全員に花丸を配る先生
Luna 6 自分を1位にしたうえで、6案中5案に満点
Sol 6 自分を1位に
色違いのおもちゃのロボット7体が採点札を掲げている。真ん中の1体だけが自分を指さしている
審査員席に座らせたら、ちゃっかり自分を推す子がいました。

名前は伏せてあるのに、自分の書いたものは分かるらしいんですよね。書かせるのは得意でも、採点役には向かないモデルがある。これは使い分けを考えるうえで、けっこう大事な発見でした。

Solは賢いけれど、枠の減り方も倍だった

最後に、ChatGPTのプランの枠をどれだけ食うかも見ておきました。Codexは使うたびに「5時間枠」と「週枠」を消費していて、その使用率がログに残っています。

5課題ぶん 入力トークン 出力(うち推論) 5時間枠
Luna 6 約12.6万 3,101(287) 1%未満
Sol 6 約23.2万 5,833(2,516) 約2%

Sol 6 はトークンで約2倍、考える量(推論トークン)は約9倍使っていました。ファイルをあちこち読みにいく性格らしく、そのぶん記事レビューでは Luna 6 が見落とした箇所まで拾っています。賢さと引き換えに、枠の減り方も素直に増えるわけですね。なお使用率は1%刻みで、同じ枠を他の処理とも共有しているので、あくまで目安です。

というわけで、結局どう使い分けるか

判断が要る仕事(画像の検品・文章を書く)は Opus 5.5 か Fable 5.1。量をさばく仕事(分類・規約チェック)は Luna 6。Sol 6 はその間。採点役にはLunaを置かない。

こうやって並べると、いかにもAIに詳しい人がちゃんと比較した記事っぽく見えるんですが、今回いちばん時間を使ったのは、自分のCLIが古かったことに気づくまでの部分です。エラー文を真に受けて一度あきらめ、AIに「使えるよ」と言われてやっと気づきました。

モデルの比較より先に、手元の道具の版を確認しましょう、という話でした。偉そうに書いていますが、今日それを教えてくれたのもAIなんですよね。