何が起きたのか

2026-08-06 18:44 UTC(日本時間 8月7日 03:44)、Hacker News に「Qwen3.8 Max now ranked as the best overall model by agentic index」というスレッドが立ち、400ポイント超を集めました(Hacker News、2026-08-07 確認。ポイントは加算され続ける値です)。リンク先は Artificial Analysis の Agentic Index フィルタ付きリーダーボードです。

ところが、同じスレッド内でユーザー d2p が、数分のリロードを挟んで順位が反転したことをスクリーンショット付きで報告します。最初は Qwen が 55.4、Opus Max が 55.3。リロード後は Opus Max が 59.2、Qwen が 58.4。投稿者の apitman は「Welp. That didn’t last long.」と応じています。

種明かしはスレッドに現れた「Artificial Analysis チームの George」と名乗るユーザー(HN ID: Gcam)によるもので、投稿から5時間足らず後の同日 23:26 UTC(日本時間 8月7日 08:26)に「We published an update today that does result in a change of the order, Qwen3.8 Max to second rather than first.」と説明しました。指すのは同日公開の Intelligence Index v4.1.1 です(Artificial Analysis 2026-08-06)。なお、Qwen が実際に何時間首位に表示されていたかは、公式にも HN スレッドにも記録がありません。

順位が動いたこと自体より、「どの指数の話なのか」「更新は指数のどこに効いたのか」が切り分けられていない状態で見出しだけが流通したことのほうが、実務上は厄介です。以下、数字で分解します。


そもそも Agentic Index とは何を測っているのか

Artificial Analysis の該当ページは、Agentic Index を「measures performance in agentic workflows, focusing on behaviors like tool use, planning, autonomy, and complex problem solving」と定義しています(Artificial Analysis、2026-08-07 確認)。

構成ベンチマークについては、HN スレッドで「It’s the best in AA agentic index (GDPval-AA v2, τ³-Banking)」という指摘があり、公式のメソドロジーページでも Agents カテゴリは GDPval-AA v2 と τ³-Banking の2本で構成されると記載されています(Artificial Analysis メソドロジー、2026-08-07 確認)。エージェント系でよく引かれる Terminal-Bench v2.1 は、このカテゴリではなく Coding カテゴリ側に入っています。Artificial Analysis 自身の説明は「weighted average of agentic capabilities benchmarks」であり、Agentic Index の内部で2本をどの比率で合成しているかは公開されていません(Intelligence Index 側での重みは GDPval-AA v2 が20%、τ³-Banking が14%ですが、これは9評価を通した重みであって Agentic Index 内部の比率とは別物です)。

そしてもう一点、見落とされやすい数字があります。Agentic Index のページ表示は「24 of 24 models」でした(2026-08-07 確認)。一方、Qwen3.8-Max と Claude Opus 5 のモデルページで Intelligence Index の順位を見ると、いずれも「/ 185」と表示されます。どちらも収録が増えれば動く表示値であり、実際この2つの数字は数日単位で変わります。それでも桁が違うという事実は変わりません。数十モデルの中の1位と、百数十モデルの中の1位は、同じ「1位」という語で呼べる対象ではありません。

実際、Qwen3.8-Max のモデルページを見ると、Intelligence Index のスコアは58、順位は185モデル中9位です(Artificial Analysis Qwen3.8 Max、2026-08-07 確認)。「Agentic Index で1位」と「総合で9位」は矛盾しません。前者は母集団が一桁小さく、評価軸も2本だけの話だからです。


v4.1.1 の変更は指数のどこに効いたのか

Intelligence Index v4.1.1 は9本の評価を4カテゴリに重み付けして合成します(Artificial Analysis メソドロジー、2026-08-07 確認)。

カテゴリ内訳重み
Agents (34%)GDPval-AA v2 / τ³-Banking20% / 14%
Coding (24%)Terminal-Bench v2.1 / SciCode16% / 8%
Scientific Reasoning (24%)HLE / GPQA Diamond / CritPt12% / 6% / 6%
General (18%)AA-Omniscience / AA-LCR12% / 6%

式にすればこうなります。

$$\mathrm{II} = 0.20\,s_{\text{GDPval}} + 0.14\,s_{\tau^3} + 0.16\,s_{\text{TB}} + 0.08\,s_{\text{SciCode}} + 0.12\,s_{\text{HLE}} + 0.06\,s_{\text{GPQA}} + 0.06\,s_{\text{CritPt}} + 0.12\,s_{\text{Omni}} + 0.06\,s_{\text{LCR}}$$

v4.1.1 の変更点は公式記事とHNでの説明を突き合わせると2系統あります。1つは判定モデルの差し替えで、「HLE, AA-LCR and AA-Omniscience are now graded by GPT-5.6 Luna (medium), replacing GPT-4o, Qwen3 235B A22B 2507, and Gemini 3 Flash Preview respectively」というものです。もう1つは τ³-Banking を Sierra の v1.0.1 に更新し、リカバリ系シナリオでの採点パイプラインを修正した件です(Artificial Analysis 2026-08-06)。

ここが分解のポイントです。グレーダー差し替えが触っているのは HLE・AA-LCR・AA-Omniscience の3本、すなわち

$$0.12 + 0.06 + 0.12 = 0.30$$

で Intelligence Index の30%です。そしてこの3本は、いずれも Agents カテゴリには含まれていません。つまり Luna への差し替えは、定義上 Agentic Index の値を直接動かしません。公開された2つの変更のうち、Agentic Index に直接関係するのは τ³-Banking の v1.0.1 更新だけ、ということになります。

動いた幅も押さえておきます。更新をまたいで Qwen は 55.4 → 58.4 で +3.0、Opus Max は 55.3 → 59.2 で +3.9。両者とも上がっていて、順位が入れ替わったのは差が「Qwen +0.1」から「Opus +0.8」へ、0.9ポイント分だけスイングしたからです。つまり反転の実体は4ポイント級の大変動ではなく、団子状態の上位2つが1ポイント未満の差で並び替わっただけ、と読むほうが実態に近いはずです。この0.9ポイントがどの評価から来たのかについて、公式はカテゴリ別の寄与分解を公開していません。τ³-Banking 起因という読みは、あくまで「公開された変更のうち定義上関係しうるのはそれだけ」という消去法による筆者の推定です。

なお公式記事は Intelligence Index について「most models move by less than a point」とし、最大の上げ幅は Muse Spark 1.2(xhigh)の +2.7 ポイント、上位陣の順位は変わらず Claude Opus 5 が63で1位を維持したと記しています。合成指数の総合値がほとんど動かなくても、部分指数の順位は入れ替わりうる、という実例になっています。


「1位」は3つある

もう一段ややこしいのは、Artificial Analysis には Coding Agent Index という別の指数が存在することです。バージョンは v1.3(2026年7月)で、DeepSWE(113の長期タスク)、Terminal-Bench v2(84のターミナル系タスク)、SWE-Atlas-QnA(124のリポジトリQ&A)の3本で構成されます(Artificial Analysis Coding Agent メソドロジー、2026-08-07 確認)。

決定的な違いは評価単位です。このメソドロジーは「agent variants, not just model names」を測ると明記しています。モデル単体ではなく、ハーネスとモデルの組み合わせが評価対象になります。HN では「They didn’t run all benchmarks」として、Qwen が Coding Agent Index 側では未計測である点が指摘されていました。

整理すると、読者が見出しを受け取ったときに確認すべきなのは次の3点です。第一に、どの指数か(Intelligence / Agentic / Coding Agent)。第二に、母集団は何モデルか(2026-08-07 時点の表示で 185 / 24 / 未確認。いずれも収録が増えれば動く値です)。第三に、その指数を構成するベンチマークが自分のユースケースに対応しているか。Qwen3.8-Max は3つのうち1つで首位に立ち、直後に2位となり、残り1つでは総合9位、もう1つでは未計測です。


知能とコストのトレードオフ

価格面では差がはっきりしています。ただし Qwen3.8-Max の料金はリージョン依存で、単一の数字では書けません。Singapore(International scope)エンドポイントは入力100万トークンあたり2.00ドル / 出力6.00ドル、暗黙キャッシュ入力0.25ドルです(Artificial Analysis、2026-08-07 確認)。一方、北京(China)と US Virginia・東京・フランクフルト・香港(いずれも Global scope)は入力1.65ドル / 出力4.951ドル、暗黙キャッシュ入力0.206ドルと公式ドキュメントに明記されています(Alibaba Cloud Model Studio、2026-08-07 確認)。キャッシュヒット時の支払額は通常入力価格の12.5%、つまり割引率は87.5%(Artificial Analysis の表示は丸めて -88%)で、どちらの体系でも一致します。出力速度67.6 tok/s、最初のトークンまで2.58秒、コンテキストは100万トークンです(Artificial Analysis、2026-08-07 確認)。

対する Claude Opus 5(標準の API 価格。Fast mode は別料金)は入力5.00ドル / 出力25.00ドル、キャッシュヒット0.50ドルで90%引き。出力速度54.5 tok/s で185モデル中111位、最初のトークンまで56.78秒とレイテンシは大きく、コンテキストは同じく100万トークンです(Artificial Analysis、2026-08-07 確認)。以下の比較は、Artificial Analysis が採用している Singapore 側の価格体系を前提にしています。

なお速度・TTFT・速度順位は Artificial Analysis が継続的に計測し直している値で、本記事の数字は 2026-08-07 時点の表示です。日単位で1〜数 tok/s、TTFT は秒単位で動きます。価格やコンテキスト長のような静的な値と同じ精度では扱わないでください。

指数を1回走らせる実費も公開されています。Qwen3.8-Max は出力1億5000万トークンを生成して総額1,741.41ドル、Opus 5 は1億トークンで3,836.05ドル。Qwen は5割多く喋って、費用は45%で済んでいる計算です。なお Qwen3.8-Max はページ上で「very verbose」、Opus 5 は「somewhat verbose」と注記され、収録モデルの中央値は7000万トークンとされています。

HN では user43928 が、タスクあたりコストとして Qwen 3.8 Max が1.13ドル(スコア58)、Opus 5 xhigh が1.80ドル(スコア63)、GPT-5.6 Sol xhigh が0.81ドル(スコア59)という数字を投稿していました。これは Artificial Analysis が公式に掲載した表ではなくユーザー集計である点に注意が必要ですが、方向としては公式の価格・実費データと整合します。スコア5ポイント差に約6割の単価差を払うかどうか、という判断です。


オープンウェイトはまだ出ていない

Qwen3.8-Max は2026-08-03に公開された総パラメータ2.4兆のMoE(Mixture of Experts、専門家混合)モデルです。入力はテキスト・画像・動画、出力はテキスト、コンテキストは100万トークン。ここまでは Alibaba Cloud Model Studio の公式ドキュメントに「A 2.4-trillion-parameter MoE flagship」として明記されています(Alibaba Cloud Model Studio、2026-08-07 確認)。

一方、トークンあたりの活性パラメータについては注意が必要です。約950億という数字が TestingCatalogDataCamp といった二次媒体で報じられていますが、Alibaba Cloud の公式ドキュメントには活性パラメータ数の記載がありません。二次媒体の中には活性数を未開示として扱っているものもあり、一次情報で裏の取れた数字ではない、というのが現状です。ベンダー側は別途 OSWorld-Verified 86.1 などの数値を提示しています(MarkTechPost 2026-08-03)。

同時に、Qwen3.8-Max と Qwen3.8-27B のオープンウェイト公開が「翌週」に予告されました(TestingCatalog)。8月3日起点の「翌週」は8月10日の週を指します。

2026-08-07時点で Hugging Face の Qwen organization ページを確認したところ、Qwen3.8-Max も Qwen3.8-27B もリポジトリは掲出されていません。最新の更新は Qwen3-ASR 系(約2週間前)でした(Hugging Face Qwen)。ただしこれは「予告が破られた」ことを意味しません。予告された週がまだ来ていないだけです。ローカル実行を検討している場合、判断材料が揃うのは早くとも来週以降になります。


残された不確実性

  • 順位を入れ替えた0.9ポイントのスイングがどの評価から来たのかは、公式にはカテゴリ別分解が公開されていません。本記事の τ³-Banking 起因という読みは消去法による推定であり、確定情報ではありません。
  • Agentic Index が GDPval-AA v2 と τ³-Banking をどの比率で合成しているかも公開されていません。本記事は Intelligence Index 側の重み(20% / 14%)を示していますが、これは Agentic Index 内部の比率ではありません。
  • Agentic Index のリーダーボードは JavaScript で描画されるため、静的取得ができません。本記事が引用する 55.4 / 55.3 および 59.2 / 58.4 は HN 上のユーザー投稿スクリーンショットに基づく報告値で、公式が表として掲載した数値ではありません。
  • HN の kmeh は、知識・ハルシネーション系のベンチで「nano-sized」なグレーダーを使うことへの疑問を投げています。Artificial Analysis 側は Luna を「selected for strong agreement with human judgment in our grader validation」と説明していますが、v4.1.1の告知記事本文には、その検証データや人間判定との一致率を示す数値は掲載されていません(Artificial Analysis 2026-08-06)。
  • Qwen3.8-Max の OSWorld-Verified 86.1 はベンダー発表値であり、Artificial Analysis の指数には含まれていません。第三者による再現は、本記事執筆時点で検索した範囲では確認できませんでした。
  • トークンあたりの活性パラメータ約950億は二次媒体の報道であり、Alibaba Cloud の公式ドキュメントには記載がありません。オープンウェイトが公開されれば、設定ファイルから直接確認できるようになります。
  • オープンウェイト公開が予告どおり8月10日の週に行われるか、ライセンス条件がどうなるかは未確定です。

まとめ

「Qwen3.8-Max が総合1位」という見出しは、正確には「当時24モデルが表示されていた Agentic Index で、2026-08-06 の v4.1.1 適用前に1位だった」という意味でした。しかもリードは0.1ポイント。適用後は0.8ポイント差の2位です。同じモデルは、順位が185モデル中で示される Intelligence Index では58で9位、Coding Agent Index では未計測です。

指数が更新されて順位が動くこと自体は、方法論を改善している証拠でもあります。問題になるのは、合成指数の名前だけが独り歩きして、母集団・構成ベンチマーク・判定モデルという3つの前提が省略されるときです。今回のケースは、グレーダー差し替えが Intelligence Index の30%にしか触れておらず、しかもその30%は Agentic Index の外側にある、という構造まで降りて初めて筋が通りました。

実務的な結論はシンプルです。リーダーボードのスコアを比較検討に使うなら、指数名・母集団・構成ベンチマークの3点をセットで控えておくこと。そして自分のワークロードに近い単一ベンチマークの生スコアを、合成指数より優先して見ることです。


主要出典


関連する過去記事