何が起きたのか

Metaは2026年8月10日、300億パラメータ(公称。モデルカード表記では約29.6B)のオープンウェイトモデル「Muse Glimmer」をApache 2.0ライセンスで公開しました。なおMetaはライセンスとは別に、アクセス・利用へ適用されるUsage Policyを公開しています(後述)。公式リサーチブログは冒頭でこのモデルを「a 30-billion-parameter model optimized for always-on local agent workflows」と定義しており、汎用チャットではなく常時稼働のローカルエージェントを名指しした位置づけになっています(Meta AI Research 2026-08-10)。

学習方法についても公式ブログは踏み込んでおり、「We trained Muse Glimmer on Muse Spark’s outputs using logit distillation, leveraging a similar data mix as the teacher」と記述しています。上位モデルMuse Sparkのロジットを教師とした蒸留モデルであることが明記されている点は、後述するベンチマークの偏りを読むうえで効いてきます。

配布は Hugging Face 経由で、llama.cpp・MLX・ExecuTorch への統合が予告されました。このうち llama.cpp 対応は公開当日の2026年8月10日にマージ済みで、build b10353 以降で利用できます(meta-models/Muse-Glimmer-30B-GGUF)。言語については「more than 100 languages」のデータで学習したとされていますが、全言語で評価済みではなく、手厚くサポートされない言語では性能が落ち得るとモデルカードのLimitationsに明記されています。

本稿では「30Bが単一のコンシューマGPUで常時稼働する」という主張が、どの数値によって成立しているのかを、重みサイズとKVキャッシュの両側から検証します。そのうえで、勝っているベンチと負けているベンチがきれいに割れている点を確認します。


55.7GBから15.9GBへ──量子化の刻み方

公式ブログは、フル精度で「over 55 GB」の重みがK-Quant圧縮で「under 20 GB」に収まると述べています。Metaが24GB VRAM向けとして検証・配布する公式GGUFはK-Quant-17GB(実サイズ16.8GB)です(meta-models/Muse-Glimmer-30B-GGUF)。これとは別に、第三者のUnslothが独自の量子化ビルドを公開しており、ビット幅ごとの刻みはそちらで確認できます(unsloth/Muse-Glimmer-30B-GGUF)。

量子化サイズ
UD-IQ2_XXS(2bit)10.7 GB
UD-Q3_K_XL(3bit)13.4 GB
UD-Q4_K_XL(4bit)15.9 GB
UD-Q5_K_M(5bit)19.2 GB
UD-Q6_K_XL(6bit)26.3 GB
Q8_0(8bit)29.6 GB
BF1655.7 GB

注意が要るのは、この55.7GBが何のサイズかという点です。UnslothのBF16 GGUFは合計55.7GBですが、これは視覚エンコーダを含まないテキストモデルのサイズです。モデル全体は約29.6Bパラメータで、公式のBF16 safetensorsは合計約59.6GB(meta-models/Muse-Glimmer-30B)。両者の約3.9GBの差は、主に別配布される約1.8Bパラメータの視覚エンコーダに対応します。「24GB級のGPU1枚」を一次的に裏付けているのはUnslothの15.9GBではなく、Metaが24GB向けとして検証している公式K-Quant-17GB(16.8GB)のほうです。

劣化率は公式ブログ本文には数値がなく(比較表は画像)、Hugging Faceの公式モデルカードにテキストで掲載されています。32GB VRAM向けのK-Quant-Dynamicが0.2%、24GB向けのK-Quant-17GBが1.0%で、「15の一般的なベンチマークのaccuracy metrics平均で測定」と注記されています(meta-models/Muse-Glimmer-30B)。公式ブログ側の記述は「minimal to no degradation on agentic tasks」という定性的な表現です。


KVキャッシュが1.8GBで済む理由

重みが15.9GBに収まっても、コンテキスト131,072トークン超を謳うモデルでKVキャッシュが数十GBに膨らむなら「単一GPUで常時稼働」は破綻します。ここを潰しているのが注意機構の構成です。

公式モデルカードが公開している構成は次のとおりです(meta-models/Muse-Glimmer-30B)。

  • 層数 52、hidden 6,656、head次元 128
  • クエリヘッド32 / KVヘッド2(GQA比 16:1)
  • 注意パターンは [Local, Local, Local, Global] の繰り返し、sliding window 2,048
  • FFNはSwiGLU、中間次元 19,968、RoPEのθは500,000(公式カードの表記では local 層のみに適用)
  • 語彙 202,048、コンテキスト 131,072+

52層を4層周期で割ると13サイクルになるので、グローバル注意は13層、ローカル注意は39層という配分になります。KVキャッシュ量は次式で見積もれます。

$$ \mathrm{KV} = 2 \cdot b \cdot d_{\text{head}} \cdot n_{\text{kv}} \cdot \left( L_{\text{global}} \cdot T + L_{\text{local}} \cdot \min(T, W) \right) $$

先頭の2はKとVの2本分、$b$ はバイト幅、$T$ はコンテキスト長、$W$ はウィンドウ幅です。fp16キャッシュ($b = 2$)、$d_{\text{head}} = 128$、$n_{\text{kv}} = 2$、$L_{\text{global}} = 13$、$L_{\text{local}} = 39$、$T = 131{,}072$、$W = 2{,}048$ を入れます。

$$ \mathrm{KV} = 1024 \cdot \left( 13 \cdot 131072 + 39 \cdot 2048 \right) = 1024 \cdot 1{,}783{,}808 \approx 1.83\ \mathrm{GB} $$

1層1トークンあたりちょうど1KiB、フルコンテキストを埋めても約1.8GBです。仮にGQAを使わず32ヘッド分のKVを持ち、全52層がグローバル注意だった場合は 1層1トークンあたり16KiB、$52 \cdot 131072 \cdot 16\ \mathrm{KiB} \approx 112\ \mathrm{GB}$ になります。GQAの16倍とローカル層の削減が重なって、約61分の1まで縮んでいる計算です。

24GBの内訳は、Meta公式配布のファイル構成で見るのが正確です。

構成要素公式配布のサイズ
テキストモデル(K-Quant-17GB)16.8 GB
視覚エンコーダ(mmproj-kquant.gguf、任意)1.4 GB
DFlash drafter(dflash-kquant.gguf、任意)1.6 GB
fp16 KVキャッシュ(131Kトークン時の理論値)約1.83 GB
単純合計約21.6 GB

Metaはこの一式を24GB VRAM向けとして検証・明記しています。ただし約21.6GBという単純合計は、作業バッファ・ランタイム割当・パディングを含まない机上の値で、ピークVRAMの実測ではありません。「単一コンシューマGPU」という主張の実体は、量子化だけでなくこのKV設計との合わせ技だと読めます。

一方でsliding window 2,048は短めです。131,072トークンの全体へ直接注意できるのは13層のグローバル層に限られます。local層間でも表現は層をまたいで伝播するため、この構成情報だけから長文脈の細部保持性能を断定することはできませんが、直接参照を13層に集約するという設計選択であることは確かです。


DFlashは3.1倍だが、倍率はハードで割れる

生成速度側の仕掛けはDFlashという投機的デコードです。公式ブログはこれを「a small companion network that proposes entire blocks of tokens at once. The main model then verifies these proposals in parallel, accepting correct tokens and correcting wrong ones」と説明しています。

公表されている高速化倍率は次の3点です(Meta AI Research 2026-08-10)。

  • RTX 5090: 3.1倍
  • M5 Max: 1.8倍
  • M4 Max: 1.5倍

同じ手法でも2倍以上の開きがあります。ただしこの3点から原因を特定することはできません。測定は同一条件ではなく、RTX 5090はllama.cpp、Apple SiliconはExecuTorchと推論ランタイム自体が異なります(batch 1・greedy decoding)。カーネル実装、量子化の実装品質、投機の受理率、メモリ帯域などが交絡するため、Apple側で倍率が伸びない理由を構造から断定はできません。ローカル常駐を前提に導入を検討するなら、この倍率は自分のハードで測り直すべき数字です。

絶対値は公式モデルカードに掲載されており、DFlashは1回のフォワードパスで16トークンを提案し、RTX 5090では74.9トークン/秒から233.4トークン/秒に上がります(meta-models/Muse-Glimmer-30B)。


勝ち負けの偏り──MCP Atlasで勝ち、OSWorldとTerminalBenchで負ける

公式ブログの比較表は画像で提供されており本文から数値を読めませんでしたが、Hugging Face上の公式モデルカードに同じ比較表が掲載されています。Gemma4-31BおよびQwen3.6-27B(thinkingモード)との比較は次のとおりです(Hugging Face meta-models/Muse-Glimmer-30B)。

ベンチマークMuse Glimmer-30BGemma4-31BQwen3.6-27B
MCP Atlas75.554.262.5
DeepSearch QA74.661.771.1
Gaia243.336.440.0
SWE-Bench Pro51.236.950.2
AIME 202694.789.294.1
IFBench77.076.070.8
AA-LCR80.068.373.3
OSWorld-Verified65.958.575.6
TerminalBench 2.151.743.460.7
τ3-Banking23.515.116.7

勝ち負けの分かれ方に規則性があります。ツール呼び出しの計画と実行(MCP Atlas +13.0ポイント)、検索を伴う多段調査(DeepSearch QA、Gaia2)、長文脈での推論(AA-LCR +6.7ポイント)では明確に勝っています。他方、GUIを操作するOSWorld-Verifiedでは9.7ポイント、シェルを叩くTerminalBench 2.1では9.0ポイント、いずれもQwen3.6-27Bに負けています。

ただしこの表から言えるのは「Metaの評価設定では、MCP AtlasなどでQwen3.6-27Bを上回り、OSWorld-VerifiedとTerminalBench 2.1では下回った」という結果までです。ハーネス、action space、system promptはベンチごとに異なり、Metaの評価方法論自身も「our evaluation setup (e.g. agent tools and system prompts) may not be specifically tuned for proprietary third-party models」と述べています。2つの負けから「GUI・ターミナル一般に弱い」というモデル固有の能力差まで確定することはできません。Muse Sparkからのロジット蒸留という学習方法を踏まえると、教師モデルの得意分野が転写された可能性は仮説として立てられますが、Metaはこの偏りの原因を説明していません。

τ3-Bankingの23.5という絶対値も目を引きます。3モデルの中では最高値ですが、表中の3モデルはいずれも25未満にとどまります。難度や人間水準の基準が示されていないため、絶対水準の評価はこの表だけではできません。

実務への含意は素直です。MCPサーバー群を叩いて調査やコード修正を回すローカル常駐エージェントの土台としては有力な候補になりますが、画面操作の自動化やターミナル作業の自律実行を主目的にするなら、このモデルサイズ帯では別の選択肢を並べて比較する価値があります。


常時稼働という実体

「always-on」という表現が成立する条件を、ここまでの数値で整理します。

公式K-Quant構成(テキスト16.8GB+KV理論値約1.8GB、必要に応じて視覚1.4GBとDFlash 1.6GB)は、24GBのGPUに載せたまま常時レジデントにできる規模としてMetaが検証しているものです。常駐させれば、呼び出しのたびに発生するモデルロード待ちを省けます。ただしprompt prefill・推論・ツール初期化などの時間は残るため、「起動が速くなる」のはロード待ちの部分です。公式ブログの「Running models locally enables you to use AI anywhere, anytime, with or without an internet connection」は文字どおり、ネット接続の有無によらず使えるというオフライン動作可能性の記述です。

視覚エンコーダの扱いは配布形態で変わります。モデルカードによると約1.8BパラメータのViT-G/14(50層、幅1536、パッチサイズ14)で、画像1枚あたり最大4,096の視覚トークンを消費します。公式GGUFでは視覚エンコーダは独立したmmproj-kquant.gguf(1.4GB)で、テキスト専用運用ならロードせずに済みます。一方、Transformersで一体型のBF16モデルをそのままロードする場合は、視覚部分を除いた読み込みができるかを別途確認する必要があります。

知識カットオフは2026年1月4日とされています。常時稼働の調査エージェントとして使う場合、検索ツールを併用しない限り約7か月分の空白を抱えることになります。


残された不確実性

公式ベンチ表の原典性。ベンチマーク数値はHugging Faceの公式モデルカードで確認しましたが、公式リサーチブログ本文では画像化されており、テキストとして照合できていません。数値の一致は複数媒体で確認できています。評価条件についてはMetaが別途「Muse Glimmer Evaluation Methodology」を公開しており、Muse Glimmerは high reasoning strength・temperature=1.0/top_p=0.95/top_k=64 を全ベンチマーク共通で用いること、MCP AtlasやDeepSearch QA・OSWorld-Verifiedは4ラン平均であること(ラン数はベンチごとに異なり、外部スコアを採用する項目もあります)、SWE-Benchはbashツールとファイル操作ツールによるスキャフォールドを用いること、TerminalBench 2.1はE2Bサンドボックス上のTerminus 2ハーネスを用いることが明記されています(Meta AI Research 2026-08-10)。残る留保は比較対象側で、同ドキュメント自身が「our evaluation setup (e.g. agent tools and system prompts) may not be specifically tuned for proprietary third-party models」と述べており、第三者モデルの条件が最適化されていない可能性は排除できません。

量子化劣化の内訳。0.2%と1.0%という劣化率は公式モデルカードに「15の一般的なベンチマークのaccuracy metrics平均」として掲載されていますが、15ベンチの内訳やベンチ別の劣化は示されていません。2bit(UnslothのUD-IQ2_XXS 10.7GB、第三者量子化)まで落としたときのエージェント性能は公表されていません。

KVキャッシュ試算の前提。本稿の約1.8GBは、[Local, Local, Local, Global] の繰り返しが52層に均等配分される(グローバル13層)という前提と、fp16キャッシュを仮定した計算です。実装によってはKVキャッシュ自体を量子化して更に小さくできますが、実測値ではありません。

DFlashの適用範囲。3.1倍という数字は投機の受理率に依存します。受理率はタスクの予測しやすさで変わるため、エージェントの長い試行錯誤ループで同じ倍率が出る保証はありません。

Apache 2.0の含意。重みとコードのライセンス自体は制約の少ないものですが、Metaは別途「Muse Glimmer Usage Policy」を公開し、モデルへのアクセス・利用に適用すると記載しています(Usage Policy)。年齢・軍事・マルウェアをはじめ多数の禁止用途が列挙されているため、実務での利用条件を検討する際はApache 2.0だけでなくこちらの確認が必要です(Usage Policyの法的位置づけ・執行可能性までは一次資料からは判定できません)。公式ブログはベンチマーク比較にsafetyカテゴリを含めているものの、本文テキスト上で安全性の限界そのものを列挙してはおらず、「Muse Glimmer was evaluated under the standards set out in Meta’s Advanced AI Scaling Framework and assessed for open-weight release across all relevant categories」という枠組みへの言及が中心です(Meta AI Research 2026-08-10)。ただしHugging Faceの公式モデルカードにはLimitations節が置かれ、「The model may produce inaccurate, biased, or objectionable responses to user prompts.」「The model has not been evaluated on all languages contained in the pre-training data.」「Quantized inference may show minor quality differences in edge cases compared to full-precision.」といった限界が明示されています(Hugging Face meta-models/Muse-Glimmer-30B)。評価方法論ドキュメント側にもCIMemories、Siren AgentDojo、MBCT・HPCT・VCT、WMDP、LAB-Bench、CyberGym、CyberBenchといった安全性ベンチマークの記載があり、情報が公式ブログ・モデルカード・方法論ドキュメントに分散している点が読み手側の負担になっています(Meta AI Research 2026-08-10)。


まとめ

Muse Glimmerの「単一コンシューマGPUで常時稼働」という主張は、Metaが24GB向けとして検証する公式K-Quant構成(テキスト16.8GB+視覚1.4GB+DFlash 1.6GB)と、GQA 16:1およびsliding window 2048によってフルコンテキストでも理論値約1.8GBに抑えたKVキャッシュの組み合わせで成立しています。単純合計約21.6GBはピークVRAMの実測ではありませんが、仮に全層global・MHAなら112GB相当になるKVを1.8GBに落とす設計判断が、このモデルの実用ラインを決めています。

性能面では、Metaの評価設定において、MCP Atlas 75.5やAA-LCR 80.0といったツール呼び出し・長文脈の系統で勝ち、OSWorld-Verified 65.9とTerminalBench 2.1の51.7ではQwen3.6-27Bに9ポイント前後の差で負けるという偏りが出ています。この偏りをモデル固有の能力差と断定はできませんが、ローカル常駐エージェントの土台として検討するなら、自分のワークロードがどちら側にあるかを自前のハーネスで確かめる価値があります。


主要出典

  • Introducing Muse Glimmer: an open-weight model optimized for always-on local agent workflows(Meta AI Research、2026-08-10)— 一次発表。30B・Apache 2.0・55GB超から20GB未満への量子化・DFlashの3.1倍/1.8倍/1.5倍・Muse Sparkからのロジット蒸留を明記。ベンチ比較表は画像
  • meta-models/Muse-Glimmer-30B(Hugging Face、Meta公式)— 構成(52層/32Q・2KV/sliding window 2048/RoPE θ=500,000 local層のみ/ViT-G/14約1.8B)、量子化劣化率0.2%/1.0%(15ベンチ平均の注記つき)、DFlash絶対速度74.9→233.4 tok/s(RTX=llama.cpp・Apple=ExecuTorch、batch 1・greedy)、Gemma4-31B・Qwen3.6-27Bとの比較表10項目、Limitations節、知識カットオフ2026-01-04。BF16 safetensorsは合計約59.6GB
  • meta-models/Muse-Glimmer-30B-GGUF(Hugging Face、Meta公式)— 24GB VRAM向けK-Quant-17GB(16.8GB)・視覚エンコーダmmproj-kquant.gguf(1.4GB、別ファイル)・DFlash drafter(1.6GB)。llama.cpp対応は2026-08-10にマージ済み・build b10353以降
  • Muse Glimmer Usage Policy(Meta)— Apache 2.0とは別にアクセス・利用へ適用されるとMetaが記載する禁止用途リスト
  • unsloth/Muse-Glimmer-30B-GGUF(Hugging Face、第三者量子化ビルド)— テキストモデルの量子化サイズ刻み10.7GB〜55.7GB(BF16 55.7GBは視覚エンコーダを含まない)
  • Muse Glimmer Evaluation Methodology(Meta AI Research、2026-08-10)— 温度1.0/top_p 0.95/top_k 64、ラン数、SWE-Benchのスキャフォールド、Terminus 2ハーネス、安全性ベンチマーク群、第三者モデル向け最適化の留保を明記
  • Meta AI Releases Muse Glimmer(MarkTechPost、2026-08-10)— 二次情報。劣化率・DFlash速度の一次出典は上記のMeta公式モデルカード

関連する過去記事