Facebook母公司Meta旗下的Superintelligence Labs於數小時前發表Muse Glimmer,稱這套模型可在配備大部份用戶可以買到有GPU的PC或Mac上運作,並採用Apache 2.0開放模型權重(open weights)方式授權。
Meta的設計重點,是讓AI助理根據用戶目標拆開工作步驟,呼叫工具並完成後續工作,而不只是逐次回答問題。Muse Glimmer可處理文字和圖片,亦能在工具回傳錯誤結果時找出問題再試,包括寫程式、檢查程式錯誤、處理多輪要求及其他需要長時間運作的工作。Meta稱,模型訓練資料來自超過100種語言。
Meta表示,Muse Glimmer未壓縮時需要超過55GB記憶體,消費級GPU難以容納。他們把其壓縮至約4bit,令模型本身少於20GB,餘下記憶體便可供對話暫存(KV cache)、圖像理解模組和加速生成的輔助模型同時使用,讓模型可順利在24GB或32GB記憶體的硬件上使用。
Meta在RTX 5090測到生成速度為原來3.1倍,在M5 Max和M4 Max則為1.8倍和1.5倍,並稱輸出質素沒有下降。這項加速來自DFlash輔助模型,它會先提出一批候選文字,再由Muse Glimmer主模型一次核對,錯誤部分才改動。模型因此不用逐個token生成文字,token是模型處理文字時使用的基本單位。
Meta的測試包括要求模型完成整項工作、連續使用工具和處理多輪要求,也測試寫程式、圖像理解、安全和推理。Meta亦以Gemma4-31B及Qwen3.6-27B作比較,稱Muse Glimmer在同等規模中表現較強。Meta預告,針對llama.cpp、MLX和ExecuTorch的支援會在未來數日陸續推出,開發者往後也可使用Ollama、LM Studio、Unsloth、vLLM及SGLang等工具或服務運作這套模型。
