Google今日公布Gemini 4 Argon,主打可持續處理較長、較複雜的工作,公布的多項測試成績亦高過GPT-6 Astra、Claude Fable 5.1和Claude Opus 5.5。今次較值得留意的用途包括大型程式修改、企業工作流程,以及從影片和多份文件整理資料,模型目前只會讓指定的網絡安全公司或團隊用戶使用,一般用戶仍然用唔到,即係有得睇無得試用。
Argon在評估長時間真實軟件工程任務的DeepSWE v1.1取得77.9%,高過三款最強對手,當中Opus 5.5為74.2%。這項測試較貼近需要多個步驟才能完成的程式工作,Google亦稱內部已用Argon處理除錯、大型程式改寫及演算法設計。不過,在另一項程式開發測試FrontierSWE v2,Argon仍低過Astra、Fable 5.1和Opus 5.5,可見分數並非每項都領先。
Argon在評估完整企業工作流程執行表現的AutomationBench取得51.3%,同樣高過三款對手,Opus 5.5則為42.5%。這項比較關乎AI能否完成一連串工作,而不只是回答單一問題。Google公布的金融研究及法律文件測試亦由Argon領先三者,惟法律測試本身仍不足兩成。
Google稱Argon可從長影片找出細節、分析專業圖表,以及根據多份文件執行工作,而它在長影片理解測試LVBench亦高過Astra、Fable 5.1和Opus 5.5。Google把Argon的輸出上限由過往的64,000個token提高至100萬個token,讓模型在一次處理過程中有更多空間推理及生成內容。
Google先透過Fairwind計劃向可信任的網絡安全防守團隊提供Argon,待收集試用意見及加強安全措施後,才逐步讓更多人使用。之後計劃先讓付費API客戶和Google AI Ultra訂閱用戶使用,尚未公布確實開放日期。
Argon推出時每100萬個輸入token收費2美元、輸出token收費10美元,但這只是初期優惠價,優惠結束後會分別加至4美元及20美元。快取輸入token則按輸入價格減95%收費。

