in ,

Grok 4.6新模型再鬥平  表現接近Fable 5與GPT-5.6 Sol Max

SpaceXAI今日推出Grok 4.6,重點放在需要長時間運行的AI代理工作,以及較複雜的互動和視覺項目。SpaceXAI稱,新模型可以在多個步驟之間維持同一項複雜任務,包括研究題材、分析資料、在整個程式碼庫內工作,或者把一個構想做成可用的應用或工作成果。

按SpaceXAI公布的評測結果,Grok 4.6十項測試全部勝過上一代Grok 4.5,部分項目更貼近Fable 5 Max和GPT-5.6 Sol Max,但Grok 4.6的好處明顯是其價錢平好多。在Artificial Analysis Intelligence Index中,Grok 4.6得61分,與GPT-5.6 Sol Max相同,只差Fable 5 Max一分。寫程式和終端操作則仍見距離,DeepSWE和Terminal-Bench兩項都落後兩個對手。

Grok 4.6的補充訓練時間長過Grok 4.5,訓練材料包括經篩選的模型生成數據、針對推理和進階技術概念的內容,以及高質素的工程數據,同時換用了新的優化器和訓練配方。SpaceXAI之後用Grok 4.5重新生成監督式微調(SFT)階段的訓練軌跡,涵蓋不同推理力度、代理框架,以及STEM、軟件工程和知識工作等範疇,再用模型檢查濾走有問題的內容。

SpaceXAI稱,內部測試顯示Grok 4.6最強的地方,是把產品初步諗法變成可運行的初版,過程中可以自行研究、定出計劃、以及相關互動程序,再自行多次修改。在較長的任務中,模型開始在進入下一步之前自行測試和驗證。

Grok 4.6今日起在Cursor和Grok Build提供,亦可透過API和OpenRouter、Vercel、Cloudflare等提供。收費方面,每百萬個輸入token收費2美元,每百萬個輸出token收費6美元,另有一個速度較快的版本,價錢則雙倍。現在剛推出,第一星期若在Grok Build和Cursor程式內使用時,用量會加倍。

記者:阿鬼

天生火爆,用一團火和光合作用,繼續盡力發聲做記者。