OpenAI推出GPT-6 Sol及GPT-6 Luna,把GPT-6系列的更新帶到收費較低的模型,重點是降低用戶長時間處理工作和寫程式的成本。兩款新模型採用與GPT-6 Astra相近的訓練方法,OpenAI稱它們在處理事實、程式開發及操作電腦等方面均有改善,API收費亦較上一代優惠價進一步下調。Astra仍然是系列中定位最高的選擇,Sol和Luna則讓用戶按工作難度及預算選用。至於與同一日推出的Claude Opus 5.5相比,若以分數來說,GPT-6 Sol與GPT-6 Luna表現明顯差很多。
減價最直接反映在開發者的API賬單。按每100萬token計,GPT-6 Sol的輸入收費由上一代的4美元降至2美元,輸出由20美元降至10美元,兩者均減半。Luna的輸入收費由0.20美元降至0.10美元,輸出則由1.20美元降至0.50美元,後者實際減幅超過一半。這些比較採用GPT-5.6 Sol及Luna的優惠價,屬API按用量收費,並非ChatGPT訂閱月費減價。
對需要反覆讀取同一批資料的AI代理,OpenAI亦從快取入手減少開支。GPT-6會更有效重用之前已處理的輸入內容,讀取已快取內容的費用較一般輸入低九成。開發者在對話中調高或調低模型的思考程度,或啟用及停用工具時,也可以保留之前內容供快取重用,毋須因這些改動而失去原有的節省。新增的監察及診斷工具則讓開發者查看哪些內容成功使用快取,以及哪些地方仍有改善空間。
較低收費針對的是需要AI持續處理多個步驟的工作,包括跨應用程式辦公及修改軟件。OpenAI採用的AutomationBench,測試AI代理使用47種工具處理銷售、市場推廣及行政等任務,Sol在xhigh思考設定下,每項任務成本約為0.27美元。程式開發方面,FrontierCode除了檢查程式是否正確,也評估測試質素、修改範圍及是否符合原有程式庫的要求。OpenAI稱Sol在這項測試較上一代有明顯進步,希望配合較低的API收費,讓開發者有更多預算反覆修改及測試。
與同一日推出的Claude Opus 5.5相比,Sol在兩項已公布測試的分數仍然較低。AutomationBench方面,Sol在xhigh設定下取得33.2%,Opus 5.5公布的成績則為40.0%。另一項測試AI操作電腦的OSWorld 2.0,Sol在xhigh設定下取得60.5%,Opus 5.5則為81.8%。不過,值得一提嘅係,兩邊數字來自各自公布的測試,思考設定亦有不同。
除了價錢及測試成績,OpenAI亦希望新模型答得更準確和直接。內部事實準確度測試顯示,Sol的錯誤數量約為上一代的一半,但測試材料特別選自用戶曾指出模型答錯的對話,不能當成一般使用時的錯誤率。Sol及Luna也沿用Astra對回答方式的調整,減少術語、生硬句子及用處不大的細節,在保留實質內容的同時稍為縮短答案。官方展示的網站修改例子,重點包括較清楚交代已完成哪些檢查,以及避免向用戶重複不必要的技術細節。
兩款模型已開始向ChatGPT Work及Codex的Plus、Pro、Business、Enterprise和Edu用戶推出,Free及Go用戶則可在桌面應用程式使用GPT-6 Luna。OpenAI表明,新模型尚未在Chat提供,ChatGPT的推出安排亦會分批進行,因此並非所有用戶會同時見到新選項。開發者可經API使用gpt-6-sol及gpt-6-luna,按各自工作所需選擇模型及思考程度。
