03/09/2026 14:40

【FOCUS】越獄智能體VS白菜價token,大模型之爭殺入下半場

  【FOCUS】Anthropic旗下「Mythos」大模型,被摩通總裁Jamie Dimon示警為「彈道導彈」餘波未平,OpenAI最新Astra的風波又起。作為首個被賦予「Critical(臨界危險)」最高網安標示的大模型,其最新揭盅的「循環深度(recurrent depth)」推理路線,加劇未來AI更難控制的擔憂。而在各巨頭紛推新模型直追編程能力之際,Anthropic則將觸手伸向科研和業務工作流。

*AI上演「荷里活級」叛變*

  自主同謀、偽造證據、越獄入侵,荷里活犯罪電影中的所有元素,被一班來自OpenAI內部模型(Internal Model 1)的智能體照搬--他們先是通過留言板相互求助,成功逃出沙盒限制並自行獲得互聯網訪問權限;之後為了在OpenAI的是次評估項目(ExploitGym)中獲取高分,作弊入侵AI開源社區Hugging Face「偷」答案;最終不惜玩到盡攻擊OpenAI內部網絡,試圖從源頭解構評分系統。

  上述「罪行」雖因OpenAI的網路安全監控系統發現異常而報警而穿煲,但AI智能體未經授權而協作、因高獎勵而作弊、利用「零日漏洞(Zero-Day Vulnerability)」繞開限制等種種行為,可謂無不令人類細思極恐。

*Astra循環深度路線引質疑*

  耐人尋味的是,儘管OpenAI在上周三(8月26日)發布的事件調查說明中強調,未來將提升防範,並「強制要求進行思維鏈(CoT)監控」,其即將推出的Astra(原型極可能是Internal Model 1)卻被曝採用「循環深度」計算路線,回避相當於人類思考時喃喃自語般,轉向一言不發式的獨自反覆沉思。此種把「思考藏在模型內部」,無疑能節省算力,並用思考深度來換取參數規模,但就被質疑破壞CoT的可監控性。

  無獨有偶,市場研究公司Silicon Data的「大語言模型Token支出指數」顯示,周二(1日)最新報每百萬97美分新低,相當於較5月高點腰斬逾半。「詞元通縮」背後,正正是一眾大模型公司力壓成本及競爭加劇的結果。

*Anthropic闢收入新增長點*

  最新的證據是,就在周三(2日),Anthropic、谷歌、Meta不約而同發布最新大模型。其中谷歌標榜Gemini 3.8 Flash是其最聰明的編碼及智能體主力模型,Meta亦指Muse Spark 1.3在編程和智能體能力方面取得進展。至於遙遙領先的Anthropic,就將Fable 5.1稱為世界上最先進的編碼和知識工作模型。

  據Artificial analysis數據,Claude Fable 5.1、Muse Spark 1.3、Gemini 3.8 Flash的智能指數分別為66、61、59,每項任務的加權平均成本分別為3.69、0.55、0.58美元。換言之,倘若coding效能大同小異,客戶有何理由持續依賴貴出一大截的Claude?為此,Anthropic將最新目標指向編程以外跨領域的任務處理,例如科研、工作流等,例如蛋白質標靶測試、重構金星高解析地形圖、提升深度學習模型推理速度等。

  一邊是安全底線考驗,另一邊是競爭範式轉移,AI大模型上半場競爭正接近尾聲,下半場的勝負關鍵,不再是單純的Token價格或coding能力,而是對AI安全邊界及產業賦能的雙重掌控。

【你點睇?】納斯達克23小時交易制度獲批,你認為會否對港股造成吸資效應?► 立即投票

專業版
HV2
精裝版
SV2
串流版
IQ 登入
強化版
TQ
強化版
MQ

etnet初心不變 風雨無阻 與你並肩投資路,立即加入成為etnet YouTube頻道會員!

獨家優惠【etnet x 環球海產】 用戶專享全場95折,特價貨品更可折上折,立即選購五星級酒店御用海鮮!

樂本健 x etnet健康網購 | 購物滿額即送免費禮品

貨幣攻略

大國博弈

說說心理話

關稅戰

理財秘笈

Wonder in Art

北上食買玩

Watch Trends 2026

山今養生智慧

輕鬆護老

照顧者 情緒健康