開源 AI 與封閉式前沿模型相比只「落後 4 個月」, 但便宜 10 倍
請查看你的收件匣,確認信中可讓你調整偏好設定, 甚至加入其他群組。
在你喜愛的社群媒體平台上追蹤 TNS。
開源 AI 與封閉式前沿模型相比只「落後 4 個月」, 但便宜 10 倍
AI 模型領域正醞釀一場低調的革命。專有的封閉式前沿模型 憑藉全球大眾的高度關注,已穩固其主導地位;這股關注也一路向上擴散,讓從 美國 到 歐洲 與 中國&firstPage=true) 的政府與監管機構都產生興趣。
儘管這些模型占據主導地位,開源社群卻很少避戰(還記得 Windows 嗎?以及如今的 Linux 和 Android?);開源倡議者主張,專有模型不過是企業級的外包裝,包裹著具備記憶能力、可觀測性控制、路由智慧與連接器的模型)。
如果開源模型每個 token 的成本大約低 10 倍,那可說是相當昂貴的包裝紙。
來自大型企業的恐懼行銷因素
AI 代理整合新創公司 Apelogic 的創辦人兼執行長 Boris Renski 告訴 The New Stack,前沿實驗室正「全力散播恐懼」,強調那些格外聰明、危險的模型,以及 AGI 即將到來。
「那種恐懼訴求,目的就是要轉移大家對那些基準測試的注意力;那些測試顯示,開源模型只落後四個月,成本卻只要一小部分,」Renski 說。「這代表多數時候,企業付錢給 OpenAI 或 Anthropic,買的其實不是智慧本身,而是模型周邊那些『商品化的企業功能(commodity enterprise features)』,例如 IDP 整合、MCP 連接器 和可觀測性(observability)。」
「多數時候,企業付錢給 OpenAI 或 Anthropic,買的其實不是智慧本身,而是模型周邊那些『商品化的企業功能』,例如 IDP 整合、MCP 連接器和可觀測性。」
Renski 的憂慮,很大一部分來自他打造開源基礎設施公司的二十年經驗;他說,自己一路看著「開源總會追上,而且往往在能力與採用度上反超」那些垂直整合的專有技術堆疊。這是一再重演的模式,他認為從 Windows 對 Linux、Oracle 對 MySQL、Docker Enterprise 對 Kubernetes 等案例中都看得出來。
這會不會又是一次 Oracle 式的所有權負擔重演?
「幾年後,企業回頭看自己和前沿實驗室簽下的多年期 LLM 合約時,感受會跟今天看 Oracle 授權一樣,但到那時候就太晚了。因為他們業務的整體運作,早已和專有 LLM 供應商深度交織在一起,想遷移也不可能了,」Renski 警告。
Jonathan Bryce,Cloud Native Computing Foundation(CNCF,雲端原生運算基金會)執行董事,也認同這種說法。他告訴 The New Stack,為了領先四個月的能力而多付十倍成本,如今「根本不能算是企業 AI 策略」。
「這顯然不是審慎的做法或策略,」Bryce 說。「實際上,這是一種代價非常高的綁定。前沿一直在移動,所以開發者應該建立在開放基礎設施之上,這樣每次排行榜一變動時,他們才能在不必重建整個應用程式的情況下,更換模型和硬體。」
Renski 對這件事直言不諱的看法(以及 Bryce 的認同),剛好也呼應了無伺服器推論平台公司 Featherless 提出的一些大膽主張。該組織宣稱,透過對 Z.ai GLM 5.2 這個開放權重的中文 AI 模型進行原生最佳化,它可以「大幅砍掉前沿 AI 的成本」。
等等,每月 1,000 億個 token 到底是多大規模?
該公司在週一發布了一份聲明,內容指出,其在 AMD 私有雲基礎設施上進行原生最佳化的 GLM 5.2 模型,可將前沿等級 AI 推論費用大幅降低,估計降幅達 94%。根據 Featherless 的說法,對於一支滿載運作、每月使用約 1,000 億個 token 的開發團隊來說,GPT-5.5 的年成本為 1,557,600 美元;若使用 Claude Opus 4.8,相同的每月工作負載年成本則為 1,506,000 美元。
如果 1,000 億個 token 聽起來已經很多,那麼今年援引 Deloitte 研究的報導指出,一家醫療保健企業在六個月內就消耗了 1 兆 個 token。
相較於它對專有模型的成本估算,Featherless 的私有雲方案則把這些變動因素都吸收到固定的年費 90,000 美元中,讓一支滿載使用的開發團隊每年可省下超過 146 萬美元。
推論沒有差別
我們真的會走到那一步嗎?也就是大型前沿品牌終於感受到開源與開放權重模型帶來的壓力,最後讓開發者(以及使用者)甚至根本不會去想,他們的推論到底跑在哪種硬體上?
Isaac Gemal,Featherless 的開發者關係主管,向 The New Stack 表示,開放權重模型過去常被認為比較差,或不足以勝任真正的工作,但現在「GLM 5.2 已經徹底翻轉了這種說法」。那麼,要讓 GLM 5.2 原生跑在 AMD 而不是 Nvidia 硬體上,到底有多容易?開發者又該留意哪些陷阱?
「大型實驗室常會講一些像是……『除了 XYZ 情況外,我們不會記錄你的請求』之類的話,但凡是他們自家系統判定為『不安全』的內容,最後還是會被保留下來,有時甚至一放就是好幾年,完全取決於他們自己的裁量。他們的區分標準通常很模糊,而且涵蓋範圍非常廣。我們認為這種做法本末倒置。」
「這並不容易;GLM 5.2 的需求甚至高於我們的預測,這讓我們很意外,所以一開始如何有效分配 GPU 資源是一大挑戰,」Gemal 說。「我們有一支非常優秀的工程團隊,直接與 Tensorwave 合作,確保這些大型模型的部署能夠順利進行。」
實際上,確實有一些營運上的限制與陷阱需要留意。Gemal 建議開發者特別注意記錄隱私政策裡那些藏得很深的附帶條款。
「大實驗室常常會說一些類似這樣的話……『除非是 XYZ 情況,否則我們不會記錄你的請求』,但只要是他們自家系統判定為『不安全』的內容,最後還是會被保存下來,而且有時一放就是好幾年,完全由他們自行裁量。他們的區分標準通常很模糊,而且範圍非常廣。我們認為這種做法是開倒車,我們非常重視隱私,」Gemal 說。
真實世界的開發者怎麼看?
這裡最終的試金石,顯然還是得回到真實世界的開發者與資料科學實務工作者,看看他們怎麼看待這些開放替代方案。
波蘭 Screen Studio 的軟體工程師 Kacper Michalik 告訴 The New Stack,他一直在實際工作中測試一款開放權重模型(正是 GLM 5.2),並拿它和 Opus 4.8 這類封閉模型比較,也就是用在資料工程技術棧研究、演算法問題,以及元件生成等任務上。
「在技術研究任務上,GLM 5.2 給我的結果和 Claude Opus 4.8 類似,甚至更好,」Michalik 說。「它涵蓋面很廣,會主動延伸相關主題,甚至還會產出實用的視覺化圖表。在一道程式面試題上,我比較了 GPT、Claude 和 GLM。GPT 很會解釋思考步驟,但沒有給程式碼;Claude 精簡清楚,但對複雜度的說明偏簡略;GLM 則落在中間,也就是重點清楚、用文字一步一步解釋得很扎實,而且還給出了一個可運作的 Python 解法。」
Michalik 指出,只要提示夠清楚,他認為結果相當出色。GLM 也做出了一個使用 Zod 與 TypeScript 的 React 表單元件,不但能正確運作、型別設計良好,也能妥善處理欄位並清楚顯示驗證錯誤。他進一步說明,它預設會使用 Tailwind 來做樣式,這在現在已經是標準做法。
「它並不完美,」Michalik 解釋道。「當我請它用 React 和 TypeGPU 在單一檔案中建立一個 3D 場景時,它沒辦法正確渲染結果;我原本預期它在完整專案生成上會更接近 v0 或 Lovable。到了傍晚,我也碰上了使用額度限制的警告。」
開源 AI 模型的安全性,以及衝向終點線的競賽
由於這些開放式 AI 模型之中有不少來自中國,安全性的疑慮勢必得被攤到檯面上討論。
開源 CMS 公司 Umbraco 的資深工程師 Phil Whittaker 告訴 The New Stack,他同意開放權重(open-weight,並非 open-source)AI 模型大約落後前沿模型四到五個月,但事情並不只有這麼簡單。
「我不確定我是否同意這些模型便宜 10 倍的說法,因為那完全取決於規模以及目標是什麼,」Whittaker 表示。「不過,是的,多數開放權重模型確實來自中國。直接連接到供應商的 AI 端點,會牽涉到安全與隱私問題。改用像 Ollama 這樣的第三方供應商會比較好,但成本是以 token 計價,而且不同模型之間 tokenizer 的差異,可能代表成本頂多只降低 50%。」
Whittaker 最後補充,自行託管(self-hosting)也是一個選項,但那需要前期資本支出(伺服器)以及持續維護。他指出,從基準測試與實際經驗來看,GLM 5.2 正在「接近」Anthropic 的 Opus 4.8 的智慧水準。但這裡的但書是,雖然它速度沒那麼快,卻比起代理式(agentic)程式設計工具更適合長時間執行、且可獨立完成的任務,因為在後者情境中,推論速度非常重要。
「結果也取決於驅動模型的 harness 品質,」Whittaker 補充道。「隨著模型越來越商品化,而一般使用者的需求也能由品質較低的模型完成,harness 以及它的配置方式會變得更加重要。」
這裡牽涉的變動因素非常多,而當我們進入這場可能已跑到中段衝刺的位置時,再把 AI 的發展說成一場「競賽」,聽起來已經有些陳腔濫調。或許我們真正需要分析的是:這場比賽裡到底有多少匹馬、牠們被餵養的是什麼,以及誰手上握著韁繩。
由社群為開發者打造的路線圖、文章、資源與學習旅程,幫助你選擇自己的方向,並在職涯中持續成長。
