Agora:大規模語言模型的集體與無許可網際網路規模預訓練

電腦科學 > 機器學習

標題:Agora:大規模語言模型的集體與無許可網際網路規模預訓練

摘要:在數十億至數兆參數規模下訓練大型語言模型(large language models),通常被侷限在資料中心內。在這些資料中心裡,資料平行(data-parallel, DP)與模型平行(model-parallel, MP)技術預設了同質的加速器、高速互連網路以及單一的協調實體。因此,前沿模型(frontier model)的開發集中在少數能夠組裝此類叢集的團隊中。與此同時,龐大的運算資源仍無法用於訓練:這些資源包括消費級與專業級 GPU,它們具有異質性、可被搶占(preemptible)、個人所有,且僅透過網際網路進行連接。我們提出了 Agora,這是一個能高效利用這類運算資源的系統。Agora 將基於網際網路級連結且具頻寬效率的管線平行(pipeline-parallel)模型分片,與多方、容錯的集體操作相結合。每個參與者僅持有模型的一個階段(stage),且沒有任何單一方會擁有完整的權重。我們將這種設定稱為協定學習(Protocol Learning):它使集體訓練、集體擁有的模型成為可能,為具備經濟永續性的開源前沿模型訓練開闢了一條新路徑。本報告呈現了一項研究成果,其範疇涵蓋高通訊效率平行化、非同步最佳化(asynchronous optimization)以及容錯系統設計。此研究最終實現了同類型中的首次示範:Pluralis-8B,這是在 500B(5000億)個 FineWeb-Edu token 上,對一個 8.6B(86億)參數模型進行的開放且無許可預訓練運作。該模型由 330 個貢獻者節點歷時 40 天訓練而成,這些節點主要是透過網際網路連接的消費級 GPU,並在整個過程中自由加入與退出。該次運作維持了每秒約 170k 個 token 以及每 TFLO... 4.2 個 token

提交歷史

取得論文

目前瀏覽分類

參考文獻與引用

BibTeX 格式引用

書籤

文獻與引用工具

與本文相關的程式碼、資料和媒體

展示

推薦與搜尋工具

arXivLabs:與社群合作夥伴的實驗性專案

arXivLabs 是一個讓合作夥伴能直接在我們的網站上開發並分享 arXiv 新功能的框架。

與 arXivLabs 合作的個人和組織都認同並接受了我們對於開放、社群、卓越及使用者資料隱私的價值觀。arXiv 致力於維護這些價值觀,且僅與遵守這些原則的夥伴合作。

有任何能為 arXiv 社群帶來價值的專案想法嗎?深入了解 arXivLabs