大型語言模型在訓練與推論前,必須先透過 BPE 等方法將文字切分為 token;面對龐大資料集時,斷詞速度可能成為文本編碼與預處理的瓶頸。高效且相容多種模型的工具,因此可望縮短資料準備時間並降低運算資源占用。
史丹佛大學博士生 Marcel Rød 近日開源以 Rust 打造的 BPE 斷詞庫 Gigatoken,處理速度最高達每秒 24.53 GB。公布的效能數據顯示,它最快比 HuggingFace Tokenizers 高出 989 倍,並已支援 GPT-2、Llama、DeepSeek 等 23 種主流大型語言模型。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。