馬克雷達MARK RADAR
關於
EN
登入

Kimi 團隊發表 Attention Residuals 論文獲馬斯克點讚,作者包含 17 歲高中生

2 篇報導 · 首次偵測 2026-03-23 · 最後活動 2026-03-23

大型語言模型普遍採用 PreNorm 殘差連接,將各層輸出固定累加;模型愈深,隱藏狀態可能持續放大,單層新資訊因而被稀釋。中國 AI 公司月之暗面(Moonshot AI)旗下 Kimi 團隊提出 Attention Residuals(AttnRes),改以 softmax 動態選取前層表徵,改善深層模型的資訊傳遞與運算效率。

Kimi 團隊於2026年3月16日發布論文,並將 AttnRes 導入 Kimi Linear,以總參數480億、啟用參數30億的模型進行1.4兆個 token 預訓練,各項評測均勝過基準。Elon Musk 同日在 X 稱「Impressive work」;37名作者中,17歲深圳高中生陳廣宇與張宇、蘇劍林為同等貢獻的共同第一作者。

全部報導

2 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR

習慣在 Google 搜新聞的話,可以把馬克雷達設為偏好來源,搜尋結果會更常出現本站的整理。在 Google 設為偏好來源 →

全站時間均為台北時間(GMT+8)