馬克雷達MARK RADAR
EN

Kimi 團隊發表 Attention Residuals 論文獲馬斯克點讚,作者包含 17 歲高中生

2 篇報導 · 首次偵測 2026-03-23 · 最後活動 2026-03-23

大型語言模型普遍採用 PreNorm 殘差連接,將各層輸出固定累加;模型愈深,隱藏狀態可能持續放大,單層新資訊因而被稀釋。中國 AI 公司月之暗面(Moonshot AI)旗下 Kimi 團隊提出 Attention Residuals(AttnRes),改以 softmax 動態選取前層表徵,改善深層模型的資訊傳遞與運算效率。

Kimi 團隊於2026年3月16日發布論文,並將 AttnRes 導入 Kimi Linear,以總參數480億、啟用參數30億的模型進行1.4兆個 token 預訓練,各項評測均勝過基準。Elon Musk 同日在 X 稱「Impressive work」;37名作者中,17歲深圳高中生陳廣宇與張宇、蘇劍林為同等貢獻的共同第一作者。

全部報導

2 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR