微軟研究揭露先進 AI 模型處理長流程文件仍具內容劣化風險
1 篇報導 · 首次偵測 2026-05-21 · 最後活動 2026-05-21
企業正將大型語言模型導入 AI 代理與 RAG 系統,讓模型接手多輪文件編修;但這類委派工作仰賴模型保留原意與既有內容。微軟研究院因此建立 DELEGATE-52,涵蓋程式、會計、科學等 52 個專業領域,檢驗長流程可靠性。
微軟研究院於 2026 年 4 月發表論文,測試 6 個模型家族、共 19 款 LLM;經 20 次互動後,Gemini 3.1 Pro、Claude 4.6 Opus 與 GPT-5.4 等前沿模型平均劣化 25%,全體平均逾 50%。代理工具未改善結果,文件愈長或互動愈多,錯誤愈嚴重。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。