馬克雷達MARK RADAR
EN

微軟研究揭露先進 AI 模型處理長流程文件仍具內容劣化風險

1 篇報導 · 首次偵測 2026-05-21 · 最後活動 2026-05-21

企業正將大型語言模型導入 AI 代理與 RAG 系統,讓模型接手多輪文件編修;但這類委派工作仰賴模型保留原意與既有內容。微軟研究院因此建立 DELEGATE-52,涵蓋程式、會計、科學等 52 個專業領域,檢驗長流程可靠性。

微軟研究院於 2026 年 4 月發表論文,測試 6 個模型家族、共 19 款 LLM;經 20 次互動後,Gemini 3.1 Pro、Claude 4.6 Opus 與 GPT-5.4 等前沿模型平均劣化 25%,全體平均逾 50%。代理工具未改善結果,文件愈長或互動愈多,錯誤愈嚴重。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)