馬克雷達MARK RADAR
EN

研究揭示頂尖 AI 模型在長時專注力與認知控制任務中存在顯著弱點

1 篇報導 · 首次偵測 2026-06-11 · 最後活動 2026-06-11

斯特魯普任務要求受試者忽略顏色詞字義、辨認字體顏色,是心理學衡量抑制干擾與執行控制的經典工具。紐約市立大學皇后學院與德州農工大學醫學院團隊以此檢驗 Transformer,指出 LLM 的「注意力」不等同人腦持續維持目標的控制機制,攸關長文件分析與監控可靠性。

研究於2025年1月23日先登上 bioRxiv,2026年6月2日刊於《PNAS Nexus》。GPT-4o處理不一致色詞時,準確率從5字清單的91%、10字的57%,降至40字的15%;Claude 3.5 Sonnet在20字前尚穩定,40字跌至24%,混合清單的不一致項目更接近0%。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR