研究揭示頂尖 AI 模型在長時專注力與認知控制任務中存在顯著弱點
1 篇報導 · 首次偵測 2026-06-11 · 最後活動 2026-06-11
斯特魯普任務要求受試者忽略顏色詞字義、辨認字體顏色,是心理學衡量抑制干擾與執行控制的經典工具。紐約市立大學皇后學院與德州農工大學醫學院團隊以此檢驗 Transformer,指出 LLM 的「注意力」不等同人腦持續維持目標的控制機制,攸關長文件分析與監控可靠性。
研究於2025年1月23日先登上 bioRxiv,2026年6月2日刊於《PNAS Nexus》。GPT-4o處理不一致色詞時,準確率從5字清單的91%、10字的57%,降至40字的15%;Claude 3.5 Sonnet在20字前尚穩定,40字跌至24%,混合清單的不一致項目更接近0%。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。