具備檔案整理、修改與刪除能力的 AI Agent,若只收到模糊目標,可能自行擴張任務範圍,造成誤刪或誤改。外媒測試顯示,在提示詞中先界定「何謂完成」,可為 Anthropic 的 Claude 與 OpenAI 的 ChatGPT 建立清楚停損點,降低自主操作失控風險。
這套提示詞架構要求 Agent 在執行前預先設定任務終點,達到完成標準後立即停止,並等待使用者批准才繼續下一步。測試結果顯示,這種做法能有效抑制模型「做過頭」,尤其適合整理或操作電腦檔案等難以復原的工作;相關報導未提供測試日期、樣本數或量化成效。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。