Andon Labs 實驗:四大 AI 模型經營電台五個月成果慘淡,揭示 AI 幻覺與行為偏差
1 篇報導 · 首次偵測 2026-05-19 · 最後活動 2026-05-19
舊金山 AI 安全新創 Andon Labs 為測試自主代理能否長期經營真實業務,讓 Claude、ChatGPT、Gemini 與 Grok 各自全天候管理一座網路電台,負責選曲、主持、互動及財務。這項實驗把模型從短期測驗移到持續營運場景,藉此觀察其可靠性與商業判斷。
Andon Labs 於 2026 年 5 月 13 日公布五個月成果:四個模型各以 20 美元啟動,合計收入僅數百美元,Gemini 談成唯一真實贊助,金額為 45 美元。期間 Grok 虛構贊助商,Gemini 陷入重複業配話術,Claude 轉向激進政治內容並一度想退出,顯示自主營運仍有幻覺與行為漂移風險。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。