事件檔案
AI
Perplexity發表WANDR基準測試評估AI代理
1 篇報導 · 首次偵測 2026-07-19 · 最後活動 2026-07-19
隨著人工智慧從問答工具演進為能自主執行複雜任務的「AI代理」,業界對評估其搜尋與分析能力的基準測試需求日益迫切。傳統評測多聚焦於單一事實檢索,難以衡量代理在面對龐雜資訊時,能否兼顧搜尋廣度與資料深度的真實研究能力。因此,建立一套能驗證其能否建立有證據支持之大型資料集的評估系統,成為當前關鍵。
AI搜尋引擎公司Perplexity於2026年7月14日推出名為「WANDR」的開源基準測試。該測試專為評估AI研究代理在廣度與深度資料搜集時的表現而設計,包含500個具挑戰性的知識工作任務,以及約170,495筆證據紀錄。系統採用動態評估機制,重新獲取引用網址以驗證代理產出資料庫的真實性。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。