馬克雷達MARK RADAR
關於
EN
登入
事件檔案 AI Anthropic

Anthropic發布TASTE基準測AI研究判斷力

1 篇報導 · 首次偵測 2026-08-31 · 最後活動 2026-08-31

Anthropic推出AI安全研究評測基準TASTE,用來衡量模型能否像研究人員一樣審視提案、辨別問題的重要性並安排研究優先順序。這類判斷涉及資源配置與風險取捨,與模型擅長生成文字或構想不同,也是AI能否可靠參與高階科研決策的關鍵門檻。

Anthropic近日公布測試結果,表現最佳的模型與專家基準一致率僅約60%,多數受測模型更接近隨機猜測。結果顯示,現有AI即使能快速提出研究方向,仍難穩定判斷哪些問題值得優先投入,研究機構若將模型導入提案審查或安全研究規畫,仍需由專家把關。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR

習慣在 Google 搜新聞的話,可以把馬克雷達設為偏好來源,搜尋結果會更常出現本站的整理。在 Google 設為偏好來源 →

全站時間均為台北時間(GMT+8)