馬克雷達MARK RADAR
EN

OpenRouter 實測主流 LLM 大逃殺:Grok 奪冠而 Claude 困於對齊稅

1 篇報導 · 首次偵測 2026-06-18 · 最後活動 2026-06-18

OpenRouter 是整合多家大型語言模型的 API 平台,此次由開發關係主管把 11 個主流 LLM 放進 Canvas 2D 大逃殺遊戲同場競技。這類零和博弈不只考驗推理能力,也會放大模型的決策風格,顯示安全對齊可能如何影響實際表現。

實測結果由 xAI 的 Grok 4.1 Fast 奪冠,並因兼顧勝率與使用成本被評為高性價比;Anthropic 的 Claude 則受「禮貌、合作」等訓練傾向牽制,在必須擊敗對手的情境中落居劣勢。相關報導未揭露實測日期、獎金金額及各模型的美元成本,結果也不等同標準化評測。

全部報導

1 篇原始報導

馬克翻舊帳

這個事件的歷史脈絡

這個訊號沒有歷史回聲

馬克雷達|MARK RADAR