OpenRouter 實測主流 LLM 大逃殺:Grok 奪冠而 Claude 困於對齊稅
1 篇報導 · 首次偵測 2026-06-18 · 最後活動 2026-06-18
OpenRouter 是整合多家大型語言模型的 API 平台,此次由開發關係主管把 11 個主流 LLM 放進 Canvas 2D 大逃殺遊戲同場競技。這類零和博弈不只考驗推理能力,也會放大模型的決策風格,顯示安全對齊可能如何影響實際表現。
實測結果由 xAI 的 Grok 4.1 Fast 奪冠,並因兼顧勝率與使用成本被評為高性價比;Anthropic 的 Claude 則受「禮貌、合作」等訓練傾向牽制,在必須擊敗對手的情境中落居劣勢。相關報導未揭露實測日期、獎金金額及各模型的美元成本,結果也不等同標準化評測。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。