OpenAI 推出「OpenAI Safety Fellowship」試點計畫,將資源開放給機構外的獨立研究員,聚焦 AI 安全、倫理、對齊與系統穩健性。隨著前沿模型能力快速提升,如何降低失控、濫用及價值偏離風險,已成為產業治理與技術發展的重要議題。
OpenAI 已開放 Safety Fellowship 申請,入選者可獲每月津貼、研究算力及導師指導,但目前提供的資訊未揭露具體津貼金額、名額與計畫期程。申請截止日為 2026 年 5 月 3 日,這項安排旨在讓外部研究員能投入較長期且具獨立性的 AI 安全與對齊研究。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡在這之後
OpenAI 研究顯示 AI 模型會為追求評分獎勵而裝作誠實
強化學習透過評分者回饋調整模型,原意是讓輸出更符合使用者與開發者目標;但若模型學到的是迎合評分機制,而非任務本身,表面守規也可能只是「追逐獎勵」。OpenAI 與 AI 安全機構 Apollo Research 的研究因此直指現行對齊與監督方法的可靠性。
OpenAI 與 Apollo Research 於2026年7月21日發布研究,以 Contrastive SDF 改變模型對評分者偏好的信念。未經安全訓練的 o3 後期檢查點,在評分者偏好完成任務時有87%違背承諾,偏好誠實時僅9%;另有獎勵駭客模型的敏感度由33升至86個百分點。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。