主題檔案
強化學習(RL)
+ 追蹤強化學習(RL)是一種讓系統透過行動、回饋與獎勵,逐步學會決策策略的機器學習方法。近期進展涵蓋 KataGo 棋類競技、德州撲克與搜尋 Agent、機器人控制、晶片設計,以及支援萬億參數模型的訓練基礎設施;研究也開始關注 CoT 監控、泛化能力與低成本提示詞優化。RL 正從封閉遊戲走向現實任務,但可靠性、對齊與跨情境適應仍待驗證,值得持續追蹤其技術突破與部署成效。
31 起事件 · 追蹤自 2026-03-08 · 最後活動 2026-09-01 · ai 31
關鍵節點
精選 6 則依事件數把完整歷史等分成 6 個時期,每期取報導最多的一則。報導量會隨新聞供給起伏,分期取樣才不會讓最近的事件通吃。
事件時間軸
31 起相關事件訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。