馬克雷達MARK RADAR
關於
EN
登入
主題檔案

強化學習(RL)

強化學習(RL)是一種讓系統透過行動、回饋與獎勵,逐步學會決策策略的機器學習方法。近期進展涵蓋 KataGo 棋類競技、德州撲克與搜尋 Agent、機器人控制、晶片設計,以及支援萬億參數模型的訓練基礎設施;研究也開始關注 CoT 監控、泛化能力與低成本提示詞優化。RL 正從封閉遊戲走向現實任務,但可靠性、對齊與跨情境適應仍待驗證,值得持續追蹤其技術突破與部署成效。

31 起事件 · 追蹤自 2026-03-08 · 最後活動 2026-09-01 · ai 31

關鍵節點

精選 6 則

依事件數把完整歷史等分成 6 個時期,每期取報導最多的一則。報導量會隨新聞供給起伏,分期取樣才不會讓最近的事件通吃。

  1. 2026-08-27 Hugging Face 發表開源 AI 輪滑小鴨機器人 7 則報導
  2. 2026-08-18 字節跳動與清華推出 CUDA Agent 強化學習系統優化 GPU 運算 1 則報導
  3. 2026-07-28 Kimi AI 團隊開源 AgentENV 分散式 Agent 強化學習訓練系統 1 則報導
  4. 還有 3 則關鍵節點 註冊即可查看完整脈絡

事件時間軸

31 起相關事件

追蹤額度用完了

免費方案能追蹤的主題數有上限。更多追蹤額度與每日精選信正在規劃—— 留下你的想法,開放時第一時間通知你。

如果有付費方案,你大概願意付多少?

方案內容與價格都還沒定案,這份回覆只用來決定要不要做、怎麼做。

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)