AI 開發競爭正由單一基礎模型效能,轉向整合模型、代理人 Harness 與持續評估迴圈。DeepSeek、Google 等機構強化代理人基礎設施,重點在讓 AI 能規劃、執行並驗證多步驟任務;DeepSWE 則聚焦真實軟體工程流程,補足傳統編碼測試與開發者實際體驗的落差。
截至 2026 年 7 月 20 日,事件資料顯示新發布的 DeepSWE 基準測試成為焦點,被用來檢視 AI 處理程式碼庫、修復問題與完成工程任務的能力。不過唯一相關報導標題為「not much happened today」,未提供發布日期、測試分數、參與模型數、投資金額或 DeepSeek、Google 的具體時程,現階段無法核實更多量化進展。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。