低延遲與推論成本已成為 AI Agent 商用化的關鍵,因為多步驟工作會反覆呼叫模型,速度與每次請求成本都會被放大。Google 以 Flash 系列鎖定大量、低成本工作負載;OpenAI 則以旗艦 GPT-5.6 Sol 爭取複雜專業任務,競爭正從模型能力延伸至推論效率。
Google 於2026年8月13日推出 Gemini 3.7 Flash,12月31日前每百萬輸入、輸出 token 收0.75與3.75美元。OpenAI 同日預覽 GPT-5.6 Sol Ultrafast,由 Cerebras 加速,每秒最高輸出750個 token、比標準處理快14倍,目前僅供受邀 API 客戶,定價未公布。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Google 傳推出 Gemini 3.7 Flash 且 API 價格砍半
Google 的 Gemini Flash 系列以低延遲、較低成本服務大量推論、程式開發與 AI 代理工作。若 Gemini 3.7 Flash 的效能與降價消息屬實,將直接衝擊 OpenAI、Anthropic 等業者的模型定價,也可能降低企業部署代理式 AI 的門檻。
截至 2026 年 8 月 14 日,多篇報導稱 Google 已推出 Gemini 3.7 Flash,API 費率為每 100 萬輸入 tokens 0.75 美元,輸出價格也傳降至原水準一半,優惠延續至年底。Google 官方 Python SDK 的 GitHub 曾出現相關模型選項 PR,約 15 秒後即更名並關閉,但官方定價文件仍待確認。
Google 發布 2026 年 7 月最新 AI 成果與 Gemini 模型
Google 以 Gemini 為核心,將生成式 AI 從聊天工具推向可規劃、呼叫工具並完成多步驟任務的 Agent,應用也逐步延伸至搜尋、開發平台與機器人。Flash 系列強調速度、成本與推理能力的平衡,攸關企業能否大規模部署 AI 工作流程。
Google DeepMind 7 月 21 日推出 Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite。前者輸出 Token 較 3.5 Flash 少 17%,每百萬輸入/輸出 Token 定價 1.50/7.50 美元;後者每秒輸出 350 Token,定價 0.30/2.50 美元,並開始導入 Google Search。
Google發表三款Gemini新模型
生成式 AI 競爭正從聊天機器人轉向可連續呼叫工具、執行多步任務的 AI 代理,企業因而更重視 Token 成本、回應速度與資安能力。Google 以 Gemini Flash 系列補強輕量模型陣容,藉此擴大 Gemini API 生態系並提高大規模部署的經濟性。
截至 2026 年 7 月 29 日,Google 發表 Gemini 3.6 Flash、3.5 Flash-Lite 與 3.5 Flash Cyber 三款模型,主打更快運算與更高 Token 效率。其中 Cyber 微調模型已進入漏洞修補試點;3.5 Pro 仍在測試,下一代 Gemini 4 則已啟動預訓練。
Google 發表 Gemini 3.5 Flash 模型,主打自主代理與程式開發
Google於2026年Google I/O開發者大會推出Gemini 3.5 Flash,延續Gemini多模態模型布局,鎖定高頻調用、長上下文與即時回應的AI應用。其重要性在於以Flash級成本提供超越前代Pro的效能,並強化自主代理與程式開發能力。
最新公布的Gemini 3.5 Flash在多項agent評測中超越上一代Pro,推理與處理速度提升4倍。Google並展示模型可在12小時內完成作業系統開發,總成本低於1,000美元;公司同步重申加碼AI基礎建設,反映市場已有實際需求。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。