主題檔案
視覺語言模型(VLM)
+ 追蹤視覺語言模型(VLM)結合影像、影片與文字理解,讓 AI 能辨識畫面、解析文件並進行多模態推理。近期發展從 Phi-4、LFM2.5-VL-3B 等桌機與端側模型,延伸至 Parse 5、Unlimited-OCR 的企業文件處理,以及 MirroS 將影片轉為可執行物理程式碼;同時也出現 PerceptionBench 與 PAS,檢驗模型能力及視覺幻覺。值得追蹤其部署成本、評測可信度,以及在公部門與產業流程中的實際效益。
11 起事件 · 追蹤自 2026-03-05 · 最後活動 2026-08-30 · ai 11
事件時間軸
11 起相關事件訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。