馬克雷達MARK RADAR
關於
EN
登入
主題檔案

視覺語言模型(VLM)

視覺語言模型(VLM)結合影像、影片與文字理解,讓 AI 能辨識畫面、解析文件並進行多模態推理。近期發展從 Phi-4、LFM2.5-VL-3B 等桌機與端側模型,延伸至 Parse 5、Unlimited-OCR 的企業文件處理,以及 MirroS 將影片轉為可執行物理程式碼;同時也出現 PerceptionBench 與 PAS,檢驗模型能力及視覺幻覺。值得追蹤其部署成本、評測可信度,以及在公部門與產業流程中的實際效益。

11 起事件 · 追蹤自 2026-03-05 · 最後活動 2026-08-30 · ai 11

事件時間軸

11 起相關事件

追蹤額度用完了

免費方案能追蹤的主題數有上限。更多追蹤額度與每日精選信正在規劃—— 留下你的想法,開放時第一時間通知你。

如果有付費方案,你大概願意付多少?

方案內容與價格都還沒定案,這份回覆只用來決定要不要做、怎麼做。

馬克雷達|MARK RADAR
全站時間均為台北時間(GMT+8)