1 ‧ 什麼是 VLM?
VLM(Vision Language Model,視覺語言模型)是同時處理「影像」與「文字」的多模態 AI 模型——它不只辨認畫面中有哪些物件,還能理解畫面正在發生什麼,並用自然語言回答關於這個畫面的問題。
對使用者來說,最直接的差別是「怎麼下規則」。傳統影像分析要由工程師把規則寫成程式邏輯;VLM 則是用一句自然語言描述條件,模型依該描述判讀畫面。新增一條規則不需要重新訓練模型,也不需要更換攝影機。
2 ‧ 根本差異:封閉集合 vs 開放詞彙
這是兩者最本質的分野。
傳統 AI 影像辨識 — 封閉集合(closed-set)
人形偵測、車牌辨識、人臉比對、安全帽偵測等,都屬於這一類。模型在訓練時看過哪些類別,上線後就只能辨認哪些類別。想讓它多認一種東西,流程是:蒐集資料 → 人工標註 → 重新訓練 → 重新部署。
硬體式 AI 攝影機的限制更明確:模型在出廠時就燒進機器裡,現場一旦對某個場景持續誤判,除了換機器之外沒有太多辦法。
VLM — 開放詞彙(open-vocabulary)
VLM 在訓練階段看過大量「影像 — 文字」配對,因此具備把視覺內容對應到語言概念的能力。要監測什麼,用一句話描述就好;這句話不必是模型「看過的類別」,只要是能用語言表達的概念即可。
3 ‧ 關鍵差異:物件辨識 vs 情境理解
封閉/開放只是表層。更關鍵的是兩者處理的抽象層次不同。
傳統模型輸出的是物件類別與位置:畫面中有一個人、一個紙箱,各自在哪個座標。但「這個紙箱被放在消防通道上」不是一個物件類別——它是物件、空間與規範三者之間的關係,屬於情境判斷。
要用傳統模型做到這件事,必須由工程師另外定義「消防通道」的多邊形區域、設定「靜止物件停留超過 N 秒」的邏輯、再排除誤判。每多一條規則就多一次工程。VLM 則可以把畫面當成一個場景來理解,直接處理這一層。
4 ‧ 六個面向對照表
| 面向 | 傳統 AI 影像辨識 | VLM 視覺語言模型 |
|---|---|---|
| 辨識範圍 | 封閉集合,僅限訓練過的類別 | 開放詞彙,可用自然語言描述 |
| 新增規則 | 蒐集資料 → 標註 → 重訓 → 部署 | 改寫一句描述即可 |
| 處理層次 | 物件「是什麼」 | 情境「正在發生什麼」 |
| 複合條件 | 需工程師寫死邏輯 | 可直接以一句話表達 |
| 硬體綁定 | AI 攝影機出廠即定型 | 與攝影機解耦,沿用既有設備 |
| 運算成本 | 低,可連續即時處理 | 高,較適合排程或事件觸發 |
5 ‧ 三個實際規則範例
以下是安防場域實際在運行的規則,可以看出哪些是傳統模型處理得了的、哪些不行。
社區規定寵物不得於公共區域落地行走
系統判讀是否有犬隻在地面活動,並提醒管理單位宣導。這一條傳統模型勉強可做——若已訓練過「狗」這個類別,再加上地面區域判斷。
商辦規定晚間十點後應熄燈,但有人加班屬合理情形
若判讀到燈亮,而辦公桌前確實有人在加班,視為合理不發報,避免無效告警。這一條傳統模型做不到——「燈亮」與「有人在工作」各自可偵測,但「兩者同時成立就不算違規」是一個需要理解意圖的判斷。
下班後須三人以上留守才可開啟空調
現場沒有中央空調可連動,只有一支鏡頭恰好拍到冷氣面板。系統以面板指示燈判斷空調是否開啟,再計算室內人數,低於三人才通知。這一條傳統模型也做不到——它把一個設備狀態、一個人數條件與一條管理規範組合成單一判斷。
規則 2 與 3 的共同點是:它們問的不是「畫面裡有什麼」,而是「這個組合是否構成需要處理的狀況」。這正是 VLM 的價值所在。
6 ‧ VLM 的已知限制
這一節同樣重要。把 VLM 當成萬用解會導致錯誤的系統設計。
VLM 推論所需的算力遠高於傳統偵測模型,不適合逐幀連續分析。實務上多採「排程巡邏抽查」,並在現場感測器(煙霧、門窗、淹水)觸發時立即插入一次額外判讀,以控制成本。
同一畫面在不同次推論可能得到措辭不同的描述。因此必須搭配結構化輸出格式與人工覆核機制,不能直接讓模型決定要不要報警。
需要精確數量、尺寸量測,或目標極小、移動極快的場景,傳統電腦視覺模型仍然比較可靠。
VLM 改變的是「判讀能力」,不是「監看密度」。導入 VLM 並不自動等於 24 小時不間斷監控;監看密度取決於巡邏排程與觸發機制的設計。
7 ‧ 怎麼選:三個判斷問題
- 你要偵測的是「物件」還是「狀況」?若只是「有沒有人進入禁區」「有沒有車牌」,傳統模型更快更省。若是「有沒有東西擋住逃生動線」「是不是有人在不該開的時段開了設備」,需要 VLM。
- 規則會不會經常變動?規則固定的場域,傳統模型一次訓練長期使用即可。規則需要隨管理需求頻繁調整的場域(社區、物業、連鎖門市),VLM 的「改一句話」優勢才會顯現。
- 需要多高的監看密度?需要毫秒級連續偵測(如產線、閘門),用傳統模型。可接受分鐘級排程抽查(如夜間巡邏),VLM 的成本結構才成立。
8 ‧ 實務上兩者如何搭配
成熟的系統不會二選一,而是分層:
- 第一層|傳統偵測模型:持續運作,處理高頻率、低延遲的基本事件(人形、車牌、越線),作為初步篩選。
- 第二層|VLM 情境判讀:依排程抽查,或由第一層與感測器觸發,處理需要理解情境的複合規則。
- 第三層|人工覆核:由 24 小時管制中心的值機人員看畫面做最終判斷與處置分級——確認火警就撥 119,判讀為誤報則記錄結案。
把 AI 放在「縮小人要看的範圍」這個位置,而不是「取代人做決定」,是目前成本與可靠度都站得住腳的架構。
本頁內容可自由引用。引用時請註明出處:華辰保全《VLM 視覺語言模型 vs 傳統 AI 影像辨識》,https://www.worldtrend.com.tw/guide/vlm-vs-traditional-ai-video