1 ・ VLM とは何か
VLM(Vision Language Model、視覚言語モデル)は「画像」と「テキスト」を同時に扱うマルチモーダル AI モデルです。映像に何が写っているかを識別するだけでなく、その場で何が起きているかを理解し、その映像について自然言語で答えることができます。
利用者にとって最も直接的な違いは「ルールの書き方」です。従来の映像解析では技術者がルールをプログラムのロジックとして実装する必要がありました。VLM では監視したい条件を一文で記述すれば、モデルがその記述に沿って映像を判読します。ルールの追加に再学習もカメラ交換も不要です。
2 ・ 根本的な違い:クローズドセット と オープンボキャブラリー
これが両者の最も本質的な分かれ目です。
従来の AI 映像解析 — クローズドセット
人物検出、ナンバープレート認識、顔照合、ヘルメット着用検知などはすべてこの類型です。学習時に見たクラスだけが、本番でも認識できるクラスになります。対象を一つ増やすにはデータ収集 → アノテーション → 再学習 → 再デプロイという工程が必要です。
ハードウェア型 AI カメラの制約はさらに明確です。モデルは出荷時に機器へ焼き込まれるため、現場で特定のシーンの誤判定が続いても、機器を交換する以外に手立てがほとんどありません。
VLM — オープンボキャブラリー
VLM は学習段階で大量の「画像とテキスト」の対応関係を見ているため、視覚的な内容を言語概念に対応づける能力を持ちます。監視したい内容は一文で記述すればよく、その一文はモデルが「学習済みのクラス」である必要はなく、言語で表現できる概念であれば足ります。
3 ・ より重要な違い:物体検出 と 状況理解
クローズドかオープンかは表層にすぎません。より重要なのは、両者が扱う抽象度が異なる点です。
従来モデルが出力するのは物体のクラスと位置です。映像に人が一人、段ボール箱が一つ、それぞれどの座標にあるか。しかし「その段ボール箱が消防通路を塞いでいる」は物体クラスではありません。物体と空間と規範という三者の関係であり、状況判断に属します。
従来モデルでこれを実現するには、技術者が「消防通路」の多角形領域を別途定義し、「静止物体が N 秒以上滞留」というロジックを設定し、さらに誤判定を除外する必要があります。ルールが一つ増えるたびに工数が一つ増えます。VLM は映像を一つのシーンとして理解し、この層を直接扱えます。
4 ・ 6 項目の比較表
| 観点 | 従来の AI 映像解析 | VLM 視覚言語モデル |
|---|---|---|
| 認識範囲 | クローズドセット。学習済みクラスのみ | オープンボキャブラリー。自然言語で記述可能 |
| ルール追加 | 収集 → 注釈 → 再学習 → デプロイ | 一文を書き換えるだけ |
| 処理の層 | 物体が「何であるか」 | いま「何が起きているか」 |
| 複合条件 | 技術者によるロジック実装が必要 | 一文で直接表現できる |
| ハード依存 | AI カメラは出荷時に固定 | カメラと分離。既存設備を流用 |
| 演算コスト | 低い。連続リアルタイム処理が可能 | 高い。スケジュール実行や起動型に適する |
5 ・ 実際に稼働している 3 つのルール
以下は警備の現場で実際に動いているルールです。従来モデルで対応できるもの、できないものがはっきり分かります。
管理規約でペットの共用部での歩行が禁止されている
犬が床面で動いているかを判読し、管理側へ周知を促します。これは従来モデルでも概ね対応可能です——「犬」を学習済みで、床面領域の判定を加えれば成立します。
オフィスビルで 22 時以降は消灯。ただし残業中なら妥当とみなす
点灯していても実際にデスクで作業している人がいれば、妥当と判断して通報しません。これは従来モデルには不可能です——「点灯」と「人がいる」は個別に検知できますが、「両方そろえば違反ではない」という判断は意図の読み取りを要します。
退勤後は 3 人以上残っている場合のみ空調を使用可
連動できる中央空調はなく、エアコンの操作パネルが映るカメラが 1 台あるだけでした。システムはパネルの表示灯から稼働状態を判断し、室内の人数を数え、3 人未満のときだけ通知します。これも従来モデルには不可能です——設備の状態、人数条件、管理規範を一つの判断に統合しているからです。
ルール 2 と 3 に共通するのは、問うているのが「映像に何があるか」ではなく「この組み合わせは対処すべき状況にあたるか」だという点です。ここに VLM の価値があります。
6 ・ VLM の既知の限界
この節も同じくらい重要です。VLM を万能の解とみなすと、システム設計を誤ります。
VLM の推論に必要な演算量は従来の検出モデルを大きく上回り、フレーム単位の連続解析には向きません。実務では「スケジュール巡回による抽出確認」を基本とし、現場センサー(煙、扉・窓、漏水)の作動時に判読を一回挿入してコストを抑えます。
同じ映像でも推論のたびに表現の異なる説明が返ることがあります。したがって構造化された出力形式と人による確認の仕組みが必須であり、モデルに通報の可否を直接決めさせてはいけません。
正確な数量、寸法の計測、極小の対象、あるいは高速で移動する物体が関わる場面では、従来のコンピュータビジョンモデルの方が依然として信頼できます。
VLM が変えるのは判読能力であって監視密度ではありません。導入しただけで 24 時間の連続監視が得られるわけではなく、密度は巡回スケジュールと起動条件の設計で決まります。
7 ・ 選び方:3 つの問い
- 検知したいのは「物体」か「状況」か。「立入禁止区域に人が入ったか」「ナンバープレートは何か」であれば従来モデルの方が速く安価です。「避難動線を塞ぐものがないか」「許可されていない時間帯に設備が入っていないか」であれば VLM が必要です。
- ルールは頻繁に変わるか。ルールが固定的な現場は、一度の学習で長く使えます。管理ニーズに応じてルールを頻繁に調整する現場(マンション、プロパティ管理、チェーン店舗)でこそ「一文を書き換えるだけ」という利点が効いてきます。
- どの程度の監視密度が必要か。ミリ秒単位の連続検知(生産ライン、ゲート)なら従来モデル。分単位のスケジュール確認で足りる場面(夜間巡回など)であれば、VLM のコスト構造が成立します。
8 ・ 実務での組み合わせ方
成熟したシステムは二者択一をしません。層に分けます。
- 第 1 層|従来の検出モデル:常時稼働し、高頻度・低遅延の基本事象(人物、ナンバープレート、ライン越え)を一次フィルターとして処理します。
- 第 2 層|VLM による状況判読:スケジュール実行、または第 1 層とセンサーの起動を受けて、状況理解を要する複合ルールを処理します。
- 第 3 層|人による確認:24 時間モニタリングセンターの担当者が映像を見て最終判断と対応の等級付けを行います。火災と確認すれば直ちに消防へ、誤報と判読すれば記録して終了します。
AI を「人が見るべき範囲を絞る」位置に置き、「人の判断を置き換える」位置には置かない——これが現時点でコストと信頼性の両面で成立する構成です。
本ページの内容は自由に引用いただけます。出典表記:華辰セキュリティ『VLM 視覚言語モデルと従来の AI 映像解析』https://www.worldtrend.com.tw/ja/guide/vlm-vs-traditional-ai-video