Görsel-Dil Modelleri (VLM): Kameraya Soru Sorabildiğiniz Çağ
Vision-language modeller sahada ne değiştiriyor? Doğal dille sorgulanan kamera arşivi, sıfır-örnekle yeni ihlal tanımı ve olay özetleme.
Klasik görüntü analitiğinde her yeni ihlal tipi yeni bir model demekti: veri topla, etiketle, eğit, doğrula. Görsel-dil modelleri (VLM) bu denklemi değiştiriyor. Metin ve görüntüyü ortak bir anlam uzayında temsil eden bu modeller, daha önce hiç örneği görülmemiş bir durumu doğal dille tanımlayarak tespit edebiliyor.
Sıfır-örnek tespit
"Merdivende korkuluk tutmadan çıkan kişi" cümlesi, VLM için çalışan bir kural tanımıdır. Model, cümledeki kavramları görüntüdeki bölgelerle eşleştirir. Doğruluk, özel eğitilmiş bir modelin altında kalır — ama günler yerine dakikalar içinde çalışan bir prototip üretir. Pratikte biz bunu keşif aşamasında kullanıyoruz: hangi kuralın değerli olduğu VLM ile hızla test ediliyor, değerli olan kural için özel model eğitiliyor.
Arşivi konuşturmak
İkinci ve belki daha büyük etki arama tarafında. "Geçen ay 3. depoda gece vardiyasında palet devrilmesi oldu mu?" sorusu, saatlerce kayıt taramak yerine saniyeler içinde cevaplanıyor. Olay klipleri otomatik metin özetiyle indeksleniyor; İSG raporu hazırlamak dakikalık bir işe dönüşüyor.
Sınırlar ve gerçekçilik
VLM'ler hâlâ ağır modellerdir; her kareyi 25 fps ile işlemek edge donanımda ekonomik değildir. Doğru mimari kademelidir: hafif tespit modeli sürekli çalışır, ilginç bir olay yakalandığında VLM devreye girip bağlamı yorumlar. Maliyet ve doğruluk dengesi böyle kurulur.