Tether Data'nın yapay zeka araştırma girişimi QVAC, mobil ve edge cihazlarda çalışmak üzere geliştirilen VisionPsy-Nano adlı multimodal yapay zeka modelini açık kaynak olarak yayımladı. Yaklaşık 460 milyon parametreye sahip model, bulut altyapısı gerektiren çok modlu yetenekleri doğrudan mobil cihazlara taşıyor.

VisionPsy-Nano, 0,5 milyar parametre sınıfındaki görsül-dil modelleri arasında gerçekleştirilen karşılaştırmalarda rakip modelleri belirgin şekilde geride bıraktı. Liquid AI'ın LFM2.5-VL-450M, Hugging Face'in SmolVLM2-500M ve nanoVLM-460M-8k ile kıyaslandığında, VisionPsy-Nano-460M 17 değerlendirme kriterinin 16'sında en yüksek performansı göstererek 62,3 normalize puana ulaştı. Model, dokümantasyon metni çıkarma (OCR), finansal raporlar analizi, sahne algılama, mekânsal analiz ve görsel muhakeme gibi görevlerde sınıfının en başarılı sonuçlarını elde etti. MM-IFEval ve POPE testlerinde kendisinden 1,6 ila 2,3 kat daha büyük modelleri geride bıraktı.

Tether, farklı kullanım senaryolarına yönelik iki sürüm sunuyor. VisionPsy-Nano-460M kalite ve doğruluk odaklı standart uygulamalar için, VisionPsy-Nano-460M-Flash ise mobil cihazlarda düşük gecikme sağlamak üzere optimize edildi. Flash sürümü, tam sürümün yaklaşık yüzde 99'unu korurken akıllı telefonlarda çok daha hızlı yanıt veriyor.