Zyphra presenta Zamba2-VL: modelli open-source visione-linguaggio con architettura ibrida
Zyphra ha rilasciato Zamba2-VL, una famiglia di modelli visione-linguaggio (VLM) open-source disponibili in tre varianti da 1,2, 2,7 e 7 miliardi di parametri. I modelli si basano sull’architettura ibrida Zamba2, che combina layer state-space Mamba2 con blocchi Transformer condivisi, offrendo un’alternativa ai tradizionali VLM basati su Transformer densi.
L’obiettivo dichiarato è chiaro: precisione competitiva con latenza drasticamente ridotta, rendendo questi modelli ideali per l’edge computing e l’elaborazione su dispositivi.
Architettura innovativa
Zamba2-VL segue lo schema LLaVA ormai standard: un encoder visivo pre-addestrato converte i patch dell’immagine in feature, un adattatore MLP proietta tali feature nello spazio del modello linguistico, che poi elabora una sequenza interleaved di token visivi e testuali. I modelli supportano la comprensione e il grounding di immagini singole e multiple.
L’elemento distintivo è il backbone Zamba2: un ibrido tra layer state-space Mamba2 (che operano in tempo lineare con uno stato di dimensione fissa) e un numero ridotto di blocchi attention condivisi. I layer Mamba2 gestiscono la maggior parte del calcolo in modo efficiente, mentre i blocchi attention preservano la capacità di recupero contestuale che i modelli puramente SSM sacrificano.
Zyphra abbina ciascun backbone Zamba2 al Vision Transformer di Qwen2.5-VL, scelto per le sue positional embedding 2D rotazionali e l’elaborazione nativa a risoluzione dinamica. Un adattatore MLP a due layer collega l’encoder al backbone.
Prestazioni e benchmark
Il team di ricerca ha valutato Zamba2-VL su 14 benchmark che coprono comprensione di grafici, diagrammi e documenti, percezione generale, ragionamento e conteggio visivo. I risultati mostrano un quadro interessante:
- Conteggio visivo: il punto di forza principale — Zamba2-VL-1.2B raggiunge 62.5 su PixMoCount, contro 32.8 di InternVL3.5-1B e 17.7 di PerceptionLM-1B
- Comprensione documenti: DocVQA al 90.9% per il modello 2.7B
- Ragionamento knowledge-heavy: il modello è inferiore su MMMU (37.7) e MathVista (51.0), dove basi più grandi lo superano
Vantaggio in inferenza
Il vero punto di forza di Zamba2-VL emerge durante l’inferenza. L’attention Transformer scala quadraticamente con la lunghezza della sequenza, e gli input multimodali allungano rapidamente le sequenze — una singola immagine ad alta risoluzione può aggiungere diverse migliaia di token, un breve video clip decine di migliaia.
Zamba2-VL elimina la crescita della cache KV grazie allo stato ricorrente a dimensione fissa. Su un prefisso di 32.000 token, i test mostrano una latenza inferiore di almeno un ordine di grandezza rispetto ai VLM Transformer comparabili. Il vantaggio è massimo sui modelli 1.2B e 2.7B, il range ideale per deployment on-device e edge.
Casi d’uso
I modelli si prestano a diversi scenari applicativi: estrazione da documenti e fatture (grazie ai risultati DocVQA), conteggio per inventari retail e magazzini, grounding per indicare oggetti in immagini prodotto o UI, e assistenti on-device grazie alla bassa latenza.
Disponibilità
I tre modelli sono disponibili sulla collezione Hugging Face di Zyphra con licenza Apache 2.0, pesi pubblici e codice di inferenza funzionante. L’inferenza richiede una GPU CUDA per i kernel Mamba2 ottimizzati.
In sintesi, Zamba2-VL rappresenta un passo avanti significativo per i VLM open-source, offrendo un’alternativa efficiente ai modelli Transformer puri con un eccellente rapporto qualità-latenza per deployment edge e on-device.