Rhythm Blues AI

PaliGemma 2. Una nuova frontiera nei modelli Vision-Language


Listen Later

La puntata descrive PaliGemma 2, un modello Vision-Language di Google Research, particolarmente versatile e addestrato su ampi dataset multimodali. L’architettura combina un encoder visivo con modelli linguistici Gemma 2, scalando da 3 a 28 miliardi di parametri e diverse risoluzioni. Il modello si distingue per le elevate prestazioni in diversi ambiti, dal riconoscimento ottico dei caratteri alla generazione di report medici, mostrando un buon equilibrio tra accuratezza, efficienza computazionale ed etica. Infine, vengono delineate le prospettive future di sviluppo, focalizzate su ottimizzazione e specializzazione.

...more
View all episodesView all episodes
Download on the App Store

Rhythm Blues AIBy Andrea Viliotti, digital innovation consultant (augmented edition)