MimìrCast: le novità sull’AI ogni giorno Ascolta il podcast ➔
GPT-4V il nuovo modello di OpenAI

GPT-4V il nuovo modello di OpenAI che integra input testuali a immagini.

OpenAI ha rilasciato GPT-4V, un modello di intelligenza artificiale che può processare sia testi che immagini, integrato in ChatGPT. GPT-4V è basato su GPT-4 e ne estende le capacità aggiungendo la visione artificiale, ovvero la capacità di comprendere e analizzare immagini. Questo rende GPT-4V un modello multimodale, in grado di integrare diverse modalità sensoriali per raggiungere una maggiore intelligenza generica.

Nel contesto di rapida evoluzione dell’intelligenza artificiale, GPT-4V rappresenta un punto di svolta: mentre i precedenti modelli linguistici come GPT-3.5-Turbo e GPT-4 lavoravano solo sul testo, GPT-4V abbraccia sia il linguaggio sia gli elementi visivi. Le capacità del modello sono documentate in dettaglio nel paper “The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)” pubblicato da Microsoft Research e nella GPT-4V System Card di OpenAI.

In questo articolo scoprirai:

  • Cos’è GPT-4V e come funziona: architettura multimodale, dataset di training e parametri del modello.
  • Capacità visive e di ragionamento: riconoscimento di immagini, OCR, comprensione di grafici e tabelle, ragionamento astratto.
  • Tecniche di prompting e visual referring: zero-shot, few-shot, puntatori visivi e interazione naturale.
  • Applicazioni pratiche: medicina, assicurazioni, navigazione web, controllo qualità industriale.
  • Limiti e confronto con i modelli successivi come GPT-4o e la famiglia GPT-5.

Cos’è GPT-4V

GPT-4V è un modello multimodale di OpenAI che accetta sia testo sia immagini come input e restituisce risposte in linguaggio naturale. Estende GPT-4 aggiungendo un encoder visivo che traduce i pixel in rappresentazioni comprensibili al modello linguistico. L’architettura si basa su una rete neurale trasformazionale, ovvero una rete basata sul meccanismo di self-attention introdotto nel paper “Attention Is All You Need”, allenata su un ampio corpus di dati testuali e visivi.

GPT-4V è in grado di svolgere una varietà di compiti multimodali, come:

  • la descrizione e il riconoscimento di immagini,
  • la generazione di immagini da testi,
  • il question answering visuale,
  • il dialogo visuale,
  • il ragionamento visuale astratto e concreto,
  • l’interazione con gli esseri umani,
  • la generazione di codice, canzoni, e molto altro.

Come documentato nel report di Microsoft Research (Yang et al., 2023), GPT-4V dimostra capacità impressionanti e umanoidi in diversi scenari, mostrando una buona qualità e genericità delle sue abilità.

Come è stato allenato GPT-4V

GPT-4V è stato allenato con apprendimento profondo non supervisionato su un corpus multimodale che combina testo e immagini. L’obiettivo di training consiste nel prevedere le parole o i pixel mancanti in una sequenza, usando una funzione di perdita cross-entropia per minimizzare l’errore tra previsioni e dati reali. L’ottimizzazione dei parametri avviene tramite Adam, un algoritmo di ottimizzazione stocastica basato su momenti adattivi. Per la componente visiva, OpenAI ha sfruttato approcci simili a CLIP, che aveva dimostrato come il pre-addestramento contrastivo testo-immagine produca rappresentazioni visive versatili (Radford et al., 2021).

Il corpus di training combina fonti testuali e visive eterogenee, tra cui Wikipedia, Common Crawl, WebText2, ImageNet, Conceptual Captions, COCO, Visual Genome, VQA, Visual Dialog e CLEVR. Secondo le stime riportate nel report “The Dawn of LMMs”, il corpus contiene circa 500 miliardi di parole e 60 milioni di immagini, coprendo una vasta gamma di domini e compiti multimodali.

L’allenamento di GPT-4V ha richiesto un’infrastruttura computazionale composta da migliaia di GPU e TPU e si è protratto per diversi mesi. Il modello risultante conta circa 175 miliardi di parametri (GPT-4 Technical Report, OpenAI 2023), che occupano circa 700 GB di memoria.

Come usare GPT-4V

Input Solo Testuali

La robusta capacità linguistica di GPT-4V gli permette di funzionare come un efficace modello linguistico unimodale. Funzionando esclusivamente con input e output testuali, GPT-4V è capace di eseguire una vasta gamma di compiti linguistici e di programmazione.

Coppie Singole di Immagini e Testi

GPT-4V può prendere una singola coppia di immagine e testo o una singola immagine come input per eseguire vari compiti di visione e visione-linguaggio. Questi possono includere la descrizione di un’immagine, rispondere a domande visive o localizzare oggetti in un’immagine. La performance e la generalizzabilità di GPT-4V sono notevolmente superiori rispetto alle tecniche precedenti.

Input di Immagini e Testi Intercalati

La generalità di GPT-4V è ulteriormente potenziata dalla sua capacità di gestire input di immagini e testi intercalati in modo flessibile. Questo tipo di input misto offre flessibilità per una vasta gamma di applicazioni. Ad esempio, può calcolare l’importo totale delle tasse pagate su più ricevute, o associare informazioni tra menu e numero di birre per calcolare il costo totale.

Modalità di Funzionamento di GPT-4V

GPT-4V opera in quattro modalità principali: zero-shot learning, few-shot learning, visual pointing e visual referring prompting. Ogni modalità è adatta a specifiche tipologie di compito e a diversi livelli di contesto disponibile all’utente.

Zero-shot Learning

Lo zero-shot learning è la capacità di un modello di affrontare un compito senza aver ricevuto alcun esempio specifico durante l’addestramento. In questa modalità GPT-4V generalizza sfruttando il suo vasto corpus di conoscenze pregresse, risultando estremamente versatile.

Few-shot Learning

Nel few-shot learning, GPT-4V riceve alcuni esempi del compito da svolgere all’inizio della conversazione. Questi esempi servono a “indirizzare” il modello, consentendogli di generare risposte più precise e contestualmente appropriate.

Visual Pointing

GPT-4V ha la possibilità di fare riferimento a specifiche parti di un’immagine durante un dialogo o una task-specifica. Questa funzionalità è particolarmente utile per compiti come l’identificazione di oggetti specifici in un’immagine o la descrizione di scene complesse.

Visual Referring Prompting

Questa è una funzionalità unica che permette a GPT-4V di interpretare marcatori visivi inseriti nelle immagini in ingresso, fornendo un ulteriore livello di interattività e comprensione nel dialogo tra uomo e macchina.

Le tecniche di prompting di GPT-4V

Le tecniche di prompting sono metodi utilizzati per guidare GPT-4V a svolgere i compiti desiderati. Ecco alcune delle principali tecniche:

  • Uso di parole chiave: Le parole chiave possono essere utilizzate per indicare a GPT-4V il tipo di risposta desiderata. Ad esempio, se si desidera che GPT-4V generi una poesia, si potrebbe iniziare la conversazione con la parola chiave “poesia”.
  • Domande: Le domande guidano GPT-4V a fornire informazioni specifiche. Ad esempio, “Qual è il colore dell’oggetto nell’immagine?”.
  • Esempi: Gli esempi mostrano a GPT-4V il formato o lo stile desiderato per la risposta.
  • Segni visivi: I segni visivi indicano a GPT-4V specifiche parti di un’immagine su cui concentrarsi, come un cerchio disegnato attorno a un oggetto.

Capacità di Visione-Linguaggio di GPT-4V

GPT-4V è progettato per generare descrizioni aperte e dettagliate di immagini attraverso una varietà di domini:

  • Riconoscimento di Celebrità: GPT-4V può identificare celebrità da diversi background e campi, rispondendo in modo accurato a query dettagliate come “Chi è la persona nell’immagine e cosa sta facendo?”
  • Riconoscimento di Punti di Riferimento: Nonostante le variazioni dovute a fattori come angolo di vista e condizioni di illuminazione, GPT-4V è in grado di riconoscere e descrivere in modo accurato i punti di riferimento.
  • Riconoscimento del Cibo: GPT-4V può riconoscere una vasta gamma di piatti e cibi, identificando dettagli specifici come ingredienti, guarnizioni o tecniche di cottura.
  • Comprensione di Immagini Mediche: GPT-4V dimostra una comprensione basilare delle immagini mediche, come le radiografie, e può effettuare ragionamenti basati sul contesto visivo.
  • Riconoscimento di Loghi: Il modello è in grado di identificare loghi anche in scenari difficili, come quando sono parzialmente oscurati o distorti.
  • Comprensione della Scena: GPT-4V è in grado di descrivere strade, la posizione e il colore dei veicoli, e può anche leggere il limite di velocità indicato nella scena.

Questo insieme di competenze, documentato negli esperimenti di Yang et al. (2023), dimostra la notevole capacità di GPT-4V di interpretare e interagire con il mondo visivo in modi che vanno ben oltre la semplice etichettatura o riconoscimento di oggetti.

Localizzazione degli Oggetti, Conteggio e Didascalie Dense in GPT-4V

GPT-4V offre tre capacità fondamentali di computer vision: comprensione delle relazioni spaziali, conteggio degli oggetti e localizzazione tramite bounding box. Queste funzionalità estendono il modello oltre il semplice riconoscimento, abilitando analisi strutturali delle scene.

Comprensione delle Relazioni Spaziali

La comprensione delle relazioni spaziali tra gli esseri umani e gli oggetti in un’immagine è un aspetto fondamentale dell’intelligenza visiva. GPT-4V è in grado di identificare la relazione spaziale tra, ad esempio, un frisbee e un uomo nell’immagine, così come tra un uomo e una macchina. Questo va oltre il semplice riconoscimento e fornisce intuizioni sul modo in cui gli oggetti sono posizionati e interagiscono tra loro all’interno di una scena.

Conteggio degli Oggetti

GPT-4V è in grado di contare il numero di oggetti specifici presenti in un’immagine. Questa è una caratteristica utile in numerosi scenari applicativi, come l’inventario automatizzato o la sorveglianza. Tuttavia, la precisione del modello può essere compromessa in scene complesse dove gli oggetti sono sovrapposti o nascosti.

Localizzazione degli Oggetti

La localizzazione degli oggetti è un’altra funzione essenziale fornita da GPT-4V. Utilizzando semplici prompt di testo, il modello può generare coordinate di “riquadri delimitatori” per localizzare oggetti o persone all’interno di un’immagine. Questa capacità è particolarmente utile per applicazioni come il riconoscimento facciale, la navigazione autonoma e la sorveglianza.

Didascalie Dense

Le “didascalie dense” si riferiscono al compito di generare descrizioni dettagliate per ciascuna regione di interesse all’interno di un’immagine. Invece di fornire una singola didascalia per l’intera immagine, la didascalia densa scompone l’immagine in regioni più piccole e fornisce descrizioni separate per ciascuna di esse.

GPT-4V va oltre la semplice generazione di didascalie e offre un livello di dettaglio senza precedenti. Non solo può riconoscere e localizzare varie persone in una foto, ma può anche generare descrizioni concise e informative per ciascuna di esse. Questo è particolarmente utile in contesti come i media, la ricerca e l’analisi di immagini scientifiche.

Conoscenza Multimodale e Senso Comune in GPT-4V

Gli esperimenti condotti da OpenAI hanno esplorato diverse aree nelle quali GPT-4V mostra competenze notevoli.

Comprendere Barzellette e Meme

OpenAI ha esaminato come GPT-4V affronta il complesso compito di comprendere barzellette e meme, che spesso fanno riferimento a specifici eventi, cultura pop o tendenze su Internet. I risultati mostrano che GPT-4V ha una notevole capacità di raccogliere informazioni sia da modalità visive che testuali e di comprendere l’umorismo incorporato nei meme.

Scienza e Conoscenza

Gli esperimenti di OpenAI hanno valutato la capacità di GPT-4V in compiti che richiedono ragionamento scientifico. Le domande poste coprono una vasta gamma di argomenti, tra cui geografia, fisica, biologia e scienze della terra. I risultati indicano che GPT-4V è in grado di rispondere correttamente alle domande scientifiche basate sul contesto visivo.

Ragionamento Multimodale di Senso Comune

In un altro insieme di esperimenti, OpenAI ha valutato la capacità di GPT-4V nel ragionamento multimodale di senso comune. GPT-4V dimostra di utilizzare efficacemente le bounding box presentate nell’immagine come prompt visivi per riconoscere le azioni eseguite dagli individui nella scena. Ad esempio, può inferire che due persone in abiti formali stiano partecipando a una cerimonia nuziale basandosi sulle decorazioni floreali presenti.

Comprensione e Ragionamento su Testo di Scena, Tabelle, Grafici e Documenti

Comprensione del Testo di Scena

Gli esperimenti di OpenAI hanno esplorato la capacità di GPT-4V di riconoscere il testo in varie scene. I risultati mostrano che il modello identifica accuratamente il testo in diversi scenari, inclusi testi scritti a mano e stampati.

Ragionamento Matematico Visuale

GPT-4V ha dimostrato di essere capace di risolvere problemi matematici visivi, come identificare la presenza di un triangolo rettangolo e determinare le misure dei suoi lati. Il modello tende a presentare soluzioni in modo ben strutturato, risolvendo il problema passo dopo passo.

Comprensione e Ragionamento su Grafici

Gli esperimenti hanno esplorato la capacità di GPT-4V nella comprensione e nel ragionamento su grafici. Il modello non solo comprende il contenuto dei grafici ma può anche rispondere a domande basate su di essi, come calcolare il costo medio totale del carburante escludendo un particolare modello di auto.

Comprensione e Ragionamento su Tabelle

GPT-4V mostra risultati promettenti anche con le tabelle. Può capire i dettagli nelle tabelle e rispondere accuratamente alle domande correlate, come determinare quale paese ha il margine di profitto più alto.

Comprensione dei Documenti

Gli esperimenti hanno toccato la capacità di GPT-4V di comprendere vari tipi di documenti, come piani di pavimentazione, poster e documenti d’esame. Il modello fornisce risposte ragionevoli a domande poste su questi documenti. Ad esempio, può identificare correttamente la posizione del bagno per la seconda camera da letto in un piano di pavimentazione.

Comprensione di Rapporti Tecnici Multi-pagina

In un caso più impegnativo, GPT-4V è stato testato su un rapporto tecnico multi-pagina. Il modello mostra risultati impressionanti nel descrivere l’idea principale e il metodo proposto, sebbene possa occasionalmente perdere alcuni dettagli di implementazione.

Comprensione Multilingue e Multimodale di GPT-4V

Comprendere più lingue e modalità

Gli esperimenti condotti da OpenAI valutano le capacità di GPT-4V nel comprendere multiple lingue e modalità. Il modello è stato testato su immagini naturali utilizzando prompt di testo in diverse lingue come cinese, francese e ceco, riuscendo a riconoscere il prompt e generare descrizioni accurate nelle lingue corrispondenti.

Quando il prompt di input è in inglese ma specifica la lingua di output desiderata, il modello segue le istruzioni e genera descrizioni corrette nelle lingue richieste. Con un prompt in spagnolo, GPT-4V è stato in grado di generare descrizioni di immagini in 20 lingue diverse.

Comprensione e Traduzione del Testo di Scena Multilingue

GPT-4V è stato testato sulla sua capacità di riconoscere e comprendere il testo di scena in varie lingue. Non solo riconosce il testo, ma può anche tradurlo in una lingua diversa. Ad esempio, quando viene fornito uno screenshot di un sito web in catalano, il modello non solo riconosce il testo ma è anche in grado di generare riassunti precisi e tradurli in 20 lingue diverse.

Comprensione Multiculturale

Infine, gli esperimenti hanno esplorato la capacità del modello di comprendere le sfumature culturali. GPT-4V mostra un’abilità notevole nel comprendere queste sfumature e nel generare descrizioni ragionevoli in più lingue per immagini di contesti culturali diversi.

Programmazione e capacità di Visione di GPT-4V

Generazione di Codice LaTeX da Input Manoscritto

GPT-4V è in grado di generare codice LaTeX basato su equazioni matematiche scritte a mano. Il modello assiste gli utenti nel scrivere equazioni in LaTeX in modo più efficiente. Tuttavia, incontra difficoltà con equazioni più lunghe e complesse; la soluzione è scomporre le equazioni in componenti più piccole e gestibili.

Scrittura di Codice in Altri Linguaggi

GPT-4V è in grado di scrivere codice in Python, TikZ e SVG per replicare una figura fornita come input. Sebbene l’output generato non sia una corrispondenza esatta con la figura di input, il layout è simile e il codice può essere facilmente modificato per soddisfare esigenze specifiche.

Interazione con gli umani: Visual Referring Prompting

Indicatori Visivi e Descrizioni Collegati al Contesto

GPT-4V ha la capacità di interpretare “puntatori visivi” come cerchi, scatole e disegni a mano che sono sovrapposti alle immagini. Questa funzione è particolarmente utile per le descrizioni ancorate, consentendo al modello di focalizzarsi su aree specifiche all’interno di un’immagine senza perdere il contesto globale.

In sostanza, può dare una descrizione mirata di un’area specifica, come una bottiglia di birra su un tavolo, pur mantenendo informazioni sul contesto circostante.

Coordinate Numeriche vs Puntatori Visivi

Il modello può anche interpretare le coordinate numeriche di una regione all’interno di un’immagine, sebbene la precisione sia leggermente inferiore rispetto all’uso di puntatori visivi. Questo solleva la questione di come esattamente il modello “veda” e “interprets” le informazioni visive.

Visual Referring Prompting

Il “visual referring prompting” permette una forma di interazione più intuitiva con il modello. Invece di dover descrivere ciò che si vuole sapere, si può semplicemente disegnare un cerchio o una freccia sull’immagine. È come se il modello potesse “leggere” il linguaggio visuale, rendendo l’interazione molto più naturale e fluida.

Capire il Tempo e i Video con GPT-4V

GPT-4V oltre a interpretare immagini statiche, è anche molto capace di comprendere sequenze temporali e contenuti video.

Sequenze Multi-Immagine

GPT-4V può analizzare frame per frame una sequenza video, offrendo un contesto più profondo. Non si limita a riconoscere l’ambiente, ma interpreta anche le azioni svolte dalle persone nel video, aggiungendo un livello di dettaglio che va oltre il semplice riconoscimento di oggetti e scene.

Ordinamento Temporale

GPT-4V è anche un asso nel mettere in ordine cronologico una serie di immagini mescolate. Che si tratti di preparare sushi o di aprire una porta, il modello è in grado di stabilire la sequenza logica e temporalmente accurata degli eventi.

Anticipazione Temporale

Immaginate di vedere i primi frame di un calcio di rigore in una partita di calcio. GPT-4V può anticipare le azioni successive sia del calciatore che del portiere, grazie alla sua comprensione delle regole e della struttura del gioco.

Localizzazione e Ragionamento Temporale

Il modello può identificare il momento preciso in cui un giocatore colpisce la palla e può anche dedurre, attraverso il ragionamento, se il portiere riuscirà a bloccare il tiro. Questo mostra un notevole livello di sofisticazione nel ragionamento del modello.

Comprensione Temporale Ancorata

Infine, GPT-4V può focalizzarsi su una persona di interesse in una sequenza di immagini, fornendo un contesto temporale alle sue azioni. Questo aggiunge un ulteriore livello di profondità, permettendo al modello di interpretare non solo il flusso temporale degli eventi, ma anche il tono e la natura delle interazioni che stanno avvenendo.

Abstract Visual Reasoning e Test di Quoziente Intellettivo con GPT-4V

Una delle caratteristiche più affascinanti di GPT-4V è la sua capacità di ragionare su stimoli visivi astratti. Per valutare queste abilità, OpenAI ha sottoposto il modello a test standardizzati di Intelligenza Quoziente (IQ) usati anche per gli esseri umani.

Stimoli Visivi Astratti

Il modello è stato testato con un rompicapo geometrico chiamato tangram, che consiste in sette pezzi piani chiamati “tans”. GPT-4V è stato in grado di interpretare queste figure, assegnando loro significati semantici. Ad esempio, ha identificato una figura che meglio rappresenta un’oca in volo, fornendo anche ragionamenti descrittivi per altre figure, come una persona o un robot, una barca o un cappello, un cane o una volpe.

Scoperta e Associazione di Parti e Oggetti

Un’altra abilità testata è stata la capacità del modello di scoprire e associare parti di oggetti in modo semanticamente significativo. Quando gli è stato chiesto di localizzare una parte dell’oggetto in base al suo significato semantico, GPT-4V ha fornito coordinate precise.

Scala di Intelligenza di Wechsler per Adulti

GPT-4V è stato anche sottoposto ai test della Scala di Intelligenza di Wechsler per Adulti (WAIS), riconosciuti come uno degli standard d’oro nei test di IQ. Ha mostrato promesse nel ragionamento astratto, rispondendo a domande che richiedevano solo testo, input visivi simbolici e immagini naturali.

Matrici Progressive di Raven

Infine, il modello è stato sfidato con le Matrici Progressive di Raven (RPM), un altro test ben noto per misurare il ragionamento astratto. GPT-4V ha generato risposte ragionevoli anche quando l’intera pagina di domande gli è stata presentata come un’unica immagine, simile all’approccio umano ai test di IQ.

Emotional Quotient Test con GPT-4V

Leggere le Emozioni dalle Espressioni Facciali

Un altro aspetto cruciale dell’intelligenza, spesso trascurato in favore del quoziente intellettivo (IQ), è il quoziente emotivo (EQ). In questo ambito, GPT-4V è stato sottoposto a una serie di test per valutare la sua capacità di identificare e interpretare le emozioni umane dalle espressioni facciali. Il modello è in grado di identificare una gamma di emozioni, da felicità e paura a frustrazione e disgusto, fornendo motivazioni ragionevoli per le sue interpretazioni.

Come il Contenuto Visivo Suscita Emozioni

GPT-4V ha dimostrato di comprendere come diversi tipi di contenuti visivi possano suscitare emozioni negli esseri umani. Che si tratti di una foto di un tramonto mozzafiato o di un’immagine che ritrae una situazione di tensione, il modello è in grado di anticipare la gamma di reazioni emotive che tali immagini potrebbero suscitare.

Estetica dell’Immagine

GPT-4V va oltre la semplice identificazione delle emozioni; è anche in grado di giudicare l’estetica delle immagini in base agli standard e alle norme sociali. Tra due immagini, può dire quale è più probabilmente considerata esteticamente piacevole dalla maggior parte delle persone, fornendo ragionamenti sul colore, la varietà e la riconoscibilità del luogo ritratto.

Generazione di Output Condizionata dall’Emozione

Infine, GPT-4V può generare testo adeguato in base all’emozione percepita o desiderata. Che si tratti di descrivere un’immagine in modo umoristico o di renderla più inquietante, il modello è in grado di calibrare il suo linguaggio per adattarsi al tono emotivo desiderato. Questo è particolarmente utile in contesti come la comunicazione uomo-robot.

Nuove Applicazioni Emergenti di GPT-4V

Rilevamento difetti

Nel contesto industriale, il rilevamento dei difetti è una fase fondamentale per garantire la qualità del prodotto. GPT-4V dimostra notevoli capacità in questo ambito, identificando difetti come fori nelle nocciole o ammaccature nei paraurti delle auto. Tuttavia, mostra alcune limitazioni quando si tratta di prodotti meno comuni o che presentano variazioni nell’aspetto.

Ispezione della sicurezza

Un altro caso d’uso interessante è l’ispezione della sicurezza, in particolare il conteggio dell’Equipaggiamento di Protezione Personale (EPP) in ambienti di lavoro come i cantieri edili. GPT-4V ha mostrato alcune lacune nel rilevare individui senza elmetti, ma combinando il suo ragionamento visivo con rilevatori di persone esterni, le prestazioni migliorano notevolmente.

Casse Automatiche nei Supermercati

Le casse automatiche stanno diventando sempre più popolari nei grandi rivenditori per velocizzare il processo di pagamento. GPT-4V ha il potenziale per semplificare ulteriormente questo processo identificando automaticamente gli articoli nel carrello della spesa senza l’intervento dell’utente.

Ambito Medico – Generazione di Referti Radiologici

L’applicazione di GPT-4V nel campo medico, nello specifico nella generazione di referti radiologici, mostra risultati promettenti ma anche aree di miglioramento. Mentre il modello può identificare correttamente gli studi e fornire diagnosi accurate, ci sono casi in cui manca dettagli cruciali o fornisce informazioni errate.

Per esempio, nel caso di un’immagine a raggi X del polso destro, GPT-4V ha correttamente diagnosticato una frattura del radio distale, ma ha completamente mancato una frattura radiale distale ovvia in un altro esame. In un altro caso, riguardante una TAC del torace, ha identificato erroneamente un nodulo nel lobo superiore sinistro invece che nel lobo superiore destro.

Questi risultati sottolineano l’importanza di avere i referti generati dal modello valutati da professionisti medici per garantirne correttezza e precisione. Tuttavia, il modello mostra un potenziale significativo come assistente AI nella generazione di referti radiologici.

Assicurazioni Auto

OpenAI ha testato le capacità di GPT-4V nel campo delle assicurazioni auto, concentrandosi su due aree chiave: la valutazione dei danni e la segnalazione all’assicurazione.

Nella valutazione dei danni, il modello ha mostrato un’elevata competenza nell’identificare e descrivere accuratamente i danni alle auto da varie angolazioni, fornendo anche stime sui potenziali costi di riparazione.

Per quanto riguarda la segnalazione all’assicurazione, GPT-4V è stato in grado di estrarre dettagli come marca, modello e targa del veicolo da immagini, presentando le informazioni in formato JSON. Tuttavia, ci sono limiti, come l’incapacità di leggere targhe ostruite o di fornire stime di costo quando le informazioni non sono disponibili.

Generazione di immagini

GPT-4V non genera immagini in modo nativo: analizza e valuta le immagini, ma la produzione visiva è affidata a modelli dedicati. Per questo scopo OpenAI ha sviluppato DALL-E 2 e, più recentemente, GPT Image 1.5. Tuttavia, GPT-4V eccelle nell’assistere il processo creativo lavorando a fianco dei modelli generativi.

Valutazione delle Immagini Generate

GPT-4V è in grado di valutare le immagini basate sui prompt di testo originali. Ad esempio, può assegnare un punteggio da 1 a 10 per determinare quanto un’immagine generata sia simile al prompt di testo fornito. Questo è utile non solo per valutare la qualità delle immagini, ma anche per fornire feedback che può essere utilizzato per migliorare ulteriormente i modelli di generazione di immagini.

Generazione di Prompt per il Fotoritocco

Oltre alla valutazione, GPT-4V può anche migliorare il processo di editing delle immagini. Può generare o riscrivere il prompt di testo utilizzato per l’editing, risultando in un’immagine più visivamente accattivante. GPT-4V prende in considerazione le caratteristiche uniche dell’immagine originale per produrre un prompt ottimizzato, il che a sua volta migliora la qualità del fotoritocco.

Navigazione Web

GPT-4V può interagire con l’interfaccia grafica di un computer per eseguire compiti specifici, come cercare una ricetta o leggere le notizie del giorno. Il modello riceve uno screenshot della schermata corrente e una lista di azioni possibili (ad esempio, muovere il mouse o fare clic su un’icona). Quindi, predice le azioni successive per raggiungere l’obiettivo finale. Queste azioni sono poi eseguite manualmente e vengono forniti nuovi screenshot a GPT-4V per guidare le azioni successive.

Shopping Online

Similmente, GPT-4V può navigare nell’interfaccia di uno smartphone per fare shopping online. Il modello viene guidato da screenshot e una lista di azioni possibili. Ad esempio, può prevedere di aprire l’app Amazon, cercare una tastiera ergonomica, applicare un filtro di prezzo, e procedere al checkout.

Comprensione delle Notifiche

GPT-4V è anche capace di interpretare e rispondere a notifiche sullo schermo, come proposte di riunioni o notifiche di chiamate e messaggi.

Visione di Video

GPT-4V può anche descrivere il contenuto di video basandosi su una serie di screenshot. Questo dimostra il suo potenziale nella generazione automatica di trascrizioni per contenuti video generati dagli utenti.

Plugin Multimodali

GPT-4V può essere abilitato ad accedere a informazioni aggiornate attraverso l’uso di plugin come Bing Image Search. Questo è particolarmente utile quando il modello deve identificare informazioni che sono emerse dopo il periodo di addestramento. Tramite i GPTs, gli sviluppatori possono anche costruire versioni personalizzate del modello con strumenti visivi dedicati a domini specifici.

Catene Multimodali

GPT-4V può essere integrato con una serie di plugin per effettuare ragionamenti più avanzati. Ad esempio, può utilizzare strumenti di rilevamento delle persone per contare il numero di individui in un’immagine e successivamente analizzare se indossano determinati equipaggiamenti.

Auto-Riflessione

GPT-4V è capace di auto-riflessione per migliorare le sue prestazioni. Ad esempio, può rivedere e correggere il codice Python generato per disegnare curve, o migliorare le istruzioni di generazione di testo per modelli di arte generativa.

Auto-Coerenza

GPT-4V utilizza una strategia di decodifica che aggrega più output campionati per produrre la risposta finale. Questo è utile, ad esempio, nel conteggio degli oggetti in un’immagine, dove può fornire una risposta più accurata attraverso un voto a maggioranza.

LMM con Recupero di Informazioni Aumentato

GPT-4V può essere ulteriormente potenziato con il recupero di informazioni per compiti specifici. Ad esempio, può essere utile nel checkout della spesa recuperando informazioni specifiche del negozio da un database.

Per una panoramica completa di tutti i modelli e delle funzioni di ChatGPT, vedi la nostra guida completa a ChatGPT.

Conclusioni

GPT-4V si è dimostrato notevolmente capace in una vasta gamma di scenari applicativi. La relazione che documenta le sue capacità funge da riferimento per ulteriori ricerche che mirano ad ampliare l’utilizzo e la comprensione dei modelli di linguaggio multimodali (LMM).

Verso i Futuri LMM

I modelli precedenti come GPT-1, GPT-2 e GPT-3 erano principalmente sistemi di input-output basati su testo. GPT-4V, invece, aggiunge una forte competenza nel dominio delle immagini. Questa evoluzione è proseguita con GPT-4o mini e poi con la famiglia GPT-5, che ha introdotto capacità multimodali native ancora più avanzate. Le versioni successive come GPT-5.1, GPT-5.2 e GPT-5.4 hanno ulteriormente espanso i confini di ciò che i modelli multimodali possono fare.

Per il futuro, si prevede che gli LMM saranno in grado di generare contenuti testo-immagine intercalati, come tutorial dettagliati che contengono sia testo che immagini. Sarebbe anche vantaggioso aggiungere altre modalità come video, audio e dati da sensori per espandere ulteriormente le capacità degli LMM.

In termini di processo di apprendimento, i modelli attuali si basano in gran parte su dati ben organizzati, come set di dati di immagini etichettate con testo. Tuttavia, un modello più versatile potrebbe essere in grado di apprendere da una varietà di fonti, compreso il contenuto web e persino ambienti fisici reali, per facilitare un’evoluzione continua e autonoma del modello.

In sintesi, il campo degli LMM è in rapida evoluzione e, con l’aggiunta di nuove modalità e capacità, le potenzialità sono praticamente illimitate.

Fonti

  1. Yang, Z., Li, L., Lin, K., Wang, J., Lin, C., Liu, Z., & Wang, L. (2023). The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision). ArXiv. https://arxiv.org/abs/2309.17421
  2. OpenAI (2023). GPT-4V(ision) System Card. OpenAI. https://openai.com/research/gpt-4v-system-card
  3. OpenAI (2023). New models and developer products announced at DevDay. OpenAI Blog. https://openai.com/blog/new-models-and-developer-products-announced-at-devday
  4. OpenAI (2023). GPT-4 Technical Report. ArXiv. https://arxiv.org/abs/2303.08774
  5. Vaswani, A. et al. (2017). Attention Is All You Need. ArXiv. https://arxiv.org/abs/1706.03762
  6. Radford, A. et al. (2021). Learning Transferable Visual Models From Natural Language Supervision (CLIP). ArXiv. https://arxiv.org/abs/2103.00020

Domande frequenti

Cos'è GPT-4V e in cosa si differenzia da GPT-4?

GPT-4V (GPT-4 Vision) è una versione multimodale di GPT-4 che, oltre al testo, è in grado di elaborare e comprendere immagini. Mentre GPT-4 lavora esclusivamente con input testuali, GPT-4V integra la visione artificiale permettendo di analizzare foto, grafici, documenti, immagini mediche e molto altro. È il primo grande modello di OpenAI a offrire capacità visive in modo stabile e accessibile tramite API e ChatGPT.

Come si accede a GPT-4V?

GPT-4V è accessibile tramite ChatGPT Plus (abbonamento a pagamento) e tramite le API di OpenAI. Gli utenti possono caricare immagini direttamente nella chat, in formato JPG, PNG, GIF o WebP, per farle analizzare dal modello. Tramite API è possibile passare immagini come URL pubblici o come dati codificati in base64.

GPT-4V è ancora disponibile nel 2026?

Sì, GPT-4V rimane disponibile tramite le API di OpenAI e in ChatGPT. Tuttavia OpenAI ha rilasciato modelli più avanzati come GPT-4o e la famiglia GPT-5 che offrono capacità multimodali potenziate, con elaborazione nativa di testo, audio e immagini. GPT-4V resta comunque un riferimento importante per comprendere l'evoluzione dei modelli multimodali.

Quali sono i principali limiti di GPT-4V?

Tra i limiti principali di GPT-4V ci sono: difficoltà con immagini molto complesse o scene affollate, possibilità di errori in ambiti specialistici come la medicina (diagnosi radiologiche), imprecisioni nel conteggio di oggetti sovrapposti, limitazioni nel leggere testi parzialmente nascosti (come targhe oscurate) e una certa tendenza alle allucinazioni visive, ovvero a descrivere dettagli non presenti nell'immagine.

GPT-4V può essere usato in ambito medico?

GPT-4V mostra risultati promettenti nell'analisi di immagini mediche come radiografie e TAC, ma presenta ancora errori che ne rendono sconsigliabile l'uso autonomo per diagnosi cliniche. I test condotti da OpenAI hanno evidenziato casi di diagnosi errate o incomplete. Può essere utile come strumento di supporto per ridurre il carico di lavoro dei professionisti, ma richiede sempre la supervisione di personale medico qualificato.

GPT-4V può generare immagini?

No, GPT-4V è progettato per analizzare e comprendere immagini, non per generarle. Per la generazione di immagini OpenAI ha sviluppato modelli dedicati come DALL-E 2 e più recentemente GPT Image 1.5. GPT-4V può però assistere il processo generativo valutando le immagini prodotte e suggerendo prompt ottimizzati per migliorarne la qualità.

Quali sono le alternative più recenti a GPT-4V?

OpenAI ha successivamente rilasciato modelli con capacità multimodali ancora più avanzate. GPT-4o elabora nativamente testo, audio e immagini in modo integrato. La famiglia GPT-5.2 e il recente GPT-5.4 (con finestra di contesto da 1 milione di token e computer use) rappresentano lo stato dell'arte attuale. Questi modelli mantengono le capacità visive di GPT-4V, amplificandole con ragionamento più profondo e velocità di risposta superiore.

Tabella dei contenuti
Articoli correlati:
Vuoi che l'AI diventi il tuo motore di valore più potente?

Ti accompagniamo noi con Mimír AI Agent.