Il 29 novembre 2022 OpenAI ha rilasciato text-davinci-003, il nuovo modello della famiglia GPT-3 che integra i precedenti modelli InstructGPT e migliora la qualità del testo, la gestione di istruzioni complesse e la generazione di output lunghi. Il modello è il risultato dell’applicazione su larga scala delle tecniche di allineamento tramite feedback umano descritte nel paper Ouyang et al. (2022), e rappresenta uno snodo critico nell’evoluzione verso ChatGPT e GPT-4.
In questo articolo scoprirai:
- I limiti dei modelli precedenti di GPT-3 e perché è stato necessario superarli
- Cosa sono i modelli InstructGPT e come funziona il training in tre fasi con valutatori umani
- Esempi pratici di utilizzo di text-davinci-003 sul Playground di OpenAI
- Il posizionamento storico del modello tra GPT-3, GPT-3.5-Turbo e GPT-4
- Il deprecamento ufficiale del gennaio 2024 e il lascito delle tecniche RLHF
Questa evoluzione è proseguita fino al nuovo GPT-5.3-Codex, il modello OpenAI specializzato nel coding agentico.
Limiti dei modelli precedenti di GPT-3
I modelli GPT-3 precedenti mostravano tre problemi principali: linguaggio tossico, allucinazioni e scarsa appropriatezza delle risposte. Come dichiarato dai ricercatori OpenAI nel paper Training language models to follow instructions with human feedback, GPT-3 è stato addestrato per prevedere la parola successiva su un ampio set di testi presi da Internet, senza una supervisione esplicita sull’intento dell’utente.
Questo approccio determinava che il modello non fosse sempre in grado di eseguire in modo sicuro il compito linguistico desiderato dall’utente.
Nello specifico i modelli GPT mostravano alcuni problemi:
- Linguaggio tossico: in alcuni casi il contenuto prodotto poteva essere verbalmente aggressivo o offensivo verso alcune categorie di persone.
- Allucinazioni: di fronte a domande specifiche il modello poteva inventare fatti, nomi o produzioni di fantasia, generando quindi risposte false.
- Appropriatezza: non sempre l’output prodotto da GPT-3 aveva una buona appropriatezza, discostandosi dalle attese dell’utente.
Cosa sono i modelli InstructGPT?
Gli InstructGPT sono modelli linguistici affinati tramite feedback umano che rendono GPT-3 più sicuro, più utile e più allineato alle richieste degli utenti. Per allenarli, i ricercatori di OpenAI hanno coinvolto 40 valutatori umani in un processo articolato in tre fasi, descritto nel dettaglio nel paper di Ouyang et al. (2022). I modelli precedenti infatti si basavano esclusivamente sull’analisi dei testi online, senza una supervisione umana sull’output.
Prima fase
Nella prima fase vengono raccolti prompt reali forniti da clienti OpenAI tramite il Playground. Ai 40 valutatori umani è stato chiesto di rispondere direttamente a questi prompt fornendo risposte scritte che sono state collezionate in un dataset supervisionato.
Questi dati sono stati utilizzati per allenare un primo modello supervisionato dall’uomo che è stato utilizzato come baseline.
Seconda fase
Nella seconda fase un singolo prompt viene campionato insieme a più risposte alternative. Agli sperimentatori umani è stato chiesto di valutare queste risposte attribuendo a ciascuna un punteggio di appropriatezza, identificando le migliori e le peggiori.
Questi dati sono stati utilizzati per costruire un modello di rinforzo (reward model) per prevedere quali output sarebbero stati considerati migliori dai valutatori umani. La tecnica si basa sul lavoro pionieristico di Christiano et al. (2017) sul deep reinforcement learning from human preferences.
Terza fase
Nella terza fase sono stati forniti al modello nuovi prompt per generare nuove risposte. Queste risposte sono state pesate attraverso il modello di rinforzo in modo da massimizzare il reward, con l’obiettivo di rendere gli output più simili a quelli “premiati” dai valutatori umani.
Parallelamente, l’ottimizzazione mirava a ridurre le probabilità di emissione di contenuto tossico, rendendo il modello più allineato alla policy di OpenAI, come documentato nel post Aligning Language Models to Follow Instructions.

Text-davinci-003
Abbiamo testato text-davinci-003 utilizzando il Playground di OpenAI su alcuni compiti concreti, per valutarne in prima persona la qualità degli output. Chi volesse replicare l’esperimento può seguire le indicazioni su come accedere a GPT-3 di OpenAI.
Come sfruttare le intelligenze artificiali nello sviluppo di applicazioni web
Abbiamo chiesto a GPT-3 quali siano i vantaggi e gli svantaggi nell’utilizzare intelligenze artificiali nello sviluppo di applicazioni web.
Qui avete le risposte di GPT-3:
Vantaggi
- Possibilità di creare applicazioni web più intelligenti, che possono apprendere e adattarsi in base alle circostanze
- Migliore esperienza utente grazie alla possibilità di personalizzare le applicazioni in base alle preferenze degli utenti
- Risparmio di costi riducendo il tempo necessario per lo sviluppo delle applicazioni
- Possibilità di realizzare in breve tempo applicazioni con capacità di analisi avanzate
Svantaggi
- La complessità delle tecnologie di IA può essere un ostacolo per alcuni sviluppatori
- I costi iniziali per l’implementazione possono essere elevati
- La mancanza di controllo dei dati trattati da alcune applicazioni di IA può comportare problemi di privacy e di sicurezza
- Le applicazioni IA possono essere soggette a errori e risultati imprevisti
Dimostra il teorema del limite centrale usando Python
Il teorema del limite centrale afferma che, dato un numero sufficientemente alto di variabili casuali indipendenti e identicamente distribuite, la distribuzione della loro media tende a convergere verso una distribuzione normale.
Abbiamo chiesto a GPT-3 di dimostrare questo teorema utilizzando Python.
Questa è la risposta:
# importare le librerie necessarie
import numpy as np
import matplotlib.pyplot as plt
# generare i dati
n_samples = 100000
data = np.random.randn(n_samples)
# calcolare la media campionaria
mean_samples = [np.mean(data[:i]) for i in range(1, n_samples)]
# generare un istogramma dei dati
plt.hist(mean_samples, bins=50, density=True)
plt.xlabel("Mean Sample")
plt.ylabel("Frequenza")
plt.title("Distribuzione delle Medie Campionarie")
plt.show()Per provare text-davinci-003
Per sperimentare text-davinci-003 l’opzione più semplice è utilizzare ChatGPT, l’interfaccia conversazionale che ha reso popolare il modello presso il grande pubblico.
OpenAI ha infatti deciso di rendere pubblico e gratuito il modello, con alcuni limiti, e questa scelta ha generato un interesse senza precedenti in tutto il mondo.
Text-davinci-003 nella genealogia dei modelli OpenAI: un’analisi storica
Text-davinci-003 è lo snodo critico tra la prima generazione di GPT-3 e i grandi modelli conversazionali che ne sono seguiti. A distanza di anni dal suo rilascio, è possibile contestualizzarlo nella più ampia traiettoria evolutiva dei modelli OpenAI, riconoscendone il ruolo di ponte tecnologico verso l’era di ChatGPT.
La famiglia davinci: un’evoluzione graduale
All’interno della serie GPT-3, la famiglia davinci rappresentava il livello di capacità più elevato, contrapposto ai modelli più leggeri e veloci come ada, babbage e curie. La progressione fu sistematica:
- text-davinci-001: primo modello InstructGPT con supervisione umana di base, ma ancora limitato nella coerenza su testi lunghi.
- text-davinci-002: miglioramenti nella riduzione degli output tossici e nella gestione del contesto, con una maggiore stabilità nelle risposte a istruzioni complesse.
- text-davinci-003: il salto qualitativo più significativo dell’intera famiglia, con comprensione del contesto notevolmente migliorata, output più lunghi e coerenti, e una capacità senza precedenti di seguire istruzioni articolate su più passaggi.
Parallelamente allo sviluppo dei modelli di completamento testuale, OpenAI continuava a perfezionare modelli specializzati per compiti specifici. Un esempio significativo è text-ada-embedding-002, rilasciato nello stesso periodo, pensato specificamente per la generazione di rappresentazioni semantiche vettoriali (embeddings) ad alta qualità — un tassello fondamentale per applicazioni di ricerca semantica e retrieval-augmented generation.
Il passaggio a GPT-3.5-Turbo: la svolta conversazionale
Appena tre mesi dopo il rilascio di text-davinci-003, nel marzo 2023, OpenAI presentò GPT-3.5-Turbo, il modello che avrebbe alimentato la prima versione pubblica di ChatGPT su larga scala. GPT-3.5-Turbo non era semplicemente più capace: era stato progettato specificamente per il formato conversazionale a turni (messages), era significativamente più veloce e fino a dieci volte più economico per token rispetto a text-davinci-003. Divenne rapidamente lo standard de facto per la stragrande maggioranza delle applicazioni basate su LLM.
Questo cambio di paradigma — dal modello di completamento al modello di chat — segnò la fine pratica dell’utilità di text-davinci-003 per la maggior parte degli sviluppatori, anche se quest’ultimo rimase disponibile via API per diversi mesi ancora.
GPT-4 e la svolta multimodale
Nel marzo 2023 arrivò anche GPT-4, il modello che portò le capacità ragionative a un livello qualitativamente diverso rispetto all’intera serie GPT-3. Secondo il GPT-4 Technical Report, il modello introdusse la comprensione delle immagini (modalità multimodale), superò gli esami professionali umani in discipline come medicina e diritto, e dimostrò una coerenza su testi molto lunghi (fino a 32.000 token nel contesto esteso) che text-davinci-003 non avrebbe mai potuto raggiungere. Da quel momento, text-davinci-003 divenne obsoleto per qualsiasi use case avanzato.
Il deprecamento e il lascito tecnico
OpenAI deprecò ufficialmente text-davinci-003 nel gennaio 2024, insieme agli altri modelli della serie completamento di GPT-3, come documentato nella pagina ufficiale Model deprecations. Questa scelta segnò la chiusura definitiva di un’intera architettura di interazione con i modelli linguistici: l’era del prompt completion cedeva il passo al formato di chat strutturato, oggi universale.
Il suo lascito, tuttavia, rimane profondo e misurabile. Il RLHF (Reinforcement Learning from Human Feedback) è una tecnica di addestramento che usa preferenze umane per rifinire il comportamento di un modello linguistico, ed è proprio con text-davinci-003 che questa metodologia raggiunse la maturità operativa su scala produttiva. Le stesse tecniche, raffinate e ampliate, sono alla base dell’allineamento di tutti i modelli di frontiera odierni, inclusi gli attuali GPT-5 e i suoi successori, rendendo text-davinci-003 un anello imprescindibile nella catena evolutiva che ha trasformato i modelli linguistici da strumenti di ricerca a tecnologie di uso quotidiano.
Conclusioni
Da una prima analisi di text-davinci-003 era possibile già allora rilevare un sensibile miglioramento rispetto a text-davinci-002: maggiore precisione nel cogliere il prompt, risposte più lunghe e qualità del testo sensibilmente aumentata.
Con il senno di poi, quei miglioramenti erano solo il prologo di una trasformazione molto più radicale. Text-davinci-003 fu l’ultimo modello di completamento della serie GPT-3 a ricevere un aggiornamento significativo prima che l’intera architettura venisse superata dalla famiglia GPT-3.5 e poi da GPT-4. Il suo contributo più duraturo non fu la qualità dell’output in sé, ma aver dimostrato — su scala produttiva — che l’allineamento tramite feedback umano funzionava davvero: una prova di concetto che avrebbe orientato tutta la ricerca successiva di OpenAI.
Fonti
- Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P., Leike, J., & Lowe, R. (2022). Training language models to follow instructions with human feedback. https://doi.org/10.48550/arxiv.2203.02155
- Christiano, P. F., Leike, J., Brown, T. B., Martic, M., Legg, S., & Amodei, D. (2017). Deep reinforcement learning from human preferences. Advances in Neural Information Processing Systems, 2017-December, 4300–4308.
- Aligning Language Models to Follow Instructions. OpenAI Blog. https://openai.com/blog/instruction-following/
- Our approach to alignment research. OpenAI Blog. https://openai.com/blog/our-approach-to-alignment-research/
- OpenAI (2023). GPT-4 Technical Report. https://doi.org/10.48550/arxiv.2303.08774
- Model deprecations. OpenAI Platform Documentation. https://platform.openai.com/docs/deprecations
Domande frequenti
Cos'è text-davinci-003?
text-davinci-003 è il modello della famiglia GPT-3 rilasciato da OpenAI il 29 novembre 2022, che integra i precedenti modelli InstructGPT e migliora la qualità del testo, la gestione di istruzioni complesse e la generazione di output lunghi. È il risultato dell'applicazione su larga scala delle tecniche di allineamento tramite feedback umano e rappresenta uno snodo critico nell'evoluzione verso ChatGPT e GPT-4.
Quali limiti avevano i modelli GPT-3 precedenti?
I modelli GPT-3 precedenti mostravano tre problemi principali: linguaggio tossico, allucinazioni e scarsa appropriatezza delle risposte. Erano addestrati a prevedere la parola successiva su grandi quantità di testo da Internet, senza una supervisione esplicita sull'intento dell'utente, e quindi non sempre allineati a ciò che le persone chiedevano realmente.
Cosa sono i modelli InstructGPT?
Gli InstructGPT sono modelli linguistici affinati tramite feedback umano per rendere GPT-3 più sicuro, utile e allineato alle richieste degli utenti. Per addestrarli, OpenAI ha coinvolto circa 40 valutatori umani in un processo articolato in tre fasi (descritto nel paper di Ouyang et al., 2022), superando l'approccio basato solo sulla previsione statistica del testo.
Che ruolo ha avuto text-davinci-003 nell'evoluzione verso ChatGPT?
text-davinci-003 è lo snodo critico tra la prima generazione di GPT-3 e i grandi modelli conversazionali successivi: un ponte tecnologico verso l'era di ChatGPT. Rispetto a text-davinci-002 mostrava già maggiore precisione nel cogliere il prompt, risposte più lunghe e una qualità del testo sensibilmente superiore, anticipando le capacità che avrebbero reso popolare ChatGPT.



