ChatGPT genera immagini da un anno, ma i media italiani lo scoprono oggi

ChatGPT genera immagini da un anno, ma i media italiani lo scoprono oggi. Ancora una volta approssimazione sulla iA

Repubblica e ANSA, ma anche molte altre fonti d’informazione italiane, da ieri annunciano con enfasi che ChatGPT, nella sua versione GPT-4o, è ora capace di generare immagini, modificarle ed “emularne” lo stile. Una notizia trattata come novità assoluta. Peccato che sia tutto vero — ma con quasi un anno di ritardo. Tutto ciò evidenzia quanto sia trattata con superficialità e pressapochezza, in Italia, ogni notizia relativa all’intelligenza artificiale.

Sì, perché ChatGPT genera immagini da maggio 2023, quando OpenAI ha integrato per la prima volta DALL·E 2 nella chat

Da ottobre dello stesso anno, con l’introduzione di DALL·E 3, la qualità e la fedeltà ai prompt sono migliorate drasticamente, e da allora è possibile anche modificare immagini esistenti (inpainting) direttamente in chat. La vera novità di oggi non è che ChatGPT generi immagini, ma come lo fa: usando GPT-4o, un modello omnimodale più veloce e preciso.

La differenza non è banale, ma nemmeno rivoluzionaria. GPT-4o non usa più il classico processo di diffusione visiva, bensì un approccio “autoregressivo” che permette la costruzione dell’immagine pixel per pixel — e soprattutto una resa più accurata del testo dentro le immagini. Ma la funzione, nel suo concetto base, non è nuova. E raccontarla come tale significa ignorare l’intera evoluzione della tecnologia nel 2023.

La superficialità del racconto mediatico italiano è evidente anche nella terminologia: si scrive che “basta una frase” per ottenere un’immagine “ispirata a uno stile” — quando questo era già possibile lo scorso anno inserendo prompt come “in stile Ghibli”, “in stile Picasso”, o “in stile Escher”. Milioni di utenti lo hanno fatto, generando contenuti su TikTok e Instagram prima ancora che le redazioni si accorgessero dell’esistenza della funzione.

Certo, OpenAI oggi amplia l’accessibilità di questi strumenti, rendendoli nativi nel modello GPT-4o e disponibili anche per utenti Free. Ma il problema non è l’entusiasmo con cui vengono presentate queste funzioni. È l’assenza di contesto. La narrazione di una scoperta che, per chi segue l’evoluzione dell’IA, è già storia passata. È il modo in cui la stampa generalista si accoda alle note stampa, senza distinguere tra rilascio e rilancio.

Quello che cambia oggi non è il fatto che ChatGPT “possa creare immagini”, ma come lo fa

Ecco cosa c’è di nuovo, nel dettaglio:

  1. La generazione di immagini è ora integrata direttamente nel modello GPT-4o
    Fino a oggi, ChatGPT si appoggiava a DALL·E come strumento esterno. Adesso, con GPT-4o, la generazione di immagini è una capacità nativa del modello stesso, non più demandata a un modulo separato.
  2. Non solo generazione: anche editing e modifica sono ora integrati
    È possibile modificare immagini caricate nella chat, ad esempio cambiando elementi, colori, stile o aggiungendo nuovi dettagli. Già con DALL·E 3 era disponibile l’inpainting, ma oggi è integrato nativamente e in modo più fluido nel flusso conversazionale.
  3. È disponibile anche per gli utenti Free (in rollout progressivo)
    A differenza delle versioni precedenti, oggi anche gli utenti non paganti possono accedere alla funzione, seppure con tempi e modalità scaglionate.
  4. È utilizzabile anche all’interno di Sora
    Sora è la piattaforma video generativa di OpenAI: qui la funzione può essere sfruttata come punto di partenza per passare da immagine a video, aprendo scenari di creazione multimediale avanzata.
  5. Maggiore precisione nei testi visivi
    Uno dei punti deboli storici dell’AI generativa era la scrittura corretta del testo nelle immagini (es. cartelli, loghi, titoli). GPT-4o è in grado di rappresentare testi con molta più accuratezza rispetto a DALL·E 2 o 3.

In praticaChatGPT non ha imparato solo oggi a generare immagini. Lo faceva già, da tempo. La vera novità è che adesso, grazie a GPT-4o, questa funzione è più veloce, più integrata, più fluida, modificabile, e disponibile a più utenti oltre ad avere una serie di filtri per difendere il diritto d’autore ed evitare creazioni violente e pedopornografiche (il che accadeva in verità già in precedenza).

Forse sarebbe ora che certo giornalismo italiano cominciasse a fare i compiti e a studiare — o, per restare in tema, che aggiornasse il proprio prompt.

Ps: questo articolo lo ha scritto proprio ChatGpt

Leggi anche

il randagio edizioni ecorandagio notizie

Related Post