Il 70% delle diagnosi realizzate dai Chatbot medici è sbagliato. Questo il risultato di uno studio pubblicato sull’European Journal of Pathology. Lo studio ha ricevuto uno dei 4 premi assegnati dall’ordine dei medici di Milano dedicati a Roberto Anzalone (una figura storica della medicina milanese). Tale studio getta ombre sull’attuale, reale, affidabilità dei chatbot medici basati su intelligenza artificiale generativa. I risultati mostrano che, su duecento domande cliniche poste a ChatGPT, quasi il settanta per cento conteneva errori, e in circa un terzo dei casi le fonti citate erano imprecise o inesistenti. Quella delle fonti inventate rimane uno dei pericoli più gravi legati all’uso di iA generative.
Il premio dell’Ordine dei Medici di Milano e l’obiettivo dello studio
Il lavoro, è stato condotto da un gruppo di giovani ricercatori dell’Istituto Clinico Humanitas e della Humanitas University di Rozzano. Il coordinatore, Vincenzo Guastafierro, specializzando in Anatomia Patologica, ha spiegato che il progetto è nato nel 2023 con un obiettivo preciso: valutare i rischi legati all’uso dei chatbot nella pratica clinica e nella formazione medica.
L’esperimento ha previsto la creazione di cinque scenari clinici simulati, in cui un patologo si confrontava con ChatGPT per affinare una diagnosi. Ogni scenario è stato costruito seguendo le linee guida diagnostiche più aggiornate e validato da esperti del settore. Le domande, aperte o a risposta multipla, coprivano diverse sottospecialità della patologia: dalle neoplasie epatiche alle lesioni cutanee, fino ai tumori della mammella.
Gli errori più frequenti e le “fonti fantasma”
Il chatbot ha fornito risposte corrette solo nel 32,1 per cento dei casi, mentre nel restante 67,9 per cento è comparso almeno un errore. Su 214 riferimenti bibliografici citati, il 70,1 per cento era corretto, il 12,1 per cento impreciso e il 17,8 per cento completamente inventato. Gli studiosi hanno parlato di una vera e propria costruzione di realtà alternative, con citazioni apparentemente plausibili ma del tutto false.
In uno dei casi più eclatanti, l’intelligenza artificiale ha sbagliato la diagnosi di un carcinoma cutaneo, classificandolo come una lesione benigna. In un altro scenario ha indicato un tumore al seno di tipo errato, supportando la risposta con due articoli mai pubblicati. Questi episodi hanno confermato la pericolosità di un utilizzo acritico dei chatbot in campo medico. Questo anche alla luce del fatto che sempre di più gli utenti tendono a non verificare le fonti indicate da chatgpt o dagli altri chatbot.
I limiti dell’intelligenza artificiale in ambito diagnostico
Secondo Guastafierro, i risultati dimostrano che l’intelligenza artificiale può rappresentare un supporto, ma non può sostituire la competenza umana. La medicina è fatta di osservazione, esperienza e interpretazione, elementi che nessun algoritmo può replicare con precisione. Il rischio, spiega il ricercatore, è che un medico in formazione o un paziente inesperto accetti come vere risposte scorrette o imprecise, con conseguenze potenzialmente gravi sul piano terapeutico.
L’errore principale risiede nella natura stessa dei chatbot generativi, che producono risposte sulla base di correlazioni statistiche e non di ragionamenti clinici. In ambito medico, questo può tradursi in un apparente rigore formale privo di fondamento scientifico. Lo studio ricorda che anche quando le risposte sembrano attendibili, la verifica delle fonti è indispensabile.
I risultati emersi dal lavoro dei ricercatori italiani arrivano in un momento in cui la sanità digitale è al centro di una rapida evoluzione
Molti ospedali stanno sperimentando sistemi di supporto decisionale basati su algoritmi di apprendimento automatico, ma la ricerca invita alla prudenza. Gli strumenti di intelligenza artificiale, pur potendo accelerare la raccolta e l’analisi dei dati, non possiedono la capacità critica del medico, né la sensibilità necessaria per valutare un caso nella sua complessità.
Il rischio più grande è la delega. Quando la fiducia nella tecnologia diventa cieca, il margine d’errore si allarga. La medicina, ricordano gli autori, non può essere ridotta a una sequenza di input e output. È un processo interpretativo, costruito sull’esperienza, sulla percezione e sulla conoscenza diretta del paziente.
Il gruppo dell’Humanitas continuerà a lavorare su versioni più recenti dei modelli di intelligenza artificiale per verificare se la loro affidabilità migliorerà nel tempo
L’obiettivo non è demonizzare la tecnologia, ma comprenderne i limiti per definire standard di utilizzo più sicuri. Lo studio suggerisce anche di introdurre controlli specifici per verificare la qualità dei dati e la veridicità dei riferimenti bibliografici generati dalle macchine.
La medicina del futuro sarà certamente più digitale, ma la responsabilità diagnostica rimarrà umana. L’iA potrà assistere, mai sostituire. Il confine tra supporto e delega resta sottile, e ignorarlo significherebbe tradire la stessa essenza del mestiere medico: quella capacità di giudizio che nessuna macchina potrà mai riprodurre.
Francesca Rampazzo
Leggi anche
- OpenAI lancia intelligenza artificiale della longevità
- L’intelligenza artificiale non esiste
- Il Premio Nobel per la Chimica 2024 a Baker, Hassabis e Jumper anche grazie all’uso di intelligenza artificiale: AlphaFold 2
- Fine del sogno di vivere oltre 100 anni. Siamo vicini a un tetto
- 5 segreti dell’intelligenza artificiale che nessun giornalista o corso on line racconta chiaramente

