Un studiu recent aduce o concluzie surprinzătoare pentru cei care credeau că inteligența artificială medicală trebuie neapărat să fie specializată: modelele de limbaj de uz general — cum ar fi cele din familia GPT sau similare — au obținut scoruri mai bune decât instrumentele AI dezvoltate special pentru uz clinic, atunci când au fost evaluate pe benchmark-uri medicale standardizate.
Cercetătorii au comparat performanța mai multor modele pe seturi de întrebări medicale validate, acoperind specialități diverse — de la medicină internă la chirurgie și radiologie. Modelele generaliste au performat consistent mai bine, chiar și în domenii unde instrumentele specializate fuseseră antrenate pe date clinice specifice. Diferența de performanță a fost statistic semnificativă în mai multe categorii de întrebări, ceea ce sugerează că accesul la un volum uriaș și diversificat de date textuale oferă un avantaj net față de antrenamentul pe corpusuri înguste, dar de înaltă specialitate.
Pentru medicii care utilizează sau evaluează soluții AI în spital ori în cabinet, concluzia practică este nuanțată: un model general bine antrenat poate fi mai util decât un instrument clinic de nișă, cel puțin în sarcini care implică raționament medical pe baza întrebărilor standardizate. Totuși, autorii studiului subliniază că performanța pe benchmark-uri nu se traduce automat în utilitate clinică reală. Interacțiunea cu pacientul, integrarea datelor imagistice și contextul individual al fiecărui caz rămân domenii în care specializarea își păstrează relevanța.
Studiul ridică întrebări importante despre direcția investițiilor în AI medical și despre criteriile prin care clinicienii ar trebui să aleagă instrumentele digitale pe care le integrează în practica curentă.

