Servicii Sănătate Tehnologii Blog Despre noi Contact Scrieți-ne

Cum se antrenează o rețea neuronală: ghid pentru spitale

2026-10-0614 minConsdinamic

Ce este un model, din ce date învață, cum se măsoară, de ce scade performanța în alt spital și ce întrebări trebuie puse unui furnizor înainte de a semna.

Un director de spital care primește o ofertă pentru un sistem de inteligență artificială nu trebuie să știe să scrie cod. Trebuie însă să înțeleagă suficient din felul în care a fost antrenat și verificat modelul ca să pună întrebările corecte și să recunoască răspunsurile incomplete. Articolul de mai jos explică procesul fără matematică, cu cifre din studii publicate și cu obligațiile din cadrul european.

Ce este un model și din ce învață

O rețea neuronală este o funcție matematică foarte mare, cu milioane sau miliarde de numere interne numite parametri sau ponderi (în engleză weights). La început aceste numere sunt aleatorii, iar modelul nu știe nimic. Antrenarea este procesul prin care parametrii se ajustează, pas cu pas, până când modelul dă răspunsuri corecte pe exemplele pe care le vede. Modelul nu memorează reguli medicale; învață corelații statistice între imagini sau valori de laborator și etichetele primite.

Datele se împart, înainte de orice, în trei seturi cu roluri diferite:

  • Setul de antrenare: materialul din care învață modelul; aici se ajustează parametrii.
  • Setul de validare: folosit de echipă pentru a compara variante și a decide când se oprește antrenarea.
  • Setul de testare: pus la o parte de la început și folosit o singură dată, la final.

Dacă cineva se uită la rezultatele pe setul de testare și apoi modifică modelul, acel set devine, practic, un al doilea set de validare, iar performanța raportată nu mai spune nimic despre pacienți noi.

Etichetele: cine le pune și cât de mult sunt de acord

Pentru a învăța, modelul are nevoie de etichete: fiecare imagine sau episod de îngrijire trebuie să poarte răspunsul corect („retinopatie referabilă", „pneumonie prezentă", „sepsis la ora X"). Etichetele le pun clinicieni, iar calitatea modelului nu poate depăși calitatea lor.

Un exemplu bine documentat este studiul Gulshan et al. (JAMA, 2016) pentru retinopatia diabetică: 128.175 de fotografii de fund de ochi au fost etichetate de 54 de oftalmologi și rezidenți în ultimul an, fiecare imagine primind între 3 și 7 evaluări independente, iar eticheta finală a fost decizia majorității.

Motivul pentru care sunt necesare mai multe evaluări per caz este acordul limitat dintre specialiști. Elmore et al. (JAMA, 2015) au cerut la 115 patologi din Statele Unite să interpreteze independent biopsii mamare, în total 6.900 de interpretări. Concordanța cu diagnosticul de referință stabilit prin consens a fost de 75,3 %: 96 % pentru carcinomul invaziv, 84 % pentru carcinomul ductal in situ (DCIS), 87 % pentru leziunile benigne fără atipie și doar 48 % pentru atipie.

Un model nu poate fi mai bun decât etichetele din care a învățat. Întrebați cine a etichetat, câți au fost și cum s-au rezolvat dezacordurile.

Bucla de antrenare și supraînvățarea

Antrenarea este o buclă repetată de milioane de ori. În cuvinte simple, fiecare pas are patru momente:

  1. Trecerea înainte (forward pass): modelul primește un exemplu și produce o predicție, de obicei o probabilitate.
  2. Pierderea (loss): un număr care măsoară cât de departe este predicția de eticheta corectă.
  3. Propagarea înapoi (backpropagation): calculul care stabilește, pentru fiecare parametru, în ce direcție trebuie ajustat ca pierderea să scadă.
  4. Actualizarea: fiecare parametru se mută puțin în direcția indicată. Cât de mult se mută este dat de rata de învățare (learning rate): prea mare, și modelul sare peste soluție; prea mică, și antrenarea durează foarte mult.

O trecere completă prin setul de antrenare se numește epocă; un model este antrenat de obicei zeci de epoci, iar după fiecare echipa măsoară pierderea pe setul de validare.

Aici apare fenomenul care contează cel mai mult pentru un cumpărător: supraînvățarea (overfitting). La un moment dat modelul începe să memoreze particularitățile exemplelor de antrenare în loc să învețe tiparul general. Semnul este simplu: pierderea pe antrenare continuă să scadă, dar pierderea pe validare se oprește și apoi crește. Graficul de mai jos este o ilustrare cu date de exemplu, nu rezultatul unui studiu.

Supraînvățarea: pierderea pe antrenare față de validare (ilustrare)1,00,70,50,2012345678910■ Antrenare■ Validare
Date de exemplu, ilustrative; axa X = epoci. Nu provin dintr-un studiu.

Un furnizor serios poate arăta acest grafic pentru modelul lui; dacă nu îl are, nu știe unde s-a oprit și de ce.

Validarea externă: de ce scade performanța în alt spital

Un model care trece bine testul intern nu a dovedit încă nimic despre spitalul dumneavoastră. Performanța scade aproape sistematic pe date din alte instituții, cu alte aparate, alte populații și alte protocoale.

Zech et al. (PLOS Medicine, 2018) au antrenat un model de detecție a pneumoniei pe 158.323 de radiografii toracice din trei instituții. Modelul antrenat pe datele spitalului Mount Sinai a obținut o arie sub curbă (AUC) de 0,802 pe testul intern, dar 0,717 pe datele de la National Institutes of Health și 0,756 pe cele din Indiana. Explicația a fost în date: prevalența pneumoniei era de 34,2 % la Mount Sinai față de 1,2 % și 1,0 % în celelalte două. Un model antrenat să ghicească doar din ce spital provine radiografia a reușit în 99,95 % din cazuri. Rețeaua învățase să recunoască spitalul, nu boala.

În patologia digitală, Campanella et al. (Nature Medicine, 2019) au antrenat un model pe 44.732 de lame de la 15.187 de pacienți, cu AUC 0,991 pentru cancerul de prostată pe testul intern. Pe peste 12.000 de lame de consult din alte instituții, AUC a scăzut cu circa 6 puncte; simpla schimbare a scanerului a costat circa 3 puncte.

Cel mai cunoscut exemplu comercial este modelul de predicție a sepsisului integrat într-un sistem informatic spitalicesc larg răspândit. Wong et al. (JAMA Internal Medicine, 2021) l-au evaluat pe 27.697 de pacienți și 38.455 de spitalizări la Michigan Medicine: AUC 0,63, față de 0,76–0,83 în documentația producătorului. La pragul folosit, sensibilitatea a fost 33 %, specificitatea 83 % și valoarea predictivă pozitivă 12 %. Sistemul a generat alerte pentru 18 % din spitalizări și a ratat 67 % din pacienții cu sepsis.

Scăderea AUC la validarea externă, în studii publicatePneumonie: test intern0,8Pneumonie: alt spital (NIH)0,7Pneumonie: alt spital (IU)0,8Sepsis: minim raportat0,8Sepsis: validare Michigan0,6
Sursa: Zech et al., PLOS Medicine, 2018; Wong et al., JAMA Internal Medicine, 2021

Problema este structurală. Wu et al. (Nature Medicine, 2021) au analizat cele 130 de dispozitive medicale cu AI autorizate de FDA între 2015 și 2020: 126 fuseseră evaluate doar retrospectiv, 93 nu publicau nimic despre evaluarea în mai multe centre, iar dintre cele 41 care o făceau, 4 fuseseră evaluate într-un singur centru și 8 în două.

Metricile care contează clinic

Furnizorii raportează de obicei „acuratețea", o cifră care depinde de prevalență și spune puțin despre decizia clinică. Tabelul de mai jos arată metricile care trebuie cerute.

Metrică Ce răspunde De ce contează pentru spital
Sensibilitate Din pacienții cu boală, câți sunt detectați? Cazurile ratate (fals negative)
Specificitate Din pacienții fără boală, câți sunt corect excluși? Alarmele false și oboseala de alertă
AUC (aria sub curba ROC) Cât de bine separă modelul bolnavii de cei sănătoși, la toate pragurile Comparație între modele; nu spune nimic despre un prag anume
Valoare predictivă pozitivă Când modelul alertează, cât de des are dreptate? Depinde puternic de prevalența locală
Calibrare Când modelul spune „30 % risc", se întâmplă în 30 % din cazuri? Decizii bazate pe probabilitate, nu doar pe clasament

Același model are mai multe perechi sensibilitate–specificitate, în funcție de pragul ales. În Gulshan et al. (JAMA, 2016), algoritmul a fost raportat la două puncte de operare pe setul EyePACS-1: 90,3 % sensibilitate cu 98,1 % specificitate, sau 97,5 % sensibilitate cu 93,4 % specificitate, pentru același AUC de 0,991. Pragul este o decizie clinică și organizatorică, nu una tehnică.

Calibrarea este la fel de importantă. Un model poate avea AUC bun și totuși să supraestimeze sistematic riscul (intervenții inutile) sau să îl subestimeze (cazuri pierdute). Wong et al. au raportat pentru modelul de sepsis atât discriminare slabă, cât și calibrare slabă. Cereți curba de calibrare, nu doar AUC.

Câte date și cât calcul

Nu există un număr universal, dar studiile publicate dau ordinele de mărime. Modelele care au făcut istorie în diagnosticul pe imagini au fost antrenate pe sute de mii de exemple etichetate: 128.175 de fotografii retiniene în Gulshan et al. (2016), 158.323 de radiografii în Zech et al. (2018). În patologie, unde o lamă conține miliarde de pixeli, Campanella et al. (2019) au folosit 44.732 de lame întregi.

Mărimea seturilor de date în studii cunoscute1837,5 mii1378,1 mii918,7 mii459,4 mii0 mii128,2 miiRetină, Gulshan 2016158,3 miiRadiografii, Zech 201844,7 miiLame, Campanella 20191640,6 miiRETFound, neetichetate
Sursa: Gulshan et al., JAMA, 2016; Zech et al., PLOS Medicine, 2018; Campanella et al., Nature Medicine, 2019; Zhou et al., Nature, 2023

Două tehnici reduc nevoia de etichete. Învățarea prin transfer (transfer learning) pornește de la un model antrenat pe altă sarcină și îl ajustează pe date medicale. Modelele de fundație (foundation models) se pre-antrenează pe volume mari de date neetichetate și se adaptează apoi cu puține etichete. RETFound, publicat de Zhou et al. în Nature (2023), a fost pre-antrenat pe 1,6 milioane de imagini retiniene fără nicio etichetă (904.170 fotografii de fund de ochi și 736.442 de scanări OCT). Adaptat ulterior, a depășit modelele comparate pentru predicția insuficienței cardiace cu doar 10 % din etichete, iar pentru retinopatia diabetică a atins rezultate comparabile cu 45–50 % din date.

Costul de calcul are ordine de mărime foarte diferite. Conform Zhou et al., pre-antrenarea RETFound a durat circa 14 zile pe 8 plăci grafice NVIDIA A100, iar adaptarea pe o sarcină nouă a cerut circa 70 de minute per 1.000 de imagini pe o singură placă T4, echipament obișnuit în cloud. La celălalt capăt, Epoch AI (Cottier et al., 2024) estimează costul amortizat al hardware-ului și energiei pentru antrenarea GPT-4 la circa 40 de milioane USD și pentru Gemini Ultra la circa 30 de milioane USD, cu o creștere de 2,4 ori pe an din 2016.

8 GPU × 14 zilepre-antrenarea RETFound pe 1,6 mil. imagini neetichetateZhou et al., Nature, 2023
~70 minadaptare per 1.000 imagini, pe un singur GPU T4Zhou et al., Nature, 2023
~40 mil. USDhardware și energie pentru antrenarea GPT-4Epoch AI, 2024
2,4×/ancreșterea costului de antrenare a modelelor de frontieră din 2016Epoch AI, 2024

Guvernanța datelor și cadrul european

Datele de antrenare provin din pacienți reali, deci guvernanța lor este o problemă juridică înainte de a fi una tehnică. Trei regulamente contează.

GDPR. Regulamentul (UE) 2016/679 definește, la articolul 4, operatorul ca entitatea care „stabilește scopurile și mijloacele" prelucrării (punctul 7) și persoana împuternicită ca entitatea care prelucrează „în numele operatorului" (punctul 8). Când un spital pune la dispoziție date pentru antrenare, spitalul rămâne operator și decide scopul; furnizorul acționează, de regulă, ca persoană împuternicită, pe baza unui contract scris. Pseudonimizarea (punctul 5) lasă datele atribuibile unei persoane „cu utilizarea de informații suplimentare", deci ele rămân date personale. Practica recomandată este de-identificarea cât mai completă înainte ca datele să părăsească spitalul, cu cheia de corespondență păstrată exclusiv la spital.

EHDS. Regulamentul (UE) 2025/327 privind spațiul european al datelor privind sănătatea, adoptat la 11 februarie 2025, reglementează utilizarea secundară a datelor de sănătate. Articolul 53 alineatul (1) litera (e) punctul (ii) enumeră explicit, printre scopurile permise, „antrenarea, testarea și evaluarea algoritmilor, inclusiv în dispozitive medicale, dispozitive medicale pentru diagnostic in vitro, sisteme de IA și aplicații de sănătate digitală". Accesul se face prin organismele de acces la datele de sănătate, iar articolul 54 prevede că utilizatorii prelucrează datele numai pe baza unui permis de date. Conform articolului 105, regulamentul se aplică de la 26 martie 2027, iar capitolul IV privind utilizarea secundară de la 26 martie 2029.

AI Act. Regulamentul (UE) 2024/1689 a intrat în vigoare la 1 august 2024 și se aplică în general de la 2 august 2026. Sistemele de IA care sunt dispozitive medicale sau componente de siguranță ale lor și trec printr-o evaluare a conformității de către un organism notificat sunt cu grad ridicat de risc (articolul 6 alineatul (1) și anexa I). Pentru ele, articolul 10 cere seturi de antrenare, validare și testare relevante, suficient de reprezentative și, pe cât posibil, fără erori și complete, cu examinarea posibilelor prejudecăți care pot afecta sănătatea și siguranța, iar articolul 72 cere un sistem de monitorizare post-comercializare care să colecteze și să analizeze „în mod activ și sistematic" date despre performanță pe toată durata de viață. Calendarul a fost modificat: Regulamentul (UE) 2026/1744 (Digital Omnibus on AI), adoptat la 8 iulie 2026, stabilește aplicarea obligațiilor pentru sistemele din anexa III de la 2 decembrie 2027 și pentru cele din anexa I, unde intră dispozitivele medicale, de la 2 august 2028.

Monitorizarea cerută de articolul 72 are o justificare tehnică directă. Populația, aparatele și protocoalele unui spital se schimbă, iar un model antrenat pe datele de anul trecut poate pierde performanță treptat, fenomen numit derivă (drift).

Ce înseamnă pentru un spital din România sau Republica Moldova

Pentru un spital care evaluează un proiect de AI, fie că îl cumpără, fie că îl dezvoltă cu un partener, pașii practici sunt următorii:

  1. Definiți sarcina și pragul împreună cu clinicienii: ce decizie sprijină modelul, ce preferați să greșiți (alarme false sau cazuri ratate) și cine răspunde la alertă.
  2. Inventariați datele înainte de ofertă: câte cazuri aveți, pe ce aparate au fost produse, ce etichete există deja în sistemul informatic.
  3. Planificați etichetarea ca pe un proiect clinic: minimum doi evaluatori independenți și un mecanism de rezolvare a dezacordurilor, cu timp alocat.
  4. Cereți o validare locală înainte de contractul de producție: modelul rulează pe un eșantion retrospectiv din spitalul dumneavoastră, etichetat de clinicienii dumneavoastră.
  5. Semnați contractul de prelucrare a datelor înainte ca o singură înregistrare să părăsească spitalul: spitalul operator, furnizorul persoană împuternicită, date de-identificate, cheia la spital, scop limitat la antrenare și validare.
  6. Stabiliți monitorizarea de la început: cine măsoară lunar sensibilitatea, specificitatea și rata alertelor, și la ce prag se oprește sistemul pentru reevaluare.

Întrebările de pus unui furnizor despre antrenare și validare:

  1. Din câte instituții provin datele și câte cazuri are fiecare set (antrenare, validare, testare)?
  2. Setul de testare a fost folosit o singură dată, la final? Cine a avut acces la el?
  3. Cine a pus etichetele, câți evaluatori per caz și cum s-au rezolvat dezacordurile?
  4. Aveți graficul pierderii pe antrenare și validare pentru modelul livrat?
  5. Pe câte spitale externe a fost validat modelul și cu cât a scăzut AUC față de testul intern?
  6. Care sunt sensibilitatea, specificitatea și valoarea predictivă pozitivă la pragul propus, și cum arată curba de calibrare?
  7. Pe ce aparate și protocoale a fost antrenat? Ce se întâmplă dacă schimbăm scanerul?
  8. Cum monitorizați deriva după instalare și ce documentație furnizați conform articolului 72 din AI Act?
  9. Datele noastre vor fi folosite pentru a antrena modele livrate altor clienți? În ce condiții?

Consdinamic construiește software și inteligență artificială la comandă, cu cea mai adâncă specializare în sănătate, și lucrează cu Aiforia (Finlanda) pe seturi de date de-identificate pentru patologia digitală. Produsele proprii rulează zilnic într-o rețea medicală privată din România (Gral Medical, 29 de locații), iar validarea locală și contractul de date înainte de orice antrenare sunt practica pe care o aplicăm în proiectele noastre.

Concluzie

Antrenarea unei rețele neuronale nu este o cutie neagră pentru conducerea unui spital: trei seturi de date cu roluri separate, etichete puse de mai mulți clinicieni, un grafic de antrenare care arată unde s-a oprit modelul, o validare externă cu scăderea de performanță declarată onest, metrici la un prag ales împreună cu medicii și monitorizare după instalare. Studiile citate arată că scăderea de performanță între spitale este regula, nu excepția, iar GDPR, EHDS și AI Act (cu termenul de 2 august 2028 pentru dispozitivele medicale) transformă aceste bune practici în obligații. Un spital care pune întrebările din acest ghid înainte de a semna își protejează pacienții, bugetul și timpul clinicienilor.

Surse
  1. Zech et al., Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs, PLOS Medicine, 2018 — 158.323 radiografii din 3 instituții; AUC 0,802 intern, 0,717 și 0,756 extern; prevalență 34,2 % față de 1,2 % și 1,0 %; spitalul recunoscut în 99,95 % din imagini
  2. Wong et al., External Validation of a Widely Implemented Proprietary Sepsis Prediction Model in Hospitalized Patients, JAMA Internal Medicine, 2021 — 27.697 pacienți, 38.455 spitalizări; AUC 0,63 față de 0,76–0,83 în documentația producătorului; sensibilitate 33 %, specificitate 83 %, VPP 12 %; alerte la 18 % din spitalizări
  3. Wu et al., How medical AI devices are evaluated, Nature Medicine, 2021 — rezumat de politici Stanford HAI, 2022 — 130 dispozitive FDA 2015–2020; 126 evaluate doar retrospectiv; 93 fără informații despre evaluarea multi-centru; 4 evaluate într-un singur centru; 59 fără mărimea eșantionului; mediană 300
  4. Elmore et al., Diagnostic Concordance Among Pathologists Interpreting Breast Biopsy Specimens, JAMA, 2015 — 115 patologi, 6.900 interpretări; concordanță 75,3 % cu referința de consens; 96 % carcinom invaziv, 84 % DCIS, 48 % atipie, 87 % benign
  5. Gulshan et al., Development and Validation of a Deep Learning Algorithm for Detection of Diabetic Retinopathy, JAMA, 2016 — 128.175 imagini etichetate de 54 oftalmologi, 3–7 evaluări per imagine; AUC 0,991; două puncte de operare: 90,3 % / 98,1 % și 97,5 % / 93,4 %
  6. Campanella et al., Clinical-grade computational pathology using weakly supervised deep learning on whole slide images, Nature Medicine, 2019 — 44.732 lame digitale de la 15.187 pacienți; AUC 0,991 prostată; scădere de circa 6 puncte AUC pe lame externe și 3 puncte pe alt scaner
  7. Zhou et al., A foundation model for generalizable disease detection from retinal images (RETFound), Nature, 2023 — 1,6 milioane de imagini neetichetate; 8 GPU A100 timp de circa 14 zile; ajustare circa 70 min per 1.000 imagini pe un GPU T4; rezultate comparabile cu 10–50 % din etichete
  8. Cottier et al., The rising costs of training frontier AI models, Epoch AI / arXiv, 2024 — cost amortizat hardware și energie: GPT-4 circa 40 mil. USD, Gemini Ultra circa 30 mil. USD; creștere de 2,4 ori pe an din 2016
  9. Regulamentul (UE) 2024/1689 privind inteligența artificială (AI Act), EUR-Lex — articolul 10 (seturi de antrenare, validare, testare), articolul 72 (monitorizare post-comercializare), articolul 113 (în vigoare la 1 august 2024, aplicare generală de la 2 august 2026)
  10. Regulamentul (UE) 2026/1744 (Digital Omnibus on AI), EUR-Lex — adoptat la 8 iulie 2026; obligațiile pentru sistemele cu grad ridicat de risc din anexa III de la 2 decembrie 2027, iar pentru cele din anexa I (dispozitive medicale) de la 2 august 2028
  11. Regulamentul (UE) 2025/327 privind spațiul european al datelor privind sănătatea (EHDS), EUR-Lex — adoptat la 11 februarie 2025; articolul 53 alineatul (1) litera (e) punctul (ii): antrenarea, testarea și evaluarea algoritmilor; articolul 54: doar pe baza unui permis de date; capitolul IV de la 26 martie 2029
  12. Regulamentul (UE) 2016/679 (GDPR), EUR-Lex — articolul 4: definițiile operatorului (punctul 7), persoanei împuternicite (punctul 8), pseudonimizării (punctul 5) și datelor privind sănătatea (punctul 15)
rețele neuronaleAI medicalvalidare
Aveți o problemă asemănătoare în instituția dumneavoastră?

Spuneți-ne ce aveți nevoie. Revenim cu un prototip, nu cu slide-uri.

Scrieți-ne

Alte articole