Skip to content

AI-gestuurde gezondheidsvoorspelling

Algoritmes die beweren uw gezondheid te voorspellen, beoordeeld op wat daadwerkelijk bij mensen is aangetoond — prospectief.
Reviewed by CureMed LabsBijgewerkt op
Een arts die een algoritmische risicoscore op een scherm bekijkt naast het dossier van een patiënt
Een algoritme dat patiënten correct rangschikt op opgeslagen data heeft nog niet aangetoond dat het iets verandert voor de patiënt die voor u zit.
Simpel gezegd

Bedrijven verkopen steeds meer software die uw bloedwaarden, scans of horlogedata leest en u vertelt welke ziektes u waarschijnlijk zult krijgen. Een paar van deze tools doen daadwerkelijk één specifieke taak goed, maar bijna geen enkele heeft ooit aangetoond dat iemand er gezonder van wordt.

Het korte antwoord

AI-gezondheidsvoorspelling is echt op een handvol specifieke plekken — het beoordelen van mammogrammen, screening op diabetische retinopathie, poliepdetectie, het opsporen van een lage ejectiefractie via een ECG — en is vrijwel onderbouwd op geen enkele plek waar het aan consumenten wordt verkocht. De reden is één onderscheid dat marketing routinematig uitwist: een hoge AUROC op een opgeslagen dataset betekent dat het model patiënten correct rangschikt op data waar het geen invloed op had. Het is geen bewijs dat het gebruik van het model iets verandert voor wie dan ook. Ongeveer 1.500 AI-apparaten hebben FDA-marktautorisatie, en er zijn ongeveer 41 gerandomiseerde trials van machine-learninginterventies in de hele gezondheidszorg.

  • Nauwkeurigheid is geen voordeel: van 81 studies die deep learning met clinici vergeleken, waren er slechts 9 prospectief en slechts 6 uitgevoerd in een echte klinische setting (Nagendran 2020, PMID 32213531).
  • AI voor colonoscopie is de meest gerandomiseerde toepassing in de geneeskunde — 44 RCT's, adenoomdetectie ~20% relatief hoger, en geen enkele toename in gevorderde neoplasie (Soleymanjahi 2024, PMID 39531400).
  • Geen enkele verouderingsklok — epigenetisch, retinaal, hersenen, ECG of proteomisch — is een gevalideerd behandeldoel, een gevalideerd surrogaateindpunt, of een FDA-goedgekeurde diagnostiek; het eigen consensusorgaan van het vakgebied stelt dit zwart op wit (Moqri 2023, PMID 37657418).
  • Machine learning presteert vaak niet beter dan logistische regressie op tabulaire klinische data: over 145 rechtstreekse vergelijkingen met laag risico op bias was het verschil in logit(AUC) 0,00 (95%-BI −0,18 tot 0,18) (Christodoulou 2019, PMID 30763612).
  • Algoritmische bias is gemeten, niet hypothetisch: het corrigeren van één wijdverspreid ingezet zorgmanagement-algoritme zou het aandeel Zwarte patiënten dat extra hulp kreeg hebben verhoogd van 17,7% naar 46,5% (Obermeyer 2019, PMID 31649194).
Bijna elk longevity-product claimt tegenwoordig een AI-laag. Het leest uw bloedwaarden, uw genoom, uw scan, uw horloge, en geeft een voorspelling terug: een risicopercentage, een biologische leeftijd, een readiness-score, een lijst van dingen om u zorgen over te maken. De claim is verleidelijk omdat de onderliggende technologie oprecht goed is in patroonherkenning, en omdat de marketingzin — onze AI voorspelt uw ziekterisico — technisch waar is voor bijna elk model dat ooit is gefit.
Deze pagina beoordeelt die claims op dezelfde manier als we een geneesmiddel beoordelen: op basis van wat prospectief bij mensen is aangetoond, tegen een uitkomst waar iemand daadwerkelijk om geeft. Op die maatstaf splitst het veld scherp uiteen. Medische beeldvormings-AI heeft enkele van de beste bewijsstukken in de moderne geneeskunde opgeleverd, waaronder een gerandomiseerde trial met 105.934 vrouwen. Consumenten-longevity-AI heeft vrijwel niets opgeleverd, en valt bijna volledig buiten de apparatenregelgeving.
De ruggengraat van alles hieronder is één zin. Een hoge AUROC op een retrospectieve dataset is geen bewijs van klinisch voordeel — en dat is het enige bewijs dat de meeste AI-gezondheidsproducten hebben.

De vier niveaus van bewijs, en waarom bijna niets niveau 4 bereikt

AUROC — de oppervlakte onder de receiver-operating-curve — is de kans dat een model een willekeurig geval hoger rangschikt dan een willekeurige controle. Het is het getal in bijna elke AI-gezondheidskop, en het beantwoordt een smalle vraag: sorteert het model mensen correct op data die het al eerder heeft gezien? Het zegt niets over of het getal dat aan u wordt getoond klopt, of iemand ernaar handelt, of dat handelen ernaar meer goed dan kwaad doet.

Vier afzonderlijke bewijsniveaus schuilen achter de uitdrukking klinisch gevalideerd, en marketing presenteert routinematig het eerste alsof het het vierde was.

Waarop een AI-gezondheidsclaim daadwerkelijk kan rusten

NiveauWat het betekentHoe gangbaar in AI-gezondheid
1. Retrospectieve AUROCHet model scoort goed op een opgeslagen dataset waarop het geen invloed had. Zegt niets over of het gebruik ervan iets verandert.Vrijwel al het gepubliceerde AI-gezondheidsonderzoek, en effectief alle consumenten-longevity-AI
2. Prospectieve nauwkeurigheidHet model draait live op opeenvolgende echte patiënten; nauwkeurigheid wordt gemeten tegen een onafhankelijk verzamelde referentiestandaard. Nog steeds geen uitkomst.Ongebruikelijk
3. Gerandomiseerde procesuitkomstEen gerandomiseerde trial toont aan dat de AI verandert wat clinici doen of vinden — detectiegraad, diagnosegraad, werklast.Zeldzaam: in totaal enkele tientallen trials, de meeste in de endoscopie
4. Gerandomiseerde patiëntuitkomstEen gerandomiseerde trial toont aan dat de AI verandert of mensen langer leven, minder beroertes krijgen, of minder kanker krijgen.Vrijwel niet-bestaand in dit veld
Mammografie-AI heeft niveau 3 met echte grondigheid bereikt. Colonoscopie-AI bereikte niveau 3 en slaagde er vervolgens niet in dit om te zetten naar niveau 4. Verouderingsklokken, multi-omics-panels en consumenten-wellness-AI zitten op niveau 1, en vaak eronder.
1.524
AI-apparaten met FDA-marktautorisatie — 96,2% daarvan via 510(k)-substantiële-gelijkwaardigheid aan een bestaand product, geen nieuw uitkomstbewijs
FDA AI-Enabled Medical Device List, geraadpleegd 2026-08-31
41
gerandomiseerde trials van machine-learninginterventies in de hele gezondheidszorg, mediaan 294 deelnemers; geen enkele voldeed aan alle CONSORT-AI-normen
Plana 2022, JAMA Netw Open, PMID 36173632
9 van 81
studies die deep learning met clinici vergeleken en prospectief waren; slechts 6 werden getest in een echte klinische setting
Nagendran 2020, BMJ, PMID 32213531
15,5%
van de 168 machine-learning-apparaten die de FDA in 2024 goedkeurde, rapporteerde enige ras- of etniciteitsgegevens over de evaluatiepopulatie
Almarie 2025, Biomedicines, PMID 41463017
+0,9 / 1.000
extra opgespoorde kankergevallen door AI-ondersteunde mammografie over 597.419 screeningsonderzoeken (95%-BI −0,0 tot +1,8)
Ferre 2026, Clin Imaging, PMID 42617468
34%
van de onregelmatige-ritme-meldingen van smartwatches werd bevestigd als boezemfibrilleren bij opvolging met een ECG-pleister
Perez 2019, NEJM (Apple Heart Study), PMID 31722151

Waar AI echt werkt — en waar detectie geen voordeel oplevert

Beeldvorming is het sterkste gebied, en het is de moeite waard om precies te zijn over waarom. Mammografiescreening heeft een hoogwaardige bestaande vergelijker (twee radiologen die elke opname beoordelen), een hard downstream eindpunt (intervalkanker), en nationale programma's die bereid zijn te randomiseren. Die combinatie is zeldzaam, en heeft het beste AI-bewijs in de geneeskunde opgeleverd.

MASAI randomiseerde 105.934 Zweedse vrouwen naar AI-ondersteunde beoordeling of standaard dubbele beoordeling. Kankerdetectie steeg van 5,0 naar 6,4 per 1.000, een ratio van 1,29 (95%-BI 1,09–1,51), met 44% minder werklast bij het beoordelen van screenings. Toen het primaire eindpunt uiteindelijk werd gerapporteerd, was intervalkanker 1,55 versus 1,76 per 1.000 — een proportieratio van 0,88 (0,65–1,18). Dat is non-inferieur, niet superieur. Niemand heeft aangetoond dat AI-ondersteunde mammografie de sterfte aan borstkanker verlaagt, en gezien de vereiste trialgroottes zal dat waarschijnlijk ook niemand doen.

Onder de beeldvormingslaag verschijnt een consistent patroon: AI vindt betrouwbaar meer van iets, en meer vinden ervan heeft herhaaldelijk niet geholpen. Screening met smartwatch en pleister verdubbelt tot verdrievoudigt de detectie van boezemfibrilleren. Drie gerandomiseerde trials met harde eindpunten — LOOP, STROKESTOP en GUARD-AF — hebben geen vermindering van beroertes aangetoond. De LOOP-auteurs stellen het in hun eigen samenvatting: niet elk boezemfibrilleren is de moeite van screenen waard, en niet elk via screening ontdekt boezemfibrilleren verdient antistolling.

Het bewijsoverzicht

Gerangschikt op: het hoogste bewijsniveau dat daadwerkelijk bestaat voor elke aanpak. Deze niveaus zijn geschreven voor geneesmiddelen, dus lees ze voor software als volgt: goedgekeurd betekent dat een echte FDA-marktautorisatie (510(k), De Novo of PMA) bestaat voor de specifieke uitkomst die wordt verkocht; preklinisch betekent dat het werk echt is maar alleen bestaat als modellen gefit op opgeslagen menselijke datasets, zonder bewijs van klinische inzet; op-de-markt-onbewezen betekent dat het product aan het publiek wordt verkocht zonder regelgevende toetsing van de claim en zonder gecontroleerd bewijs van voordeel. Let op: goedkeuring en voordeel zijn verschillende assen: verschillende tools met tier goedgekeurd hier hebben gerandomiseerd bewijs dat ze detectie veranderen en geen enkel bewijs dat ze uitkomsten veranderen.

  1. Mammografie-AI (Transpara, Lunit INSIGHT MMG)

    Goedgekeurd

    Leest screeningsmammogrammen als triagemiddel en tweede beoordelaar naast radiologen.

    De best onderbouwde AI in de geneeskunde. Detectieratio 1,29 en 44% minder leeswerk in MASAI; intervalkanker non-inferieur, niet verminderd. Gepoold over MASAI, ScreenTrustCAD en PRAIM (597.419 onderzoeken) is het voordeel +0,9 kankergevallen per 1.000 screenings, met het betrouwbaarheidsinterval dat nul raakt. Echt en nuttig. Niet AI ontdekt kanker jaren eerder.

    FDA 510(k) goedgekeurd (K181704 → K241831; K211678). Gerandomiseerd (MASAI) en prospectief gepaard-lezer (ScreenTrustCAD) bewijs.NCT04838756; PMID 41620232
  2. Autonome screening op diabetische retinopathie (IDx-DR / LumineticsCore)

    Goedgekeurd

    Beoordeelt fundusfoto's op meer-dan-milde diabetische retinopathie zonder dat een clinicus het beeld beoordeelt.

    Sensitiviteit 87,2% (81,8–91,2), specificiteit 90,7% (88,3–92,7) bij 900 patiënten, in huisartsenpraktijken in plaats van oogklinieken, tegen onafhankelijke beoordeling door een leescentrum. Het schoonste voorbeeld in dit dossier van AI die goed is gedaan. Concurrenten goedgekeurd op dezelfde productcode: EyeArt (K200667) en AEYE-DS (K221183).

    FDA De Novo DEN180001, 11 april 2018 — de eerste autonome AI-diagnostiek ooit goedgekeurd op enig gebied. Prospectieve pivotale trial in de eerstelijnszorg.NCT02963441; PMID 31304320
  3. Computerondersteunde detectie bij colonoscopie (CADe)

    Goedgekeurd

    Markeert poliepen in het live gezichtsveld van de endoscopist.

    Adenoomdetectieratio 1,21 (1,15–1,28) — robuust en consistent. Maar gevorderde neoplasie per colonoscopie liet geen enkel verschil zien (incidentieverschil 0,01, −0,01 tot 0,02), de toename werd grotendeels gedreven door zeer kleine laesies, en er waren ongeveer twee extra niet-neoplastische poliepectomieën per tien procedures. De meest gerandomiseerde AI-toepassing in de geneeskunde, en niveau 3 werd geen niveau 4.

    FDA-goedgekeurd en CE-gemarkeerd. 44 gerandomiseerde trials, 36.201 patiënten.PMID 39531400; PMID 37639719
  4. AI-ECG lage ejectiefractie (Anumana, Eko, Tempus)

    Goedgekeurd

    Markeert een waarschijnlijke linkerventrikel-ejectiefractie van 50% of lager op basis van een standaard 12-afleidingen-ECG.

    Werkelijk nauwkeurig — AUC 0,93 voor EF ≤35% in het ontwikkelingswerk — en werkelijk gerandomiseerd. Let op wat het voorspelt: uw ejectiefractie nu, niet uw toekomstige risico. En let op het absolute effect in EAGLE: nieuwe diagnoses van lage EF stegen van 1,6% naar 2,1%.

    FDA 510(k) goedgekeurd als meldingssoftware (K232699, K233409, K250119, K250652). Cluster-gerandomiseerde trial (EAGLE, 22.641 patiënten).NCT04000087; PMID 30617318
  5. Score voor maligniteit van longnodules (Optellum Virtual Nodule Clinic)

    Goedgekeurd

    Beoordeelt het maligniteitsrisico van een longnodule die een mens al op een CT heeft gevonden.

    Een risicostratificatiemiddel zonder trial die aantoont dat het het stadium bij diagnose of de sterfte verandert. Het is de moeite waard te weten hoe het onderliggende onderzoek zich gedraagt: in het toonaangevende Google NLST-model overtrof de prestatie alle zes radiologen wanneer geen eerdere CT beschikbaar was, en was slechts gelijk aan hen wanneer een eerdere scan bestond — wat de klinisch realistische situatie is.

    FDA 510(k) goedgekeurd (K202300, 2021). Alleen retrospectieve validatie; geen RCT.K202300; PMID 31110349
  6. Smartwatch-melding van onregelmatig ritme

    Goedgekeurd

    Detecteert een polspatroon dat wijst op boezemfibrilleren en stuurt een melding.

    Detectie werkt; voordeel volgt niet. Slechts 34% (Apple) en 32,2% (Fitbit) van de meldingen werd bevestigd als AF op een opvolgende pleister. Een 10-seconden horloge-ECG na een melding heeft een diagnostische opbrengst van 7,6%, tegenover 60,8% voor een vierweekse pleister. En over LOOP, STROKESTOP en GUARD-AF is niet aangetoond dat meer AF vinden beroertes voorkomt. De USPSTF beoordeelt het bewijs voor AF-screening bij volwassenen van 50 jaar en ouder nog steeds als onvoldoende — een Graad I-uitspraak.

    FDA De Novo DEN180042 (Apple). Pragmatische studies bij 419.297 (Apple Heart) en 455.699 (Fitbit Heart) deelnemers.NCT03335800; NCT04380415; PMID 35076659
  7. Consumentenmeldingen voor hypertensie en slaapapneu

    Goedgekeurd

    Markeert meerweekse wearable-patronen die wijzen op hypertensie of matig-tot-ernstige slaapapneu.

    De goedkeuringssamenvattingen zijn eerlijker dan de marketing. Voor hypertensie rapporteert de FDA-samenvatting een sensitiviteit van 41,2% (37,2–45,3) en specificiteit van 92,3% bij 1.863 geanalyseerde deelnemers — het mist ongeveer 59% van de hypertensie en 46% van stadium 2-hypertensie, en de eigen indicatie verbiedt het gebruik voor bewaking of om het behandeleffect te volgen. Voor slaapapneu: sensitiviteit 66,3%. Beide zijn legitiem als een duwtje richting een echte test. Geen van beide is een meting.

    FDA 510(k) goedgekeurd (Apple hypertensie K250507, sep 2025; Apple slaapapneu K240929, predicaat Samsung DEN230041). Alleen validatie door de sponsor.K250507; K240929
  8. Sepsisvoorspelling binnen het elektronisch patiëntendossier (Epic Sepsis Model)

    Verkocht · onbewezen

    Scoort doorlopend opgenomen patiënten op waarschijnlijk begin van sepsis.

    AUC 0,63 over 38.455 ziekenhuisopnames, waarbij 67% van de sepsispatiënten werd gemist terwijl bij 18% van alle opnames een alarm afging. Het identificeerde slechts 7% van de septische patiënten bovenop wat tijdige klinische praktijk al opving. De auteurs noemen wijdverbreide adoptie ondanks deze prestatie een fundamentele zorg. Het regelgevende gat dat inzet zonder onderzoek toestond, is precies het punt.

    Niet FDA-gereguleerd — werd uitgeleverd als EPD-functionaliteit aan honderden Amerikaanse ziekenhuizen. Externe validatie bestaat, en het faalde.PMID 34152373
  9. Consumenten-epigenetische tests voor biologische leeftijd

    Verkocht · onbewezen

    Geven één biologisch-leeftijdsgetal terug op basis van DNA-methylatie in bloed, speeksel of een wangswab.

    De onderliggende klokken zijn echte, herhaalde associaties met sterfte. Het consumentenproduct is een precisieclaim die de test niet kan onderbouwen: technische ruis levert afwijkingen op tot 9 jaar tussen herhaalde metingen van hetzelfde monster voor zes prominente klokken, en verschillen tussen orale en bloedweefsels lopen op tot bijna 30 jaar bij dezelfde persoon voor sommige klokken. De meeste directe-aan-consument-tests gebruiken speeksel of wangswabs.

    Alleen laboratoriumontwikkelde tests onder CLIA. De LDT-regel van de FDA werd op 31 maart 2025 vernietigd en op 19 september 2025 formeel ingetrokken, dus geen enkele regelgever toetst de klinische validiteit van de leeftijdsclaim.PMID 36277076; PMID 39780748
  10. Retinale, hersen-, ECG- en proteomische leeftijdsverschillen

    Alleen preklinisch

    Schatten de leeftijd van een orgaan of het hele lichaam op basis van een retinale foto, MRI, ECG of plasmaproteoom, en rapporteren het verschil met uw geboortedatum.

    Statistisch reëel op populatieniveau en veel zwakker dan ze individueel klinken. Retinaal leeftijdsverschil: HR voor totale sterfte 1,02 per jaar, betrouwbaarheidsinterval dat 1,00 raakt, met geen significante associatie met cardiovasculaire of kankersterfte. Hersenleeftijd: sterfte-HR 1,061 per jaar — maar bij opname naast eenvoudige grijze-stof- en liquorvolumes was het niet langer significant (p=0,12), dus de deep-learningstap voegde niets toe boven een volumemeting.

    Onderzoeksinstrumenten. Geen FDA-goedkeuring voor enige van deze uitkomsten; zoekopdrachten op apparaatnaam in de 510(k)-database van de FDA leveren geen goedgekeurd apparaat op dat een biologische of fysiologische leeftijd oplevert.PMID 35042683; PMID 28439103
  11. Wellness-scores: readiness, herstel, belasting, slaapscore, HRV, wearable-leeftijd

    Verkocht · onbewezen

    Samengestelde dagelijkse scores voornamelijk afgeleid van hartslag, HRV en geschatte slaapfases.

    Consumentenwearables wijzen 50–65% van de tijd de juiste slaapfase toe (Cohens kappa 0,20–0,52), en zijn bevooroordeeld richting alles slaap noemen: de specificiteit van waakdetectie ligt op 0,18–0,54. Elke geregistreerde diepe-slaapminuut en elke uit REM afgeleide herstelscore is daarop gebouwd. De waarschuwingsbrief van de FDA aan Whoop stelde ook op de zaak vast dat een niet-voor-medisch-gebruik-disclaimer een product dat is ontworpen om een klinische schatting te produceren niet redt.

    Ongereguleerde algemene wellness. Geen FDA-goedkeuring gevonden voor Oura, Garmin of Ultrahuman in de FDA-database; Whoops enige goedkeuring is een ECG-functie (K243236).PMID 36016077; PMID 33378539
  12. Algemene LLM-gezondheidschatbots

    Verkocht · onbewezen

    Beantwoorden gezondheidsvragen, triëren symptomen en suggereren wat u vervolgens moet doen, in natuurlijke taal.

    De modellen zijn niet de zwakke schakel — de overdracht is dat. In een vooraf geregistreerde gerandomiseerde studie identificeerden de modellen alleen de aandoening in 94,9% van de gevallen; 1.298 leden van het publiek die diezelfde modellen gebruikten, identificeerden aandoeningen in minder dan 34,5% — niet beter dan de controlegroep. Bij 2.400 echte patiëntcasussen in plaats van vignetten presteerden geavanceerde modellen significant slechter dan artsen en waren ze gevoelig voor de volgorde waarin informatie werd gegeven.

    Geen enkele algemene LLM-chatbot is FDA-goedgekeurd of geautoriseerd als medisch hulpmiddel, en de eigen apparatenlijst van de FDA identificeert nog niet welke goedgekeurde apparaten LLM-functionaliteit bevatten.PMID 41663592; PMID 38965432
  13. Multi-omics-panels en whole-body-MRI-screeningsdiensten

    Verkocht · onbewezen

    Bundelen honderden biomarkers, genomica en een whole-body-scan tot een gepersonaliseerde gezondheidsvoorspelling.

    Gepoold over 12 studies en 5.373 asymptomatische proefpersonen leverde whole-body-MRI kritieke of onbepaalde incidentele bevindingen op bij 32,1%, waarvan slechts 12,6% ooit werd geverifieerd. De eigen database van één leverancier met 21.651 asymptomatische scans vond incidentele pancreascysten bij 7,0% van iedereen die werd gescand, waarvan ongeveer 99% onder de grootte lag die interventie zou triggeren — maar allemaal komen ze onder toezicht. Het American College of Radiology stelt dat er onvoldoende bewijs is om screening van het hele lichaam aan te bevelen bij mensen zonder symptomen, risicofactoren of familiegeschiedenis.

    Alleen CLIA-laboratoriumontwikkelde tests plus beleidsmatige terughoudendheid voor algemene wellness. Scanner- en beeldverbeteringscomponenten kunnen goedgekeurd zijn; de screeningsdienst zelf niet.PMID 30932247; PMID 41801199

Goedgekeurd medisch hulpmiddel versus consumenten-wellnessapp: het zijn niet dezelfde objecten

De meest bruikbare vaardigheid op dit gebied is het uit elkaar houden van vier regelgevende objecten die identiek klinken in marketingteksten: een door de FDA geautoriseerd medisch hulpmiddel, een laboratoriumontwikkelde test die onder CLIA draait, een algemeen wellness-product dat onder beleidsmatige terughoudendheid opereert, en software zonder enige regelgevende relatie.

Zelfs binnen de goedgekeurde categorie ligt de bewijslat laag. Van ~1.524 autorisaties ging 96,2% via 510(k), wat vraagt of een apparaat substantieel gelijkwaardig is aan een voorganger die al op de markt is — niet of het uitkomsten verbetert. In de cohort van 2024 rapporteerde slechts 29,2% zowel sensitiviteit als specificiteit, slechts 15,5% ras- of etniciteitsgegevens, en slechts 16,7% werd geleverd met een Predetermined Change Control Plan, wat betekent dat de meeste goedgekeurde modellen bevroren zijn op het moment van goedkeuring en niet kunnen worden bijgewerkt naarmate populaties veranderen.

Wat is goedgekeurd, wat is bewezen, en wat elke tool daadwerkelijk voorspelt

Tool of claimRegelgevende statusProspectief bewijs?Wat het daadwerkelijk voorspelt
Mammografie-AI (Transpara, Lunit)FDA 510(k) goedgekeurd; CE-gemarkeerdJa — gerandomiseerd (MASAI, NCT04838756, n=105.934) en prospectief gepaard-lezer (ScreenTrustCAD, NCT04778670, n=55.581)Aanwezigheid van via screening detecteerbare borstkanker op dit mammogram
IDx-DR / LumineticsCoreFDA De Novo DEN180001 (apr 2018)Ja — prospectieve pivotale trial in de eerstelijnszorg, NCT02963441, n=900Meer-dan-milde diabetische retinopathie of maculair oedeem op basis van fundusfoto's
Colonoscopie-CADeFDA-goedgekeurd; CE-gemarkeerdJa — 44 gerandomiseerde trials, 36.201 patiëntenAanwezigheid van een poliep in het huidige gezichtsveld. Geen toename in gevorderde neoplasie
AI-ECG lage ejectiefractieFDA 510(k) goedgekeurd (K232699, K250652)Ja — cluster-RCT (EAGLE, NCT04000087, n=22.641)Huidige LV-ejectiefractie ≤50% — niet toekomstig risico
Optellum Virtual Nodule ClinicFDA 510(k) goedgekeurd (K202300)Nee — alleen retrospectieve validatieMaligniteitsrisico van een reeds gedetecteerde longnodule
Smartwatch-melding van onregelmatig ritmeFDA De Novo DEN180042Ja — pragmatische studies, n=419.297 en n=455.699Waarschijnlijk boezemfibrilleren nu. 34% / 32% van de meldingen bevestigt AF
AF-screening als beroertepreventieGeen apparaatclaimJa — drie RCT's met harde eindpunten (LOOP, STROKESTOP, GUARD-AF)Geen aangetoonde vermindering van beroertes. LOOP HR 0,80 (0,61–1,05); GUARD-AF HR 1,10 (0,69–1,75)
Apple Hypertension NotificationFDA 510(k) K250507 (sep 2025)Alleen validatie door sponsor, n=1.863Patronen die wijzen op hypertensie. Sensitiviteit 41,2%
Epic Sepsis ModelNiet FDA-gereguleerd — ingezet als EPD-functionaliteitAlleen externe validatie — en die faaldeNominaal het begin van sepsis; presteerde in werkelijkheid met AUC 0,63, waarbij 67% van de gevallen werd gemist
Epigenetische klokken (Horvath, PhenoAge, GrimAge, DunedinPACE)Geen FDA-goedkeuring voor enige klinische claim; verkocht als LDT's of wellnessNee — alleen associatiestudiesChronologische leeftijd, of sterfterisico, afhankelijk van het trainingsdoel. Geen aanpasbaar doel
Retinale, hersen- en proteomische leeftijdsverschillenOnderzoeksinstrumenten; geen goedkeuringNee — cohortassociaties, grotendeels binnen enkele datasetsSterfte- en morbiditeitsrisico op populatieniveau
Consumenten-tests voor biologische leeftijdAlleen CLIA-LDT's; de LDT-regel van de FDA werd op 31 mrt 2025 vernietigd, dus geen FDA-toetsing van de leeftijdsclaimGeenNiets gevalideerd. Hetzelfde monster twee keer gemeten kan jaren verschillen
HRV, readiness, herstel, belasting, slaapscores, wearable-leeftijdOngereguleerde algemene wellnessGeenNiets gevalideerd. Slaapfase klopt 50–65% van de tijd
OTC continue glucosemeters bij niet-diabeticiAlleen goedgekeurd voor glucosemeting (Stelo K234070, Lingo K233655, Libre Rio K233861)Geen uitkomst-RCT bij mensen zonder diabetesInterstitiële glucose, ongeveer 0,9 mmol/L hoger dan capillaire meting
Algemene LLM-chatbotsGeen FDA-goedgekeurd apparaat is geïdentificeerd als LLM-aangedrevenBenchmarks plus drie RCT's — waarin de mens-plus-model-arm het model alleen niet versloegBenchmarkantwoorden, geen klinische uitkomsten
Digitale tweeling (Unlearn.AI / PROCOVA)EMA-kwalificatie-opinie — voor efficiëntie van klinische trials; door EMA omschreven als een speciaal geval van ANCOVANiet van toepassing — het is een statistische methodeVermindering van trialsteekproefgrootte. Geen gepersonaliseerde behandeling
Whole-body-MRI-screeningsdienstenScanner- en beeldverbeteringscomponenten goedgekeurd; de screeningsdienst nietAlleen observationeel met één arm (NCT06212479, afronding 2037)Incidentele bevindingen. 32,1% gepoolde incidentaloompercentage; ACR zegt dat het bewijs onvoldoende is
Lees eerst de derde kolom. Alles wat in deze tabel aan consumenten wordt verkocht, zit in de rij Geen, en verschillende goedgekeurde tools met sterk gerandomiseerd bewijs voorspellen alleen nog wat er nu gebeurt, niet wat er met u zal gebeuren.

Het regelgevende vocabulaire, ontcijferd

De uitdrukkingWaar het daadwerkelijk aan vasthangt
FDA-goedgekeurde AI (whole-body-MRI-diensten)Een beeldverbeteringsalgoritme, niet de verkochte screeningsdienst
FDA-goedgekeurd (Whoop)Eén enkele ECG-functie, K243236. Recovery, Strain, Whoop Age en Healthspan zijn ongereguleerd
EMA-gekwalificeerde digitale tweelingEen speciaal geval van ANCOVA voor het verkleinen van de steekproefgrootte van klinische trials. De FDA wees het af omdat het al onder bestaande covariaat-aanpassingsrichtlijnen valt
CLIA-gecertificeerd (elke biologische-leeftijd- en multi-omics-test)Het laboratorium meet de analyt reproduceerbaar. Het zegt niets over klinische validiteit — en sinds 31 mrt 2025 toetst geen enkele Amerikaanse regelgever die claim
FDA-geregistreerd / FDA-vermeldRegistratie van de faciliteit. Betekenisloos voor de gedane claim
Klinisch gevalideerdMeestal een retrospectieve correlatiestudie, vaak geschreven door het bedrijf dat het product verkoopt
Onze AI analyseert 100+ biomarkersAnalyseren is geen voorspellen, en voorspellen is geen validatie
Niet bedoeld om enige ziekte te diagnosticeren, behandelen, genezen of voorkomen — naast ziektedetectiemarketingEen juridische positie. De FDA oordeelde formeel in juli 2025 dat zulke disclaimers een product dat is ontworpen om een klinische schatting te produceren niet redden
Beoordeel de claim elke keer tegen het daadwerkelijke regelgevende object.

Wat er veranderde in 2025–2026

  1. jan 2025

    PRAIM gepubliceerd — de grootste real-world AI-screeningsimplementatie

    463.094 vrouwen op 12 Duitse screeningslocaties. Kankerdetectie 6,7 vs 5,7 per 1.000, +17,6% (95%-BI +5,7% tot +30,8%), met lagere en non-inferieure terugroepgraad. Observationeel, maar de richting komt overeen met MASAI.

    Eisemann 2025, Nat Med, PMID 39775040

  2. 31 mrt 2025

    De regel van de FDA voor laboratoriumontwikkelde tests wordt vernietigd

    Een federale districtsrechtbank oordeelde in ACLA v. FDA dat LDT's professionele diensten zijn, geen apparaten. Dit is het meest ingrijpende feit voor consumenten-longevity-testen: biologische-leeftijdstests en multi-omics-panels vallen voortaan alleen onder CLIA, zonder FDA-toetsing van klinische validiteit, voor onbepaalde tijd.

    Definitieve FDA-regel ter implementatie van de vernietiging, 90 FR 45134, 19 sep 2025

  3. apr 2025

    Whoop ontvangt zijn allereerste FDA-goedkeuring — voor een ECG-functie

    K243236 dekt de detectie van AFib, normaal sinusritme en hoge of lage hartslag, alleen voor informatief gebruik. Recovery, Strain, Sleep Coach, Whoop Age en Healthspan zijn nergens voor goedgekeurd.

    FDA 510(k) K243236

  4. 14 jul 2025

    FDA-waarschuwingsbrief aan Whoop over Blood Pressure Insights

    De FDA verklaarde dat het de functie voor geen enkel gebruik heeft geautoriseerd, wees de algemene-wellness-uitzondering af, en wees de disclaimers expliciet af — met de opmerking dat hun ondoeltreffendheid wordt aangetoond doordat mensen de functie gebruiken om hun hypertensie te bewaken. De afsluitbrief van 17 juni 2026 is beleidsmatige terughoudendheid tegen een omgelabeld product, geen goedkeuring.

    FDA Waarschuwingsbrief, MARCS-CMS 709755

  5. aug 2025

    Eerste gekwantificeerde deskilling-signaal

    Over vier Poolse endoscopiecentra en 1.443 colonoscopieën daalde de niet-ondersteunde adenoomdetectiegraad van endoscopisten van 28,4% naar 22,4% na blootstelling aan AI (−6,0 procentpunt, 95%-BI −10,5 tot −1,6, p=0,0089). Observationeel en in afwachting van replicatie, maar het is een systemisch risico dat geen enkele nauwkeurigheidsmetriek vastlegt.

    Budzyń 2025, Lancet Gastroenterol Hepatol, PMID 40816301

  6. sep 2025

    Apple Hypertension Notification goedgekeurd met 41,2% sensitiviteit

    De grootste consumenten-cardiovasculaire-AI-uitbreiding tot nu toe, en de bescheidenste prestatie ooit goedgekeurd. De eigen indicatie verbiedt het gebruik ervan om diagnose te vervangen, behandeleffect te bewaken, of bloeddruk te bewaken.

    FDA 510(k) K250507

  7. jan 2026

    MASAI rapporteert zijn primaire eindpunt

    Intervalkanker 1,55 vs 1,76 per 1.000; proportieratio 0,88 (0,65–1,18), p=0,41 — non-inferieur, niet superieur. Sensitiviteit 80,5% vs 73,8% (p=0,031), specificiteit 98,5% in beide armen. Het definitieve AI-screeningsresultaat, en het sluit de belangrijkste angst uit in plaats van een sterftevoordeel te bewijzen.

    Gommers 2026, Lancet, PMID 41620232

  8. feb 2026

    Het definitieve consumenten-AI-resultaat

    1.298 Britse leken-deelnemers gerandomiseerd naar het gebruik van geavanceerde LLM's of een bron van hun keuze. De modellen alleen identificeerden de aandoening in 94,9% van de gevallen; diezelfde modellen in handen van het publiek, minder dan 34,5% — niet beter dan de controlegroep. De auteurs stellen dat standaardbenchmarks de gevonden fouten met menselijke deelnemers niet voorspellen.

    Bean 2026, Nat Med, PMID 41663592

  9. mrt 2026

    De screeningscascade, gekwantificeerd op basis van de eigen data van een leverancier

    Onder 21.651 asymptomatische mensen gescand met whole-body-MRI had 7,0% een incidentele pancreascysteuze laesie, oplopend tot 20,8% bij leeftijd 80+. 96,0% was kleiner dan 2 cm en slechts 1,1% was 3 cm of groter — één orgaan, één type bevinding, en ongeveer 99% onder de interventiedrempel.

    Wong 2026, JAMA Netw Open, PMID 41801199

  10. aug 2026

    De eerlijke effectgrootte voor AI-mammografie

    Poolen van MASAI, ScreenTrustCAD en PRAIM over 597.419 onderzoeken geeft een risicoverschil in kankerdetectie van +0,9 per 1.000 (95%-BI −0,0 tot +1,8) en geen consistente toename in terugroeping.

    Ferre 2026, Clin Imaging, PMID 42617468

Verouderingsklokken: echte associaties, en geen enkel gevalideerd doel

Verouderingsklokken — epigenetisch, retinaal, hersenen, ECG, proteomisch — zijn het AI-voorspellingsproduct dat de longevity-industrie het hardst verkoopt. Ze zijn echte, herhaalde statistische associaties met sterfte. Geen enkele ervan is een gevalideerd surrogaateindpunt, een gevalideerd behandeldoel, of een FDA-goedgekeurde diagnostiek. Dat is niet ons redactionele standpunt; het is het uitgesproken standpunt van het eigen consensusorgaan van het vakgebied.

Het belangrijkste aan elke klok is waartegen hij is getraind, omdat dit bepaalt wat hij mogelijk kan voorspellen. Eerste-generatie klokken (Horvath, Hannum) werden getraind op chronologische leeftijd — een perfecte Horvath-klok zou nul sterftesignaal dragen, omdat alle biologische-leeftijdsinformatie in de foutterm zit. GrimAge werd direct getraind op tijd tot overlijden, met methylatiesurrogaten voor plasma-eiwitten en aantal jaren gerookte pakjes; dat is legitieme sterftevoorspelling, en het is deels een rokendetector in plaats van een meting van moleculaire veroudering. DunedinPACE werd getraind op de veranderingssnelheid over 19 orgaansysteemindicatoren over 20 jaar en draagt de sterkste sterfte-hazardratio's (1,65, 1,51–1,79 in Framingham Offspring).

De klokken zijn het ook onderling oneens. Veel bestaande epigenetische klokken correleren slechts zwak met elkaar, wat impliceert dat ze verschillende processen vastleggen — twee klokken op hetzelfde bloedmonster kunnen verschillende verhalen vertellen. En het enige gerandomiseerde bewijs is dun en verdeeld: in CALERIE vertraagde twee jaar 25% calorierestrictie DunedinPACE, maar veranderde PhenoAge of GrimAge niet significant. Drie klokken, dezelfde gerandomiseerde monsters, drie verschillende antwoorden.

Wat een consumentenrapport niet kan onderbouwen

  • Precisie: technische ruis levert afwijkingen op tot 9 jaar tussen herhaalde metingen voor zes prominente epigenetische klokken — PhenoAge mediane afwijking 2,4 jaar, maximum 8,6 jaar. Een verbetering van 3 jaar na een interventie past ruim binnen die ruis.
  • Weefsel: vergelijking tussen weefsels over 284 monsters vond gemiddelde verschillen van bijna 30 jaar tussen oraal en bloedweefsel bij dezelfde persoon voor sommige klokken; alleen de Skin & Blood-klok kwam overeen. De meeste directe-aan-consument-tests gebruiken speeksel of een wangswab.
  • Onafhankelijkheid: elke gepubliceerde retinale-leeftijdsverschil-uitkomst komt uit dezelfde UK Biobank-dataset en hetzelfde model getraind op dezelfde 11.052 mensen. In de rechtstreekse vergelijkingen die de auteurs uitvoerden, deed retinale leeftijd het niet beter dan routinerisicofactoren voor beroerte of Parkinson.
  • Toegevoegde waarde: hersenleeftijdsverschil voorspelde sterfte met HR 1,061 per jaar — maar hield op significant te zijn (p=0,12) zodra eenvoudige grijze-stof- en liquorvolumes in het model zaten, wat significant bleef. De deep-learningstap voegde niets toe boven een volumemeting.
  • Methodestabiliteit: hersenleeftijdsmodellen overschatten systematisch bij jongeren en onderschatten bij ouderen, dus lekt in het ruwe verschil chronologische leeftijd door. Verschillende correctiemethoden geven verschillende antwoorden, en een effectgrootte is niet te interpreteren tenzij het artikel vermeldt welke correctie is gebruikt.
  • Ontwikkelingskwaliteit: een systematische beoordeling van 81 verouderingsklokken over 59 studies vond dat 31 (38,3%) waren ontwikkeld zonder interne of externe validatie, de meerderheid werd beoordeeld als hoog risico op bias — zelfs die in hoog-impact tijdschriften — en slechts 3 klokken (3,7%) werden beoordeeld als laag risico.

Er is ook geen Amerikaanse regelgever die dit alles controleert. Elke consumenten-epigenetische-leeftijdstest is een laboratoriumontwikkelde test. De LDT-regel van de FDA werd op 31 maart 2025 vernietigd en op 19 september 2025 formeel ingetrokken, dus deze tests vallen alleen onder CLIA. CLIA certificeert de analytische prestatie van het laboratorium — nauwkeurigheid, precisie, kwaliteitscontrole, competentie van het personeel. Het beoordeelt niet of de claim die de test doet klinisch waar is. Een biologisch-leeftijdsresultaat kan analytisch reproduceerbaar zijn en toch klinisch betekenisloos, en volgens de betrouwbaarheidsdata hierboven is zelfs de analytische helft niet vanzelfsprekend.

Verslaat machine learning klassieke statistiek daadwerkelijk?

Dit is de vraag achter elke vergelijking van AI-ziekterisicovoorspelling versus traditionele methoden, en het eerlijke antwoord is ongemakkelijk voor beide kampen: de literatuur is gemengd, en het schijnbare ML-voordeel krimpt naarmate de vergelijking zorgvuldiger wordt uitgevoerd.

Het toonaangevende methodologische resultaat beoordeelde 71 studies met 282 rechtstreekse vergelijkingen van logistische regressie tegenover machine learning voor binaire klinische uitkomsten. Over de 145 vergelijkingen met laag risico op bias was het verschil in logit(AUC) tussen de twee 0,00 (95%-BI −0,18 tot 0,18) — precies nul. Over de 137 vergelijkingen met hoog risico op bias leek ML 0,34 (0,20–0,47) beter. Het ML-voordeel in de gepubliceerde literatuur is, bij benadering, de bias. Dezelfde review vond dat 79% van de studies kalibratie helemaal niet behandelde.

Dit blijft zich herhalen. Een beoordeling uit 2026 van 52 studies die IVIG-resistentie bij de ziekte van Kawasaki voorspelden, vond dat ML en logistische regressie niet te onderscheiden waren bij externe validatie (gepoolde AUC 0,76 vs 0,75), terwijl ML duidelijk beter leek bij interne validatie (0,86 vs 0,76) — de klassieke overfitting-signatuur. Er is een tegenstroom: een meta-analyse uit 2025 van EPD-gebaseerde cardiovasculaire modellen rapporteerde gepoolde AUC's van 0,865 voor random forests en 0,847 voor deep learning tegenover 0,765 voor conventionele scores — maar met I² boven 99% en aanwijzingen voor publicatiebias, en de eigen conclusie van de auteurs is dat methodologische bezwaren de huidige klinische toepasbaarheid beperken. Zo'n hoge heterogeniteit betekent dat de gepoolde schatting niet echt één ding schat.

Waarover AUROC zwijgt

  • Kalibratie — of een voorspeld risico van 10% overeenkomt met een echt risico van 10%. Ongeveer vier op de vijf gepubliceerde ML-voorspellingsartikelen rapporteert dit niet, en het is de enige eigenschap die telt voor een persoonlijk risicogetal.
  • Prevalentie — een model met AUROC 0,95 in een verrijkte dataset met 20% prevalentie kan nutteloos zijn bij 0,5% populatieprevalentie, omdat de positief voorspellende waarde instort.
  • Netto voordeel bij de beslisdrempel die u daadwerkelijk zou gebruiken — of handelen naar de score meer goed dan kwaad doet.
  • Of iemand er daadwerkelijk naar handelt. In EAGLE was het model nauwkeurig, was de trial positief, en was de absolute toename in nieuwe lage-EF-diagnoses 1,6% naar 2,1%.
  • Wat het alternatief was. Het Epic Sepsis Model miste 67% van de gevallen die clinici al behandelden.
  • Wat er gebeurt zodra er een mens aan gekoppeld wordt. LLM's die aandoeningen alleen in 94,9% van de gevallen identificeerden, zakten onder de 34,5% in handen van echte leden van het publiek.

Niets van dit alles is een pleidooi om modellen af te schaffen. QRISK3, SCORE2 en Framingham zijn transparant, volledig gepubliceerd, vele malen extern gevalideerd, en zijn waarop op richtlijnen gebaseerde preventie daadwerkelijk draait. Het is wel een pleidooi tegen de aanname dat een nieuwer, complexer model dat u wordt getoond door een bedrijf dat een abonnement verkoopt, beter is dan het gratis model dat uw arts al gebruikt. TRIPOD+AI levert nu een rapportagestandaard met 27 items; een modelstudie die dit niet volgt, moet als voorlopig worden behandeld.

Algoritmische bias en LLM-faalmodi

Bias in gezondheids-AI is geen hypothetische zorg van een ethiekcommissie. Het is gemeten, op schaal, in systemen die al waren ingezet.

De toonaangevende zaak onderzocht een commercieel risicovoorspellingsalgoritme dat werd gebruikt om extra zorgmanagement toe te wijzen aan miljoenen patiënten. Bij elke gegeven risicoscore waren Zwarte patiënten aanzienlijk zieker dan Witte patiënten. Het corrigeren van de bias zou het aandeel Zwarte patiënten dat extra hulp kreeg hebben verhoogd van 17,7% naar 46,5%. Het mechanisme telt meer dan het getal: het algoritme voorspelde toekomstige zorgkosten als proxy voor zorgbehoefte, en omdat er historisch minder geld wordt besteed aan Zwarte patiënten bij hetzelfde ziekteniveau, is kosten een bevooroordeelde proxy voor ziekte. Het model was nauwkeurig in zijn gestelde taak en discriminerend in zijn daadwerkelijke gebruik — en geen enkele AUROC zou dit hebben opgevangen.

In de beeldvorming presteerden geavanceerde borst-röntgenclassificatoren, getest over drie grote datasets, consistent en selectief ondergediagnosticeerd bij achtergestelde populaties — vrouwelijke patiënten, Zwarte patiënten, patiënten met een lage sociaaleconomische status — met de hoogste percentages in intersectionele subgroepen. Onderdiagnose is de slechtst mogelijke faalmodus: het bestempelt een zieke persoon als gezond en vertraagt hun zorg. En u kunt dit meestal niet controleren bij een goedgekeurd apparaat, omdat slechts 15,5% van de machine-learning-apparaten die de FDA in 2024 goedkeurde überhaupt ras- of etniciteitsgegevens over hun evaluatiepopulatie rapporteerde.

Gedocumenteerde LLM-faalmodi in gezondheidscontexten

  • Benchmarks vertalen zich niet naar gebruikers. Modellen identificeerden alleen aandoeningen in 94,9% van de gevallen; 1.298 leken die diezelfde modellen gebruikten, kwamen onder de 34,5% uit — niet beter dan de controlegroep, in een vooraf geregistreerd gerandomiseerd ontwerp.
  • Prestatie stort in bij echte klinische data. Over 2.400 echte patiëntcasussen in vier buikpathologieën presteerden geavanceerde modellen significant slechter dan artsen, volgden ze noch diagnostische noch behandelrichtlijnen, konden ze laboratoriumresultaten niet interpreteren, en waren ze gevoelig voor zowel de hoeveelheid als de volgorde van informatie. De auteurs concluderen dat LLM's niet klaar zijn voor autonome klinische besluitvorming.
  • Slaafsheid — het model is het eens met uw onjuiste premisse. Bij 50 paren merk-generiek geneesmiddel met prompts die een onjuiste gelijkwaardigheid stelden, was de basiscompliantie met het onlogische verzoek 100% voor drie GPT-varianten en 94% voor Llama3-8B. De modellen hadden de kennis om de premisse af te wijzen en werkten er toch aan mee. Stel een suggestieve vraag over uw eigen gezondheid, en krijg uw premisse bevestigd.
  • Verzonnen citaties. Over 636 referenties in 84 gegenereerde literatuuroverzichten was 55% van de GPT-3.5-citaties en 18% van de GPT-4-citaties volledig verzonnen; onder de echte bevatte respectievelijk 43% en 24% inhoudelijke fouten. Een referentie die op een echte studie lijkt, is er niet noodzakelijk een.
  • Kwetsbaarheid voor hoe u schrijft. Typfouten, extra witruimte, ontbrekende genderaanduidingen en informele of dramatische taal vergrootten de kans dat een model de patiënt vertelde zelf te managen in plaats van zorg te zoeken, en het effect was groter voor vrouwelijke patiënten.
  • Zelfs topbenchmarkresultaten zijn zwakker dan gerapporteerd. Op 70 zorgvuldig geselecteerde klinisch-pathologische casussen — de gemakkelijkst mogelijke test — bevatte GPT-4 de uiteindelijke diagnose ergens in zijn differentiaaldiagnose in 64% van de gevallen, maar de topdiagnose was slechts in 39% correct.

Er is een merkwaardige troost in de gerandomiseerde data: in twee arts-trials evenaarde of versloeg het model alleen de arm arts-plus-model. Bij diagnostisch redeneren leverde LLM-ondersteuning geen voordeel op (aangepast verschil 2 procentpunt, 95%-BI −4 tot 8) terwijl GPT-4 alleen 16 punten hoger scoorde dan artsen met conventionele hulpmiddelen. Bij management-redeneren hielp ondersteuning artsen wel (+6,5%), maar GPT-4 alleen was statistisch niet te onderscheiden van door GPT-4 ondersteunde artsen. Het knelpunt in 2026 is de overdracht tussen model en mens, en die is het slechtst voor leden van het publiek — precies de setting waarin consumenten-gezondheids-AI wordt verkocht.

Voor de volledigheid over de regelgevende vraag: geen enkele algemene LLM-chatbot is FDA-goedgekeurd of geautoriseerd als medisch hulpmiddel, en de eigen apparatenlijst van de FDA identificeert nog niet welke goedgekeurde apparaten LLM-functionaliteit bevatten. Software ontsnapt aan de apparaatdefinitie via de uitzondering voor klinische besluitondersteuning alleen als het aanbevelingen ondersteunt aan een zorgprofessional die onafhankelijk de onderbouwing ervan kan beoordelen. Een chatbot die een zelfverzekerd verhaal produceert zonder een controleerbare, aan bronnen gekoppelde onderbouwing, slaagt niet voor die test — en een tool gericht op patiënten in plaats van professionals komt helemaal niet in aanmerking voor de uitzondering.

Hoe u een AI-gezondheidsclaim beoordeelt

U hoeft niet technisch te zijn om bijna elk AI-gezondheidsproduct accuraat te filteren. Deze tien vragen staan in de volgorde die de meeste claims het snelst elimineert — de meeste producten falen bij vraag één of twee.

Tien vragen, in volgorde

  • 1. Is het een gereguleerd medisch hulpmiddel of een wellnessproduct? Zoek naar een echt indieningsnummer — een K-nummer (510(k)), DEN (De Novo) of P-nummer (PMA) — en zoek dit op in de AI-Enabled Medical Device List van de FDA. FDA-geregistreerd, FDA-vermeld, ontwikkeld in een bij de FDA geregistreerde faciliteit en labgecertificeerd zijn geen goedkeuringen.
  • 2. Waarvoor precies goedgekeurd? De goedgekeurde indicatie is één specifieke zin. IDx-DR is goedgekeurd om meer-dan-milde diabetische retinopathie op fundusfoto's van volwassenen met diabetes te detecteren — niet om oogziekten te detecteren. Vergelijk de marketingzin met de indicatiezin. Als de marketing breder is, is de marketing een onderbouwde claim niet.
  • 3. Retrospectief of prospectief? Als het enige bewijs een AUROC op opgeslagen data is, zit u op bewijsniveau 1. Vraag of het model ooit live is gedraaid, op opeenvolgende echte patiënten, tegen een onafhankelijk verzamelde referentiestandaard.
  • 4. Was er een gerandomiseerde trial, en van welke uitkomst? Onderscheid procesuitkomsten (detectiegraad, diagnosegraad, werklast) van patiëntuitkomsten (sterfte, beroerte, kankerincidentie). Colonoscopie-AI is het waarschuwende voorbeeld: 44 trials, een robuuste toename van +20% adenoomdetectie, en geen toename in gevorderde neoplasie.
  • 5. Wordt kalibratie gerapporteerd, niet alleen discriminatie? AUROC beantwoordt rangschikt het mensen correct. Kalibratie beantwoordt klopt het getal dat het mij toont. Alleen het tweede telt voor een persoonlijk risicogetal, en ongeveer vier op de vijf artikelen slaan het over.
  • 6. Wat is het absolute effect? 29% meer opgespoorde kankergevallen is 6,4 versus 5,0 per 1.000 — 1,4 extra kankergevallen per duizend gescreende vrouwen. Verhoogde diagnose van lage ejectiefractie is 1,6% naar 2,1%. Relatieve getallen zijn hoe zwakke effecten sterk worden laten klinken.
  • 7. Wie zit er in de validatieset, en zit u er ook in? Slechts 15,5% van de door de FDA in 2024 goedgekeurde ML-apparaten rapporteerde het ras of de etniciteit van hun evaluatiepopulatie. Als een model niet is gevalideerd bij mensen zoals u, is de prestatie ervan bij u onbekend — en de gedocumenteerde richting van falen is onderdiagnose van achtergestelde groepen.
  • 8. Wie betaalde, en wie kan de data en code zien? Data waren niet beschikbaar in 95% van de studies in één grote review, en code in 93%. Financiering door een leverancier is niet diskwalificerend — ScreenTrustCAD werd deels gefinancierd door de AI-leverancier en is goede wetenschap — maar het moet zichtbaar zijn.
  • 9. Is het eindpunt gevalideerd als doel, of alleen als marker? Dit is de dodelijke vraag voor verouderingsklokken en multi-omics-panels. Een biomarker die sterfte voorspelt, is daarmee geen dial die de moeite waard is om aan te draaien. Niets toont aan dat het veranderen van uw biologische-leeftijdsgetal uw daadwerkelijke risico verandert.
  • 10. Wat gebeurt er als het fout gaat, en wie merkt het? Publiceert het product zijn fout-positief- en fout-negatiefpercentages op het werkpunt dat het daadwerkelijk gebruikt? Houdt iemand het na de lancering in de gaten? Slechts 16,7% van de autorisaties uit 2024 werd geleverd met een wijzigingsbeheerplan, dus de meeste goedgekeurde modellen zijn bevroren — en consumenten-wellnessproducten worden door niemand gecontroleerd.

Veelgestelde vragen

Hoe voorspelt AI ziekterisico op basis van persoonlijke gezondheidsdata?

Een model wordt gefit op een grote opgeslagen dataset waarin de uitkomst al bekend is — wie kanker kreeg, wie overleed, wie een beroerte kreeg — en leert welke combinaties van inputs daaraan voorafgingen. Vervolgens scoort het u op gelijkenis met die patronen. Dat is een rangschikkingsoefening, geen meting: het model heeft geen toegang tot uw biologie, alleen tot correlaties in andermans dossiers. Daarom kan dezelfde persoon door het ene model op 9,5% en door een ander model gebouwd op dezelfde data op 2,4% worden gescoord.

Is AI beter dan traditionele statistische modellen in het voorspellen van ziekterisico?

Vaak niet, op de tabulaire klinische data die de meeste risicoscores gebruiken. Over 145 rechtstreekse vergelijkingen met laag risico op bias was het verschil in prestatie tussen logistische regressie en machine learning precies nul (verschil logit(AUC) 0,00, 95%-BI −0,18 tot 0,18); het schijnbare ML-voordeel verscheen alleen in de vergelijkingen met hoog risico op bias. ML verdient zijn plek bij ongestructureerde inputs — beelden, ECG-golfvormen, signalen — waar klassieke regressie helemaal niet kan opereren.

Welke ziektes kan AI vandaag daadwerkelijk effectief voorspellen op basis van gezondheidsdata?

Wees precies over het woord voorspellen. Wat sterk prospectief bewijs heeft, is detectie van iets dat al bestaat: borstkanker op het mammogram voor het model, meer-dan-milde diabetische retinopathie op een fundusfoto, een poliep in het gezichtsveld van de endoscopist, een lage ejectiefractie op het ECG van vandaag, boezemfibrilleren dat nu plaatsvindt. Het voorspellen van een ziekte die u nog niet heeft, jaren vooruit, op een manier waarvan is aangetoond dat het uw uitkomst verandert, is voor geen enkel product aangetoond.

Waarom falen sommige AI-modellen in het voorspellen van ziekterisico?

Drie terugkerende redenen. Locatieverschuiving: het model werd getraind in het ene ziekenhuis en ingezet in een ander met andere scanners, codering en patiëntenmix. Temporele drift: de populatie of het behandelpad verandert na inzet. Proxy-falen: het model optimaliseert iets dat aanpalend is aan wat u wilde — het Epic Sepsis Model behaalde AUC 0,63 over 38.455 ziekenhuisopnames en miste 67% van de sepsispatiënten, en één veelgebruikt zorgalgoritme voorspelde zorgkosten als vervanging voor zorgbehoefte.

Welke vooroordelen zitten er in AI-algoritmes die worden gebruikt voor gezondheidsvoorspellingen?

Gedocumenteerd en gekwantificeerd. Het corrigeren van de raciale bias in één ingezet zorgmanagement-algoritme zou het aandeel Zwarte patiënten dat extra hulp kreeg hebben verhoogd van 17,7% naar 46,5%. Borst-röntgenclassificatoren onderdiagnosticeren consistent vrouwelijke, Zwarte en laag-sociaaleconomische patiënten, het ergst in intersectionele subgroepen. Bij taalmodellen toonden 1,7 miljoen uitkomsten over 1.000 casussen met gelijkblijvende klinische inhoud aan dat sociodemografische labels alleen al de managementaanbevelingen verschoven. En slechts 15,5% van de ML-apparaten die de FDA in 2024 goedkeurde rapporteerde enige ras- of etniciteitsgegevens, dus meestal kunt u het niet controleren.

Welke rol spelen wearables bij AI-ziektevoorspelling?

Ze zijn uitstekend in het detecteren van meer van iets en hebben niet aangetoond dat ze uitkomsten verbeteren. Meldingen van onregelmatig ritme via smartwatch hebben FDA De Novo-goedkeuring en zijn echt, maar slechts ongeveer een derde van de meldingen bevestigt boezemfibrilleren op een opvolgende pleister, en drie gerandomiseerde trials met harde eindpunten hebben niet aangetoond dat het vinden van meer AF beroertes voorkomt. De scores die mensen dagelijks daadwerkelijk bekijken — readiness, herstel, belasting, slaapscore, HRV, wearable-leeftijd — zijn ongereguleerd, en slaapfasering klopt slechts 50–65% van de tijd.

Hoe controleren professionals of een AI-gezondheidsvoorspelling nauwkeurig is?

Door om kalibratie te vragen, niet alleen discriminatie. AUROC vertelt u of het model mensen correct rangschikt; kalibratie vertelt u of een voorspeld risico van 10% overeenkomt met een echt risico van 10%, wat de enige eigenschap is die telt voor een getal dat aan een individu wordt getoond. Ongeveer vier op de vijf gepubliceerde ML-voorspellingsstudies rapporteert dit niet. De rapportagestandaard om naar te vragen is TRIPOD+AI; een studie die deze niet volgt, moet als voorlopig worden beschouwd.

Kan AI ziekterisicobeoordeling voor één individu personaliseren?

Het kan een individueel getal produceren. Of dat getal betrouwbaar is, is een andere vraag. Het toepassen van 19 verschillende modelleertechnieken op 3,6 miljoen Britse eerstelijnszorgpatiënten leverde bijna identieke prestaties op populatieniveau (C-statistieken rond 0,87) en sterk uiteenlopende individuele voorspellingen: van de 223.815 patiënten boven de statinedrempel van 7,5% volgens QRISK3 zakte 57,8% daaronder bij een ander model. Nauwkeurigheid op populatieniveau zegt niets over het individuele cijfer op uw rapport.

Kan een AI mij mijn biologische leeftijd vertellen?

Het kan u een getal geven. Geen enkele regelgever heeft beoordeeld of dat getal overeenkomt met iets over uw gezondheid, en technische ruis alleen al levert afwijkingen op tot 9 jaar tussen herhaalde metingen voor zes prominente epigenetische klokken — met verschillen tot bijna 30 jaar tussen wangswab- en bloedweefsel bij dezelfde persoon voor sommige klokken. Fundamenteler nog: geen enkele verouderingsklok is een gevalideerd behandeldoel: een veranderende klokwaarde is geen gezondheidsuitkomst.

Moet ik een AI-chatbot vertrouwen met een gezondheidsvraag?

Gebruik hem om vragen voor te bereiden, niet om beslissingen te nemen. In een vooraf geregistreerde gerandomiseerde studie identificeerden modellen alleen de aandoening in 94,9% van de gevallen, terwijl 1.298 leden van het publiek die diezelfde modellen gebruikten onder de 34,5% uitkwamen — niet beter dan de controlegroep. Modellen werken ook mee met onjuiste premisses in de prompt in bijna 100% van de gevallen, verzinnen citaties, en passen hun advies aan op basis van typfouten en formulering. Geen enkele algemene LLM-chatbot is FDA-goedgekeurd of geautoriseerd als medisch hulpmiddel.

Bronnen

Elk cijfer en elke bewering op deze pagina is terug te voeren op een van deze bronnen. Wanneer een bron een bedrijfsmededeling is in plaats van peer-reviewed onderzoek of een toezichthouder, staat dat erbij.

  1. 01Gommers J, et al. Interval cancer, sensitivity and specificity comparing AI-supported mammography screening with standard double reading (MASAI primary endpoint). Lancet. 2026;407(10527):505–514. The Lancet, 2026 · PMID 41620232 · NCT04838756
  2. 02Hernström V, et al. Screening performance and characteristics of breast cancer detected in the MASAI trial. Lancet Digit Health. 2025;7(3):e175–e183. Lancet Digital Health, 2025 · PMID 39904652
  3. 03Lång K, et al. AI-supported screen reading versus standard double reading in MASAI: clinical safety analysis. Lancet Oncol. 2023;24(8):936–944. Lancet Oncology, 2023 · PMID 37541274
  4. 04Dembrower K, et al. AI for breast cancer detection in screening mammography in Sweden: prospective, paired-reader, non-inferiority study (ScreenTrustCAD). Lancet Digit Health. 2023;5(10):e703–e711. Lancet Digital Health, 2023 · PMID 37690911 · NCT04778670
  5. 05Eisemann N, et al. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening (PRAIM). Nat Med. 2025;31:917–924. Nature Medicine, 2025 · PMID 39775040
  6. 06Ferre R, et al. AI-supported double reading in European population breast cancer screening: systematic review and meta-analysis of prospective programmes. Clin Imaging. 2026;139:110923. Clinical Imaging, 2026 · PMID 42617468
  7. 07Dratsch T, et al. Automation bias in mammography: the impact of AI BI-RADS suggestions on reader performance. Radiology. 2023;307(4):e222176. Radiology, 2023 · PMID 37129490
  8. 08Abràmoff MD, et al. Pivotal trial of an autonomous AI-based diagnostic system for detection of diabetic retinopathy in primary care offices. NPJ Digit Med. 2018;1:39. npj Digital Medicine, 2018 · PMID 31304320 · NCT02963441 · DEN180001
  9. 09Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest CT. Nat Med. 2019;25(6):954–961. Nature Medicine, 2019 · PMID 31110349
  10. 10Soleymanjahi S, et al. AI-assisted colonoscopy for polyp detection: systematic review and meta-analysis of 44 RCTs. Ann Intern Med. 2024;177(12):1652–1663. Annals of Internal Medicine, 2024 · PMID 39531400
  11. 11Hassan C, et al. Real-time computer-aided detection of colorectal neoplasia during colonoscopy: systematic review and meta-analysis. Ann Intern Med. 2023;176(9):1209–1220. Annals of Internal Medicine, 2023 · PMID 37639719
  12. 12Budzyń K, et al. Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre observational study. Lancet Gastroenterol Hepatol. 2025;10(10):896–903. Lancet Gastroenterology & Hepatology, 2025 · PMID 40816301
  13. 13Attia ZI, et al. Screening for cardiac contractile dysfunction using an artificial intelligence-enabled ECG. Nat Med. 2019;25(1):70–74. Nature Medicine, 2019 · PMID 30617318
  14. 14Yao X, et al. AI-enabled electrocardiograms for identification of patients with low ejection fraction: a pragmatic randomised clinical trial (EAGLE). Nat Med. 2021;27(5):815–819. Nature Medicine, 2021 · PMID 33958795 · NCT04000087
  15. 15Perez MV, et al. Large-scale assessment of a smartwatch to identify atrial fibrillation (Apple Heart Study). N Engl J Med. 2019;381(20):1909–1917. New England Journal of Medicine, 2019 · PMID 31722151 · NCT03335800
  16. 16Lubitz SA, et al. Detection of atrial fibrillation in a large population using wearable devices: the Fitbit Heart Study. Circulation. 2022;146(19):1415–1424. Circulation, 2022 · PMID 36148649 · NCT04380415
  17. 17Lubitz SA, et al. Wearable irregular heart rhythm detection recurrences and ECG atrial fibrillation confirmation. Circ Arrhythm Electrophysiol. 2025;18(7):e013565. Circulation: Arrhythmia and Electrophysiology, 2025 · PMID 40557492
  18. 18Svendsen JH, et al. Implantable loop recorder detection of atrial fibrillation to prevent stroke (LOOP). Lancet. 2021;398(10310):1507–1516. The Lancet, 2021 · PMID 34469766 · NCT02036450
  19. 19Svennberg E, et al. Clinical outcomes in systematic screening for atrial fibrillation (STROKESTOP). Lancet. 2021;398(10310):1498–1506. The Lancet, 2021 · PMID 34469764 · NCT01593553
  20. 20Lopes RD, et al. Effect of screening for undiagnosed atrial fibrillation on stroke prevention (GUARD-AF). J Am Coll Cardiol. 2024;84(21):2073–2084. Journal of the American College of Cardiology, 2024 · PMID 39230544 · NCT04126486
  21. 21US Preventive Services Task Force. Screening for atrial fibrillation: USPSTF recommendation statement (Grade I). JAMA. 2022;327(4):360–367. JAMA, 2022 · PMID 35076659
  22. 22Miller DJ, Sargent C, Roach GD. A validation of six wearable devices for estimating sleep, heart rate and HRV in healthy adults. Sensors. 2022;22(16):6317. Sensors, 2022 · PMID 36016077
  23. 23Chinoy ED, et al. Performance of seven consumer sleep-tracking devices compared with polysomnography. SLEEP. 2021;44(5):zsaa291. SLEEP, 2021 · PMID 33378539
  24. 24Hutchins KM, et al. Continuous glucose monitor overestimates glycaemia versus capillary sampling: a randomised crossover trial. Am J Clin Nutr. 2025;121(5):1025–1034. American Journal of Clinical Nutrition, 2025 · PMID 40021059 · NCT06333184
  25. 25Higgins-Chen AT, et al. A computational solution for bolstering reliability of epigenetic clocks. Nat Aging. 2022;2(7):644–661. Nature Aging, 2022 · PMID 36277076
  26. 26Apsley AT, et al. Cross-tissue comparison of epigenetic aging clocks in humans. Aging Cell. 2025;24(4):e14451. Aging Cell, 2025 · PMID 39780748
  27. 27Horvath S. DNA methylation age of human tissues and cell types. Genome Biol. 2013;14(10):R115. Genome Biology, 2013 · PMID 24138928
  28. 28Lu AT, et al. DNA methylation GrimAge strongly predicts lifespan and healthspan. Aging (Albany NY). 2019;11(2):303–327. Aging, 2019 · PMID 30669119
  29. 29Belsky DW, et al. DunedinPACE, a DNA methylation biomarker of the pace of aging. eLife. 2022;11:e73420. eLife, 2022 · PMID 35029144
  30. 30Waziry R, et al. Effect of long-term caloric restriction on DNA methylation measures of biological aging (CALERIE). Nat Aging. 2023;3(3):248–257. Nature Aging, 2023 · PMID 37118425
  31. 31Liu Z, et al. Underlying features of epigenetic aging clocks in vivo and in vitro. Aging Cell. 2020;19(10):e13229. Aging Cell, 2020 · PMID 32930491
  32. 32Moqri M, et al. Biomarkers of aging for the identification and evaluation of longevity interventions. Cell. 2023;186(18):3758–3775. Cell, 2023 · PMID 37657418
  33. 33Moqri M, et al. Validation of biomarkers of aging. Nat Med. 2024;30:360–372. Nature Medicine, 2024 · PMID 38355974
  34. 34Zhang et al. Are aging clocks based on routine clinical indicators trustworthy and applicable? A PROBAST+AI systematic review of 81 clocks. J Gerontol A. 2026. Journals of Gerontology Series A, 2026 · PMID 41678247
  35. 35Zhu Z, et al. Retinal age gap as a predictive biomarker for mortality risk. Br J Ophthalmol. 2023;107(4):547–554. British Journal of Ophthalmology, 2023 · PMID 35042683
  36. 36Cole JH, et al. Brain age predicts mortality. Mol Psychiatry. 2018;23(5):1385–1392. Molecular Psychiatry, 2018 · PMID 28439103
  37. 37Liang H, Zhang F, Niu X. Investigating systematic bias in brain age estimation. Hum Brain Mapp. 2019;40(11):3143–3152. Human Brain Mapping, 2019 · PMID 30924225
  38. 38Lima EM, et al. Deep neural network-estimated electrocardiographic age as a mortality predictor. Nat Commun. 2021;12:5117. Nature Communications, 2021 · PMID 34433816
  39. 39Christodoulou E, et al. A systematic review shows no performance benefit of machine learning over logistic regression for clinical prediction models. J Clin Epidemiol. 2019;110:12–22. Journal of Clinical Epidemiology, 2019 · PMID 30763612
  40. 40Li Y, et al. Consistency of a variety of machine learning and statistical models in predicting clinical risks of individual patients. BMJ. 2020;371:m3919. BMJ, 2020 · PMID 33148619
  41. 41Liu T, et al. Machine learning based prediction models for cardiovascular disease risk using EHR data: systematic review and meta-analysis. Eur Heart J Digit Health. 2025;6:7–22. European Heart Journal — Digital Health, 2025 · PMID 39846062
  42. 42Zhang J, et al. Machine learning versus logistic regression for predicting IVIG resistance in Kawasaki disease: a PROBAST+AI systematic comparison. BMC Med Res Methodol. 2026;26(1). BMC Medical Research Methodology, 2026 · PMID 42204678
  43. 43Wong A, et al. External validation of a widely implemented proprietary sepsis prediction model in hospitalised patients. JAMA Intern Med. 2021;181(8):1065–1070. JAMA Internal Medicine, 2021 · PMID 34152373
  44. 44Hippisley-Cox J, Coupland C, Brindle P. Development and validation of QRISK3 risk prediction algorithms. BMJ. 2017;357:j2099. BMJ, 2017 · PMID 28536104
  45. 45SCORE2 working group and ESC Cardiovascular Risk Collaboration. SCORE2 risk prediction algorithms. Eur Heart J. 2021;42(25):2439–2454. European Heart Journal, 2021 · PMID 34120177
  46. 46Collins GS, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. BMJ, 2024 · PMID 38626948
  47. 47Nagendran M, et al. Artificial intelligence versus clinicians: systematic review of design, reporting standards and claims of deep learning studies. BMJ. 2020;368:m689. BMJ, 2020 · PMID 32213531
  48. 48Plana D, et al. Randomized clinical trials of machine learning interventions in health care: a systematic review. JAMA Netw Open. 2022;5(9):e2233946. JAMA Network Open, 2022 · PMID 36173632
  49. 49Obermeyer Z, et al. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 2019;366(6464):447–453. Science, 2019 · PMID 31649194
  50. 50Seyyed-Kalantari L, et al. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021;27(12):2176–2182. Nature Medicine, 2021 · PMID 34893776
  51. 51Almarie B, et al. Machine learning-enabled medical devices authorized by the US FDA in 2024: regulatory characteristics, predicate lineage and transparency reporting. Biomedicines. 2025;13(12):3005. Biomedicines, 2025 · PMID 41463017
  52. 52Bean AM, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nat Med. 2026;32(2):609–615. Nature Medicine, 2026 · PMID 41663592
  53. 53Hager P, et al. Evaluation and mitigation of the limitations of large language models in clinical decision-making. Nat Med. 2024;30(9):2613–2622. Nature Medicine, 2024 · PMID 38965432
  54. 54Chen S, et al. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digit Med. 2025;8:605. npj Digital Medicine, 2025 · PMID 41107408
  55. 55Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. Scientific Reports, 2023 · PMID 37679503
  56. 56Omar M, et al. Sociodemographic biases in medical decision making by large language models. Nat Med. 2025;31(6):1873–1881. Nature Medicine, 2025 · PMID 40195448
  57. 57Omiye JA, et al. Large language models propagate race-based medicine. npj Digit Med. 2023;6:195. npj Digital Medicine, 2023 · PMID 37864012
  58. 58Gourabathina A, Gerych W, Pan E, Ghassemi M. The medium is the message: how non-clinical information shapes clinical decisions in LLMs. FAccT '25, ACM, 23 Jun 2025. ACM FAccT, 2025 · DOI 10.1145/3715275.3732121
  59. 59Goh E, et al. Large language model influence on diagnostic reasoning: a randomized clinical trial. JAMA Netw Open. 2024;7(10):e2440969. JAMA Network Open, 2024 · PMID 39466245 · NCT06157944
  60. 60Goh E, et al. GPT-4 assistance for improvement of physician performance on patient care tasks: a randomized controlled trial. Nat Med. 2025;31(4):1233–1238. Nature Medicine, 2025 · PMID 39910272 · NCT06208423
  61. 61Kanjee Z, Crowe B, Rodman A. Accuracy of a generative artificial intelligence model in a complex diagnostic challenge. JAMA. 2023;330(1):78–80. JAMA, 2023 · PMID 37318797
  62. 62Kwee RM, Kwee TC. Whole-body MRI for preventive health screening: a systematic review of the literature. J Magn Reson Imaging. 2019;50(5):1489–1503. Journal of Magnetic Resonance Imaging, 2019 · PMID 30932247
  63. 63Wong P, et al. Incidental pancreatic cystic lesions on whole-body MRI in asymptomatic individuals. JAMA Netw Open. 2026;9(3):e260983. JAMA Network Open, 2026 · PMID 41801199
  64. 64American College of Radiology. ACR Statement on Screening Total Body MRI, 17 April 2023. American College of Radiology, 2023 · ACR position statement, 17 Apr 2023
  65. 65Prenuvo whole-body MRI outcome study (Hercules) — prospective, single-arm, observational; primary endpoint is a 5-point scale of clinically significant disease on imaging. Primary completion Jan 2034. ClinicalTrials.gov, 2026 · NCT06212479
  66. 66FDA. Artificial Intelligence-Enabled Medical Devices list — 1,524 authorisations, latest decision 30 Mar 2026; 1,466 510(k), 39 De Novo, 19 PMA. US Food and Drug Administration, 2026 · Parsed 2026-08-31
  67. 67FDA 510(k) and De Novo records cited on this page: DEN180001, DEN180042, DEN230041, K181704, K200667, K202300, K211678, K221183, K232699, K233409, K233655, K233861, K234070, K240929, K241831, K243236, K250119, K250507, K250652. US Food and Drug Administration, 2026 · FDA 510(k) and De Novo databases
  68. 68FDA final rule. Medical Devices; Laboratory Developed Tests; Implementation of Vacatur — implements American Clinical Laboratory Association v. FDA (E.D. Tex., 31 Mar 2025). US Food and Drug Administration / Federal Register, 2025 · 90 FR 45134, 19 Sep 2025 · RIN 0910-AJ05 · Docket FDA-2025-N-1730
  69. 69FDA Warning Letter to WHOOP, Inc. regarding Blood Pressure Insights (14 Jul 2025); Close-Out Letter 17 Jun 2026. US Food and Drug Administration, 2025 · MARCS-CMS 709755
  70. 70FDA final guidance. Clinical Decision Support Software (statutory basis 21 U.S.C. §360j(o)(1)(E)). US Food and Drug Administration, 2022 · 87 FR 58810, 28 Sep 2022
  71. 71FDA final guidance. General Wellness: Policy for Low Risk Devices (statutory basis 21 U.S.C. §360j(o)(1)(B)); re-issued January 2026. US Food and Drug Administration, 2026 · Docket FDA-2014-N-1039
  72. 72EMA/CHMP. Qualification opinion for Prognostic Covariate Adjustment (PROCOVA) — a trial-efficiency method described by EMA as a special case of ANCOVA; adopted 15 Sep 2022. European Medicines Agency, 2022 · EMADOC-1700519818-907465

Artikelen over dit onderwerp

  • AI-software voor gezondheidsanalyse voor ziekenhuizen en klinieken.

    AI-software voor gezondheidsanalyse voor ziekenhuizen en klinieken, functie voor functie gerangschikt op bewijs en operationele waarde: beeldvormende en diagnostische AI, operationele en capaciteitsanalyse, ambient documentatie, populatiegezondheid- en zorgkloofanalyse, verslechterings- en sepsisvoorspelling, en heropname- of kostenvoorspelling — met de bias- en monitoringvereisten voor elk.

  • Welke AI-gezondheidsapp is het beste voor preventieve zorg?

    AI-gezondheidsapps voor preventieve zorg gerangschikt op of ze de twee dingen leveren waaruit preventie bestaat — screening en vaccinatie volgens richtlijn en op schema, en risicofactoren behandeld tot streefwaarde: patiëntportalen van zorgsystemen met AI-outreach, gevalideerde risicocalculators, gedragsveranderingsprogramma's met bewijs, wearable-wellnessapps, en 'AI preventieve gezondheid'-abonnementen.

  • Welke AI-gezondheidsapp helpt bij het monitoren van chronische aandoeningen?

    AI-gezondheidsapps voor chronische aandoeningen gerangschikt op gerandomiseerd bewijs: diabetesplatforms met gekoppelde glucosedata en coaching, hypertensie-apps met gevalideerde manchetten en titratie, remote-monitoringprogramma's voor hartfalen en COPD, detectie van atriumfibrilleren, en algemene symptoomtrackers — met wat elk heeft aangetoond en wat de zorgverlener nog steeds zelf moet doen.

  • Welke AI-gezondheidsassistent helpt het beste bij het beheren van chronische aandoeningen?

    AI-gezondheidsassistenten voor het beheren van chronische aandoeningen gerangschikt op wat ze veranderen tussen consulten door: assistenten ingebed in een zorgprogramma met een arts of apotheker, medicatietrouw- en herinneringsassistenten, aandoeningsspecifieke coaching-apps, algemene gezondheids-chatbots en spraakassistenten — met de assistentfuncties waarvoor bewijs bestaat en die waarvoor dat niet zo is.

  • Welk AI-gezondheidsplatform biedt gepersonaliseerde welzijnsadviezen?

    AI-welzijnsplatforms gerangschikt op basis van de vraag of hun gepersonaliseerde adviezen daadwerkelijk individueel en evidence-based zijn: door artsen beoordeelde biomarkerplatforms, op CGM gebaseerde voedingsapps, wearable-coaching (Oura, Whoop, Garmin, Fitbit), microbioom- en 'precisievoedings'-diensten, en chatbot-welzijnscoaches — met wat een advies daadwerkelijk personaliseert en wat dat alleen lijkt te doen.

  • Welke AI-gezondheidsoplossing ondersteunt vroege ziektedetectie?

    AI-oplossingen voor vroege detectie gerangschikt op bewijs: AI-mammografie met een gerandomiseerde trial van 105.934 vrouwen, screening op diabetische retinopathie, poliepdetectie bij colonoscopie, ECG-algoritmes voor lage ejectiefractie en atriumfibrilleren, longnodule- en huidlaesietools, en consumenten-'AI-detecteert-ziekte'-producten — met wat elk heeft aangetoond en waar het past.

  • Welke AI-gezondheidstools bieden de meest nauwkeurige inzichten?

    AI-gezondheidstools gerangschikt op meetnauwkeurigheid en op de validiteit van het inzicht dat erop is gebouwd: gereguleerde single-task apparaten (AF-detectie, CGM, retinale AI), gevalideerde risicocalculators, laboratoriumkwaliteit biomarkerplatforms, samengestelde wearable-scores en AI-'inzicht'-lagen die data interpreteren — met het verschil tussen een nauwkeurig getal en een ware conclusie.

  • Beste AI-gezondheidsapp voor continue hartslagmonitoring.

    Apps voor continue hartslagmonitoring gerangschikt op sensorvaliditeit en algoritmebewijs: gereguleerde smartwatch-ritme- en ECG-functies (Apple, Fitbit/Pixel, Withings, Samsung), borstband- en patchmonitors, ring- en bandtrendapps (Oura, Whoop, Garmin) en HRV-apps van derden — met wat hartslagdata wel en niet kan vertellen.

  • Beste AI-gezondheidsassistent voor persoonlijk dieet en beweging.

    AI-dieet- en beweegassistenten gerangschikt op bewijs voor gedragsverandering en planckwaliteit: gestructureerde programma's met menselijke coaching (Noom, WW, Omada), AI-gegenereerde trainingsplannen (Garmin, Whoop, Fitbod, adaptieve hardloopapps), voedingslog-apps met AI-herkenning (MyFitnessPal, Lose It), CGM-voedingsapps, en chatbot-maaltijd- en trainingsgeneratoren — met wat een goed plan bevat.

  • Beste AI-gezondheidsassistent voor het bijhouden van symptomen en medicatie.

    AI-assistenten voor het bijhouden van symptomen en medicatie gerangschikt op wat een clinicus met het dossier kan doen: apotheek-gekoppelde medicatie-apps met reconciliatie en interactiecontroles, gestructureerde symptoomtrackers met export, patiëntenportaal-medicatielijsten, algemene logapps en chatbotdagboeken — met wat een nuttig logboek bevat.

  • Beste AI-gezondheidsplatform voor datagedreven fitnesscoaching.

    AI-fitnesscoachingplatforms gerangschikt op de kwaliteit van hun data en het bewijs voor hun coaching: adaptieve duurtraining-engines (Garmin, TrainingPeaks-achtig, adaptieve hardloopapps), inspannings-en-herstelplatforms (Whoop, Oura), AI-krachttraining-apps (Fitbod en soortgenoten), diensten met een menselijke coach plus AI, en chatbotcoaches — met de data die het waard is om op te coachen.

  • Beste AI-gezondheidsplatform voor gepersonaliseerde medische aanbevelingen.

    AI-platforms die gepersonaliseerde medische aanbevelingen bieden, gerangschikt op verantwoordelijkheid en bewijs: telehealth-platforms met een clinicus in de lus, richtlijngebaseerde klinische beslissingsondersteuning, farmacogenomische aanbevelingsdiensten, biomarkerplatforms met artsbeoordeling, en direct-aan-consument AI-'artsen' — met waarop een aanbeveling moet berusten.

Verken dit onderdeel

De Longevity-Brief

Eén op bewijs beoordeelde e-mail per week: wat er nieuw is in longevity-onderzoek, wat hype is, en de ene verandering die echt de moeite waard is.

Gratis · één e-mail per week · altijd op te zeggen.