Skip to content

Previsione sanitaria basata sull'IA

Algoritmi che pretendono di prevedere la tua salute, valutati in base a ciò che è stato realmente dimostrato nell'uomo — in modo prospettico.
Reviewed by CureMed LabsAggiornato il
Un medico che esamina un punteggio di rischio algoritmico su uno schermo accanto alla cartella di un paziente
Un algoritmo che classifica correttamente i pazienti su dati storici non ha ancora dimostrato di cambiare qualcosa per il paziente che hai davanti.
In parole semplici

Sempre più aziende vendono software che legge le tue analisi del sangue, le tue scansioni o i dati dell'orologio e ti dice quali malattie potresti sviluppare. Alcuni di questi strumenti svolgono davvero bene un compito ristretto, ma quasi nessuno ha mai dimostrato di rendere qualcuno più sano.

In breve

La previsione sanitaria basata sull'IA è reale in una manciata di ambiti ristretti — lettura delle mammografie, screening della retinopatia diabetica, rilevamento dei polipi, rilevamento di bassa frazione di eiezione dall'ECG — ed è sostanzialmente priva di prove ovunque venga venduta ai consumatori. Il motivo è una singola distinzione che il marketing cancella regolarmente: un AUROC elevato su un dataset storico significa che il modello classifica correttamente i pazienti su dati che non ha mai influenzato. Non è prova che usare il modello cambi ciò che accade a qualcuno. Circa 1.500 dispositivi abilitati dall'IA hanno un'autorizzazione di marketing FDA, e ci sono circa 41 trial randomizzati su interventi di machine learning in tutta la sanità.

  • L'accuratezza non è beneficio: su 81 studi deep learning vs clinico, solo 9 erano prospettici e solo 6 sono stati condotti in un contesto clinico reale (Nagendran 2020, PMID 32213531).
  • L'IA per la colonscopia è l'applicazione più randomizzata in medicina — 44 RCT, rilevamento di adenomi in aumento del ~20% relativo, e nessun aumento della neoplasia avanzata (Soleymanjahi 2024, PMID 39531400).
  • Nessun orologio dell'invecchiamento — epigenetico, retinico, cerebrale, ECG o proteomico — è un target terapeutico validato, un endpoint surrogato validato o un dispositivo diagnostico approvato dall'FDA; l'organismo di consenso del settore lo afferma per iscritto (Moqri 2023, PMID 37657418).
  • Il machine learning spesso non batte la regressione logistica sui dati clinici tabulari: su 145 confronti diretti a basso rischio di bias, la differenza in logit(AUC) era 0,00 (IC 95% da −0,18 a 0,18) (Christodoulou 2019, PMID 30763612).
  • Il bias algoritmico è misurato, non ipotetico: correggere un algoritmo di gestione delle cure ampiamente utilizzato avrebbe fatto salire la quota di pazienti neri che ricevevano assistenza extra dal 17,7% al 46,5% (Obermeyer 2019, PMID 31649194).
Quasi ogni prodotto per la longevità oggi rivendica un livello di IA. Legge il tuo sangue, il tuo genoma, la tua scansione, il tuo orologio, e restituisce una previsione: una percentuale di rischio, un'età biologica, un punteggio di prontezza, un elenco di cose di cui preoccuparsi. Il claim è seducente perché la tecnologia sottostante è davvero brava nel riconoscimento di pattern, e perché la frase di marketing — la nostra IA prevede il tuo rischio di malattia — è tecnicamente vera per quasi qualsiasi modello mai adattato ai dati.
Questa pagina valuta questi claim allo stesso modo in cui valutiamo un farmaco: in base a ciò che è stato dimostrato nell'uomo, in modo prospettico, rispetto a un esito a cui una persona terrebbe. Su questo standard il campo si divide nettamente. L'IA per l'imaging medico ha prodotto alcune delle migliori prove della medicina moderna, incluso un trial randomizzato su 105.934 donne. L'IA per la longevità consumer non ha prodotto praticamente nulla, e si colloca quasi interamente al di fuori della regolamentazione dei dispositivi.
L'ossatura di tutto ciò che segue è una frase. Un AUROC elevato su un dataset retrospettivo non è prova di beneficio clinico — ed è l'unica prova che possiede la maggior parte dei prodotti di IA sanitaria.

I quattro livelli di evidenza, e perché quasi nulla raggiunge il livello 4

L'AUROC — l'area sotto la curva ROC — è la probabilità che un modello classifichi un caso casuale sopra un controllo casuale. È il numero presente in quasi ogni titolo sull'IA sanitaria, e risponde a una domanda ristretta: il modello ordina correttamente le persone su dati che gli sono già stati mostrati? Non dice nulla sul fatto che il numero che ti viene visualizzato sia vero, che qualcuno agisca di conseguenza, o che agire di conseguenza faccia più bene che male.

Quattro livelli distinti di evidenza si celano dietro la frase clinicamente validato, e il marketing presenta regolarmente il primo come se fosse il quarto.

Su cosa può realmente basarsi un claim di IA sanitaria

LivelloCosa significaQuanto è comune nell'IA sanitaria
1. AUROC retrospettivoIl modello ottiene un buon punteggio su un dataset archiviato che non ha mai influenzato. Non dice nulla sul fatto che usarlo cambi qualcosa.Quasi tutta la ricerca pubblicata sull'IA sanitaria, e di fatto tutta l'IA per la longevità consumer
2. Accuratezza prospetticaIl modello funziona in tempo reale su pazienti reali consecutivi; l'accuratezza è misurata rispetto a uno standard di riferimento raccolto in modo indipendente. Ancora nessun esito.Non comune
3. Esito di processo randomizzatoUn trial randomizzato mostra che l'IA cambia cosa fanno o trovano i clinici — tasso di rilevamento, tasso di diagnosi, carico di lavoro.Raro: qualche decina di trial in totale, per lo più in endoscopia
4. Esito clinico randomizzatoUn trial randomizzato mostra che l'IA cambia se le persone vivono più a lungo, hanno meno ictus o sviluppano meno tumori.Sostanzialmente inesistente in questo campo
L'IA per la mammografia ha raggiunto il livello 3 con vero rigore. L'IA per la colonscopia ha raggiunto il livello 3 e poi non è riuscita a tradurlo in livello 4. Gli orologi dell'invecchiamento, i pannelli multi-omici e l'IA wellness consumer si collocano al livello 1, e spesso al di sotto.
1.524
dispositivi abilitati dall'IA con autorizzazione di marketing FDA — il 96,2% tramite equivalenza sostanziale 510(k) a un prodotto esistente, non nuove prove di esito
FDA AI-Enabled Medical Device List, analizzato il 2026-08-31
41
trial randomizzati su interventi di machine learning in tutta la sanità, mediana 294 partecipanti; nessuno ha soddisfatto tutti gli standard CONSORT-AI
Plana 2022, JAMA Netw Open, PMID 36173632
9 su 81
studi deep learning vs clinico che erano prospettici; solo 6 sono stati testati in un contesto clinico reale
Nagendran 2020, BMJ, PMID 32213531
15,5%
dei 168 dispositivi di machine learning autorizzati dall'FDA nel 2024 ha riportato dati su razza o etnia per la propria popolazione di valutazione
Almarie 2025, Biomedicines, PMID 41463017
+0,9 / 1.000
tumori extra rilevati in pool dalla mammografia assistita da IA su 597.419 esami di screening (IC 95% da −0,0 a +1,8)
Ferre 2026, Clin Imaging, PMID 42617468
34%
degli avvisi di ritmo irregolare degli smartwatch sono stati confermati come fibrillazione atriale con un patch ECG di follow-up
Perez 2019, NEJM (Apple Heart Study), PMID 31722151

Dove l'IA funziona davvero — e dove il rilevamento si ferma prima del beneficio

L'imaging è l'area più solida, e vale la pena essere precisi sul perché. Lo screening mammografico ha un comparatore esistente di alta qualità (due radiologi che leggono ogni pellicola), un endpoint duro a valle (tumore d'intervallo), e programmi nazionali disposti a randomizzare. Questa combinazione è rara, ed è ciò che ha prodotto le migliori prove sull'IA in medicina.

MASAI ha randomizzato 105.934 donne svedesi a lettura assistita da IA o doppia lettura standard. Il rilevamento del tumore è salito da 5,0 a 6,4 per 1.000, un rapporto di 1,29 (IC 95% 1,09–1,51), con il carico di lettura dello screening ridotto del 44%. Quando l'endpoint primario è stato infine riportato, il tumore d'intervallo era 1,55 contro 1,76 per 1.000 — un rapporto di proporzione di 0,88 (0,65–1,18). Ciò è non-inferiorità, non superiorità. Nessuno ha dimostrato che la mammografia assistita da IA riduca la mortalità per tumore al seno, e date le dimensioni di trial richieste, è improbabile che qualcuno lo faccia.

Sotto il livello dell'imaging, emerge un pattern coerente: l'IA trova in modo affidabile di più di qualcosa, e trovarne di più ha ripetutamente fallito nell'aiutare. Lo screening con smartwatch e patch raddoppia-triplica il rilevamento della fibrillazione atriale. Tre trial randomizzati con endpoint duri — LOOP, STROKESTOP e GUARD-AF — non hanno dimostrato una riduzione dell'ictus. Gli autori di LOOP lo scrivono nel proprio abstract: non tutta la fibrillazione atriale merita lo screening, e non tutta la fibrillazione atriale rilevata dallo screening merita l'anticoagulazione.

Il registro delle prove

Classificato secondo: il livello più alto di evidenza che esiste davvero per ciascun approccio. Questi livelli sono stati concepiti per i farmaci, quindi leggili così per il software: approvato significa che esiste una vera autorizzazione di marketing FDA (510(k), De Novo o PMA) per lo specifico output venduto; preclinico significa che il lavoro è reale ma esiste solo come modelli adattati a dataset umani archiviati, senza prove di impiego clinico; venduto-non-provato significa che il prodotto è venduto al pubblico senza revisione regolatoria del claim e senza prove controllate di beneficio. Nota che approvazione e beneficio sono assi diversi: diversi strumenti di livello approvato qui presenti hanno prove randomizzate che cambiano il rilevamento e nessuna prova che cambino gli esiti.

  1. IA per mammografia (Transpara, Lunit INSIGHT MMG)

    Approvato

    Legge le mammografie di screening come strumento di triage e secondo lettore accanto ai radiologi.

    L'IA con le prove migliori in medicina. Rapporto di rilevamento 1,29 e 44% in meno di lavoro di lettura in MASAI; tumore d'intervallo non-inferiore, non ridotto. In pool tra MASAI, ScreenTrustCAD e PRAIM (597.419 esami) il beneficio è di +0,9 tumori per 1.000 screening, con l'intervallo di confidenza che tocca lo zero. Reale e utile. Non l'IA rileva il tumore anni prima.

    Approvato FDA 510(k) (K181704 → K241831; K211678). Prove randomizzate (MASAI) e prospettiche con doppio lettore (ScreenTrustCAD).NCT04838756; PMID 41620232
  2. Screening autonomo della retinopatia diabetica (IDx-DR / LumineticsCore)

    Approvato

    Classifica le fotografie del fondo oculare per retinopatia diabetica più-che-lieve senza che un clinico legga l'immagine.

    Sensibilità 87,2% (81,8–91,2), specificità 90,7% (88,3–92,7) in 900 pazienti, in ambulatori di medicina generale anziché in cliniche oculistiche, rispetto a una classificazione indipendente da centro di lettura. L'esempio più pulito di questo dossier di IA fatta correttamente. Concorrenti approvati sullo stesso codice prodotto: EyeArt (K200667) e AEYE-DS (K221183).

    FDA De Novo DEN180001, 11 aprile 2018 — il primo dispositivo diagnostico autonomo basato su IA autorizzato in qualsiasi campo. Trial prospettico pivotal in medicina di base.NCT02963441; PMID 31304320
  3. Rilevamento assistito da computer per la colonscopia (CADe)

    Approvato

    Segnala i polipi nel campo visivo live dell'endoscopista.

    Rapporto del tasso di rilevamento degli adenomi 1,21 (1,15–1,28) — solido e coerente. Ma la neoplasia avanzata per colonscopia non ha mostrato alcuna differenza (differenza del tasso di incidenza 0,01, da −0,01 a 0,02), l'aumento era guidato in gran parte da lesioni diminutive, e c'erano circa due polipectomie non neoplastiche extra ogni dieci procedure. L'applicazione di IA più randomizzata in medicina, e il livello 3 non è diventato livello 4.

    Approvato FDA e marchio CE. 44 trial randomizzati, 36.201 pazienti.PMID 39531400; PMID 37639719
  4. ECG-IA per bassa frazione di eiezione (Anumana, Eko, Tempus)

    Approvato

    Segnala una probabile frazione di eiezione ventricolare sinistra pari o inferiore al 50% da un ECG standard a 12 derivazioni.

    Genuinamente accurato — AUC 0,93 per FE ≤35% nel lavoro di sviluppo — e genuinamente randomizzato. Nota cosa predice: la tua frazione di eiezione ora, non il tuo rischio futuro. E nota l'effetto assoluto in EAGLE: le nuove diagnosi di FE bassa sono salite dall'1,6% al 2,1%.

    Approvato FDA 510(k) come software di notifica (K232699, K233409, K250119, K250652). Trial cluster-randomizzato (EAGLE, 22.641 pazienti).NCT04000087; PMID 30617318
  5. Punteggio di malignità del nodulo polmonare (Optellum Virtual Nodule Clinic)

    Approvato

    Assegna un punteggio di rischio di malignità a un nodulo polmonare già trovato da un umano su una TC.

    Un ausilio di stratificazione del rischio senza alcun trial che dimostri un cambiamento nello stadio alla diagnosi o nella mortalità. Vale la pena sapere come si comporta la ricerca sottostante: nel modello NLST di Google, le prestazioni hanno battuto tutti e sei i radiologi quando non era disponibile una TC precedente ed erano semplicemente al pari quando esisteva una scansione precedente — che è la condizione clinicamente realistica.

    Approvato FDA 510(k) (K202300, 2021). Solo validazione retrospettiva; nessun RCT.K202300; PMID 31110349
  6. Notifica di ritmo irregolare degli smartwatch

    Approvato

    Rileva un pattern di polso suggestivo di fibrillazione atriale e invia una notifica.

    Il rilevamento funziona; il beneficio non segue. Solo il 34% (Apple) e il 32,2% (Fitbit) degli avvisi sono stati confermati come FA su un patch di follow-up. Effettuare un ECG da orologio di 10 secondi dopo un avviso ha una resa diagnostica del 7,6%, contro il 60,8% per un patch di quattro settimane. E in LOOP, STROKESTOP e GUARD-AF, trovare più FA non si è dimostrato in grado di prevenire ictus. L'USPSTF valuta ancora insufficienti le prove per lo screening della FA negli adulti dai 50 anni in su — una dichiarazione di Grado I.

    FDA De Novo DEN180042 (Apple). Studi pragmatici su 419.297 (Apple Heart) e 455.699 (Fitbit Heart) partecipanti.NCT03335800; NCT04380415; PMID 35076659
  7. Notifiche consumer per ipertensione e apnea notturna

    Approvato

    Segnala pattern wearable pluri-settimanali suggestivi di ipertensione o apnea notturna da moderata a grave.

    I riepiloghi di approvazione sono più onesti del marketing. Per l'ipertensione, il riepilogo FDA riporta sensibilità 41,2% (37,2–45,3) e specificità 92,3% su 1.863 partecipanti analizzati — manca circa il 59% dell'ipertensione e il 46% dell'ipertensione di stadio 2, e la propria indicazione vieta di usarlo per la sorveglianza o per monitorare il trattamento. Per l'apnea notturna, sensibilità 66,3%. Entrambi sono legittimi come spinta verso un test corretto. Nessuno dei due è una misurazione.

    Approvato FDA 510(k) (Apple ipertensione K250507, set 2025; Apple apnea notturna K240929, predicato Samsung DEN230041). Solo validazione dello sponsor.K250507; K240929
  8. Previsione della sepsi nella cartella clinica elettronica (Epic Sepsis Model)

    Venduto · non provato

    Assegna continuamente un punteggio ai pazienti ricoverati per probabile insorgenza di sepsi.

    AUC 0,63 su 38.455 ricoveri, mancando il 67% dei pazienti settici e generando avvisi sul 18% di tutti i ricoveri. Ha identificato solo il 7% dei pazienti settici oltre a quanto già rilevato dalla pratica clinica tempestiva. Gli autori definiscono la diffusa adozione nonostante queste prestazioni una preoccupazione fondamentale. Il divario regolatorio che ha permesso la diffusione senza esame è il punto centrale.

    Non regolamentato dall'FDA — è stato distribuito come funzionalità EHR in centinaia di ospedali statunitensi. Esiste una validazione esterna, e ha fallito.PMID 34152373
  9. Test consumer di età biologica epigenetica

    Venduto · non provato

    Restituiscono un singolo numero di età biologica dalla metilazione del DNA nel sangue, nella saliva o in un tampone della guancia.

    Gli orologi sottostanti sono associazioni di mortalità reali e replicate. Il prodotto consumer è un claim di precisione che il test non può sostenere: il rumore tecnico produce deviazioni fino a 9 anni tra esecuzioni replicate dello stesso campione per sei orologi importanti, e le differenze tra tessuto orale e sangue raggiungono quasi 30 anni nella stessa persona per alcuni orologi. La maggior parte dei test diretti al consumatore usa saliva o tamponi della guancia.

    Test sviluppati in laboratorio (LDT) solo sotto CLIA. La regola FDA sugli LDT è stata annullata il 31 marzo 2025 e formalmente revocata il 19 settembre 2025, quindi nessun regolatore esamina la validità clinica del claim sull'età.PMID 36277076; PMID 39780748
  10. Gap di età retinico, cerebrale, ECG e proteomico

    Solo preclinico

    Stimano l'età di un organo o di tutto il corpo da una foto retinica, una risonanza magnetica, un ECG o un proteoma plasmatico, poi riportano il gap rispetto al tuo compleanno.

    Statisticamente reali a livello di popolazione e molto più deboli di quanto sembrino a livello individuale. Gap di età retinico: HR di mortalità per tutte le cause 1,02 all'anno, intervallo di confidenza che tocca 1,00, senza associazione significativa con mortalità cardiovascolare o oncologica. Età cerebrale: HR di mortalità 1,061 all'anno — ma quando inserito insieme a semplici volumi di materia grigia e liquido cerebrospinale non era più significativo (p=0,12), quindi il passaggio di deep learning non aggiungeva nulla rispetto a una misurazione del volume.

    Strumenti di ricerca. Nessuna approvazione FDA per nessuno di questi output; le ricerche per nome di dispositivo nel database 510(k) dell'FDA non restituiscono alcun dispositivo approvato che produca un'età biologica o fisiologica.PMID 35042683; PMID 28439103
  11. Punteggi wellness: prontezza, recupero, sforzo, punteggio del sonno, HRV, età wearable

    Venduto · non provato

    Punteggi giornalieri composti derivati in gran parte da frequenza cardiaca, HRV e stadi del sonno stimati.

    I wearable consumer assegnano lo stadio del sonno corretto il 50–65% delle volte (kappa di Cohen 0,20–0,52), e sono orientati a chiamare tutto sonno: la specificità del rilevamento della veglia va da 0,18 a 0,54. Ogni conteggio di minuti di sonno profondo e ogni punteggio di recupero derivato dal REM è costruito su questo. La lettera di avvertimento FDA a Whoop ha anche stabilito ufficialmente che un disclaimer non per uso medico non salva un prodotto progettato per produrre una stima clinica.

    Wellness generale non regolamentato. Nessuna approvazione FDA identificata per Oura, Garmin o Ultrahuman nel database FDA; l'unica approvazione di Whoop è una funzione ECG (K243236).PMID 36016077; PMID 33378539
  12. Chatbot sanitari LLM generici

    Venduto · non provato

    Rispondono a domande sulla salute, effettuano triage dei sintomi e suggeriscono cosa fare in linguaggio naturale.

    I modelli non sono l'anello debole — lo è il passaggio di consegne. In uno studio randomizzato pre-registrato, i modelli testati da soli hanno identificato la condizione nel 94,9% dei casi; 1.298 membri del pubblico che usavano gli stessi modelli hanno identificato le condizioni in meno del 34,5% — non meglio del controllo. Su 2.400 casi di pazienti reali anziché vignette, modelli allo stato dell'arte hanno avuto prestazioni significativamente peggiori dei medici ed erano sensibili all'ordine in cui venivano fornite le informazioni.

    Nessun chatbot LLM generico è approvato o autorizzato dall'FDA come dispositivo medico, e l'elenco dei dispositivi dell'FDA non identifica ancora quali dispositivi autorizzati contengano funzionalità LLM.PMID 41663592; PMID 38965432
  13. Pannelli multi-omici e servizi di screening con risonanza magnetica total-body

    Venduto · non provato

    Raggruppano centinaia di biomarcatori, genomica e una scansione total-body in una previsione sanitaria personalizzata.

    In pool su 12 studi e 5.373 soggetti asintomatici, la risonanza total-body ha prodotto reperti incidentali critici o indeterminati nel 32,1%, di cui solo il 12,6% è mai stato verificato. Il database di un fornitore su 21.651 scansioni asintomatiche ha trovato cisti pancreatiche incidentali nel 7,0% di tutti gli scansionati, di cui circa il 99% al di sotto della dimensione che innescherebbe un intervento — eppure tutte entrano in sorveglianza. L'American College of Radiology afferma che non ci sono prove sufficienti per raccomandare lo screening total-body in persone senza sintomi, fattori di rischio o storia familiare.

    Test sviluppati in laboratorio solo CLIA più discrezionalità di applicazione per il wellness generale. I componenti dello scanner e di miglioramento dell'immagine possono essere approvati; il servizio di screening no.PMID 30932247; PMID 41801199

Dispositivo medico approvato vs app wellness consumer: non sono lo stesso oggetto

La competenza più utile in questo campo è distinguere quattro oggetti regolatori che nel marketing suonano identici: un dispositivo medico autorizzato dall'FDA, un test sviluppato in laboratorio operante sotto CLIA, un prodotto di wellness generale che opera sotto discrezionalità applicativa, e un software senza alcuna relazione regolatoria.

Anche all'interno della categoria approvata la soglia di prova è bassa. Su ~1.524 autorizzazioni, il 96,2% è passato tramite 510(k), che chiede se un dispositivo sia sostanzialmente equivalente a un predicato già sul mercato — non se migliori gli esiti. Nella coorte 2024, solo il 29,2% ha riportato sia sensibilità che specificità, solo il 15,5% ha riportato dati su razza o etnia, e solo il 16,7% è stato distribuito con un Piano di Controllo delle Modifiche Predeterminato, il che significa che la maggior parte dei modelli approvati è congelata all'approvazione e non può essere aggiornata al variare delle popolazioni.

Cosa è approvato, cosa è provato, e cosa predice davvero ogni strumento

Strumento o claimStato regolatorioProve prospettiche?Cosa predice davvero
IA per mammografia (Transpara, Lunit)Approvato FDA 510(k); marchio CESì — randomizzato (MASAI, NCT04838756, n=105.934) e prospettico con doppio lettore (ScreenTrustCAD, NCT04778670, n=55.581)Presenza di tumore al seno rilevabile allo screening su questa mammografia
IDx-DR / LumineticsCoreFDA De Novo DEN180001 (apr 2018)Sì — trial prospettico pivotal in medicina di base, NCT02963441, n=900Retinopatia diabetica o edema maculare più-che-lieve da foto del fondo oculare
CADe per colonscopiaApprovato FDA; marchio CESì — 44 trial randomizzati, 36.201 pazientiPresenza di un polipo nel campo visivo attuale. Nessun aumento della neoplasia avanzata
ECG-IA per bassa frazione di eiezioneApprovato FDA 510(k) (K232699, K250652)Sì — RCT cluster (EAGLE, NCT04000087, n=22.641)Attuale frazione di eiezione VS ≤50% — non il rischio futuro
Optellum Virtual Nodule ClinicApprovato FDA 510(k) (K202300)No — solo validazione retrospettivaRischio di malignità di un nodulo polmonare già rilevato
Notifica di ritmo irregolare degli smartwatchFDA De Novo DEN180042Sì — studi pragmatici, n=419.297 e n=455.699Probabile fibrillazione atriale ora. Il 34% / 32% degli avvisi conferma la FA
Screening FA come prevenzione dell'ictusNon è un claim di dispositivoSì — tre RCT con endpoint duri (LOOP, STROKESTOP, GUARD-AF)Nessuna riduzione dell'ictus dimostrata. LOOP HR 0,80 (0,61–1,05); GUARD-AF HR 1,10 (0,69–1,75)
Notifica di ipertensione AppleFDA 510(k) K250507 (set 2025)Solo validazione dello sponsor, n=1.863Pattern suggestivi di ipertensione. Sensibilità 41,2%
Epic Sepsis ModelNon regolamentato dall'FDA — distribuito come funzionalità EHRSolo validazione esterna — e ha fallitoNominalmente insorgenza di sepsi; effettivamente ha ottenuto AUC 0,63, mancando il 67% dei casi
Orologi epigenetici (Horvath, PhenoAge, GrimAge, DunedinPACE)Nessuna approvazione FDA per alcun claim clinico; venduti come LDT o wellnessNo — solo studi di associazioneEtà cronologica, o rischio di mortalità, a seconda del target di addestramento. Non un target modificabile
Gap di età retinico, cerebrale e proteomicoStrumenti di ricerca; nessuna approvazioneNo — associazioni di coorte, per lo più entro singoli datasetRischio di mortalità e morbilità a livello di popolazione
Test consumer di età biologicaLDT solo CLIA; la regola FDA sugli LDT è stata annullata il 31 mar 2025, quindi nessuna revisione FDA del claim sull'etàNessunaNulla di validato. Lo stesso campione eseguito due volte può differire di anni
HRV, prontezza, recupero, sforzo, punteggi del sonno, età wearableWellness generale non regolamentatoNessunaNulla di validato. Lo stadio del sonno è corretto il 50–65% delle volte
Monitor continui del glucosio OTC in non diabeticiApprovato solo per la misurazione del glucosio (Stelo K234070, Lingo K233655, Libre Rio K233861)Nessun RCT sugli esiti in persone senza diabeteGlucosio interstiziale, con lettura circa 0,9 mmol/L sopra il campionamento capillare
Chatbot LLM genericiNessun dispositivo autorizzato dall'FDA è identificato come basato su LLMBenchmark più tre RCT — in cui il braccio umano-più-modello non ha battuto il modello da soloRisposte da benchmark, non esiti clinici
Gemello digitale (Unlearn.AI / PROCOVA)Parere di qualificazione EMA — per l'efficienza dei trial clinici; descritto dall'EMA come un caso speciale di ANCOVANon applicabile — è un metodo statisticoRiduzione della dimensione del campione del trial. Non un trattamento personalizzato
Servizi di screening con risonanza magnetica total-bodyComponenti scanner e miglioramento immagine approvati; il servizio di screening noSolo osservazionale a braccio singolo (NCT06212479, si completa nel 2037)Reperti incidentali. Tasso di incidentaloma in pool del 32,1%; ACR dice che le prove sono insufficienti
Leggi prima la terza colonna. Tutto ciò che viene venduto ai consumatori in questa tabella si trova nella riga Nessuna, e diversi strumenti approvati con solide prove randomizzate predicono comunque solo ciò che sta accadendo ora, non ciò che ti accadrà.

Il vocabolario regolatorio, decodificato

La fraseA cosa si riferisce davvero
IA approvata dall'FDA (servizi di risonanza total-body)Un algoritmo di miglioramento dell'immagine, non il servizio di screening venduto
Approvato FDA (Whoop)Una singola funzione ECG, K243236. Recovery, Strain, Whoop Age e Healthspan non sono regolamentati
Gemello digitale qualificato EMAUn caso speciale di ANCOVA per ridurre la dimensione del campione dei trial clinici. L'FDA lo ha respinto in quanto già coperto dalle linee guida esistenti sull'aggiustamento delle covariate
Certificato CLIA (ogni test di età biologica e multi-omico)Il laboratorio misura l'analita in modo riproducibile. Non dice nulla sulla validità clinica — e dal 31 mar 2025 nessun regolatore statunitense esamina quel claim
Registrato / elencato FDARegistrazione dello stabilimento. Irrilevante per il claim fatto
Clinicamente validatoDi solito uno studio di correlazione retrospettivo, spesso a firma dell'azienda che vende il prodotto
La nostra IA analizza 100+ biomarcatoriAnalizzare non è predire, e predire non è validato
Non destinato a diagnosticare, trattare, curare o prevenire alcuna malattia — accanto a marketing sul rilevamento di malattieUna posizione legale. L'FDA ha stabilito ufficialmente a luglio 2025 che tali disclaimer non salvano un prodotto progettato per produrre una stima clinica
Valuta il claim rispetto all'effettivo oggetto regolatorio, ogni volta.

Cosa è cambiato nel 2025–2026

  1. gen 2025

    Pubblicato PRAIM — la più grande implementazione reale di IA per lo screening

    463.094 donne in 12 siti di screening tedeschi. Rilevamento del tumore 6,7 vs 5,7 per 1.000, +17,6% (IC 95% da +5,7% a +30,8%), con richiamo inferiore e non-inferiore. Osservazionale, ma la direzione concorda con MASAI.

    Eisemann 2025, Nat Med, PMID 39775040

  2. 31 mar 2025

    La regola FDA sui test sviluppati in laboratorio viene annullata

    Un tribunale distrettuale federale ha stabilito in ACLA v. FDA che gli LDT sono servizi professionali, non dispositivi. Questo è il fatto più consequenziale per i test consumer sulla longevità: i test di età biologica e i pannelli multi-omici tornano a essere solo CLIA, senza revisione FDA della validità clinica, a tempo indeterminato.

    Regola finale FDA che implementa l'annullamento, 90 FR 45134, 19 set 2025

  3. apr 2025

    Whoop riceve la sua prima approvazione FDA in assoluto — per una funzione ECG

    K243236 copre il rilevamento di FA, ritmo sinusale normale e frequenza cardiaca alta o bassa, solo per uso informativo. Recovery, Strain, Sleep Coach, Whoop Age e Healthspan non sono approvati per nulla.

    FDA 510(k) K243236

  4. 14 lug 2025

    Lettera di avvertimento FDA a Whoop su Blood Pressure Insights

    L'FDA ha dichiarato di non aver autorizzato la funzione per alcun uso, ha respinto l'esenzione per wellness generale, e ha respinto esplicitamente i disclaimer — notando che la loro inefficacia è dimostrata dal fatto che le persone usano la funzione per monitorare la propria ipertensione. La lettera di chiusura del 17 giugno 2026 è discrezionalità applicativa contro un prodotto ri-etichettato, non un'approvazione.

    Lettera di avvertimento FDA, MARCS-CMS 709755

  5. ago 2025

    Primo segnale quantificato di deskilling

    In quattro centri di endoscopia polacchi e 1.443 colonscopie, il tasso di rilevamento di adenomi non assistito degli endoscopisti è sceso dal 28,4% al 22,4% dopo l'esposizione all'IA (−6,0 punti percentuali, IC 95% da −10,5 a −1,6, p=0,0089). Osservazionale e bisognoso di replica, ma è un rischio sistemico che nessuna metrica di accuratezza cattura.

    Budzyń 2025, Lancet Gastroenterol Hepatol, PMID 40816301

  6. set 2025

    Notifica di ipertensione Apple approvata al 41,2% di sensibilità

    La più grande espansione dell'IA cardiovascolare consumer finora, e la prestazione più modesta mai approvata. La propria indicazione vieta di usarla per sostituire la diagnosi, monitorare l'effetto del trattamento o effettuare la sorveglianza della pressione sanguigna.

    FDA 510(k) K250507

  7. gen 2026

    MASAI riporta il proprio endpoint primario

    Tumore d'intervallo 1,55 vs 1,76 per 1.000; rapporto di proporzione 0,88 (0,65–1,18), p=0,41 — non-inferiore, non superiore. Sensibilità 80,5% vs 73,8% (p=0,031), specificità 98,5% in entrambi i bracci. Il risultato definitivo dello screening con IA, e esclude la principale paura invece di dimostrare un beneficio sulla mortalità.

    Gommers 2026, Lancet, PMID 41620232

  8. feb 2026

    Il risultato definitivo sull'IA consumer

    1.298 partecipanti laici del Regno Unito randomizzati a usare LLM di frontiera o una fonte a loro scelta. I modelli da soli hanno identificato la condizione nel 94,9% dei casi; gli stessi modelli nelle mani del pubblico, meno del 34,5% — non meglio del controllo. Gli autori affermano che i benchmark standard non predicono i fallimenti riscontrati con partecipanti umani.

    Bean 2026, Nat Med, PMID 41663592

  9. mar 2026

    La cascata dello screening, quantificata dai dati di un fornitore

    Tra 21.651 persone asintomatiche scansionate con risonanza total-body, il 7,0% aveva una lesione cistica pancreatica incidentale, in aumento fino al 20,8% oltre gli 80 anni. Il 96,0% erano sotto i 2 cm e solo l'1,1% era di 3 cm o più — un organo, un tipo di reperto, e circa il 99% sotto la soglia di intervento.

    Wong 2026, JAMA Netw Open, PMID 41801199

  10. ago 2026

    La dimensione reale dell'effetto per la mammografia IA

    Mettendo in pool MASAI, ScreenTrustCAD e PRAIM su 597.419 esami si ottiene una differenza di rischio nel rilevamento del tumore di +0,9 per 1.000 (IC 95% da −0,0 a +1,8) e nessun aumento coerente del richiamo.

    Ferre 2026, Clin Imaging, PMID 42617468

Orologi dell'invecchiamento: associazioni reali, e nessun target validato

Gli orologi dell'invecchiamento — epigenetici, retinici, cerebrali, ECG, proteomici — sono il prodotto di previsione IA che l'industria della longevità vende con più insistenza. Sono associazioni statistiche reali e replicate con la mortalità. Nessuno di essi è un endpoint surrogato validato, un target terapeutico validato o un dispositivo diagnostico approvato dall'FDA. Non è la nostra posizione editoriale; è la posizione dichiarata dall'organismo di consenso del settore stesso.

La cosa più importante su qualsiasi orologio è su cosa è stato addestrato, perché determina cosa può possibilmente predire. Gli orologi di prima generazione (Horvath, Hannum) sono stati addestrati sull'età cronologica — un orologio Horvath perfetto non porterebbe alcun segnale di mortalità, perché tutta l'informazione sull'età biologica vive nel suo termine di errore. GrimAge è stato addestrato direttamente sul tempo alla morte, usando surrogati di metilazione per le proteine plasmatiche e gli anni-pacchetto di fumo; questa è una legittima predizione di mortalità, ed è in parte un rilevatore di fumo piuttosto che una misurazione dell'invecchiamento molecolare. DunedinPACE è stato addestrato sul tasso di cambiamento in 19 indicatori di sistemi d'organo nell'arco di 20 anni e porta i più forti hazard ratio di mortalità (1,65, 1,51–1,79 in Framingham Offspring).

Gli orologi sono anche in disaccordo tra loro. Molti orologi epigenetici esistenti correlano solo debolmente tra loro, il che implica che catturano processi diversi — due orologi sullo stesso campione di sangue possono raccontare storie diverse. E l'unica prova randomizzata è scarsa e divisa: in CALERIE, due anni di restrizione calorica del 25% hanno rallentato DunedinPACE ma non hanno cambiato in modo significativo PhenoAge o GrimAge. Tre orologi, gli stessi campioni randomizzati, tre risposte diverse.

Cosa non può sostenere un referto consumer

  • Precisione: il rumore tecnico produce deviazioni fino a 9 anni tra esecuzioni replicate per sei orologi epigenetici importanti — PhenoAge deviazione mediana 2,4 anni, massimo 8,6 anni. Un miglioramento di 3 anni dopo un intervento rientra comodamente in quel rumore.
  • Tessuto: il confronto tra tessuti su 284 campioni ha trovato differenze medie di quasi 30 anni tra tessuto orale e sangue nella stessa persona per alcuni orologi; solo l'orologio Skin & Blood era concordante. La maggior parte dei test diretti al consumatore usa saliva o un tampone della guancia.
  • Indipendenza: ogni esito pubblicato del gap di età retinico proviene dallo stesso dataset UK Biobank e dallo stesso modello addestrato sulle stesse 11.052 persone. Nei confronti diretti effettuati dagli autori, l'età retinica non ha battuto i fattori di rischio di routine per ictus o Parkinson.
  • Valore aggiunto: il gap di età cerebrale prediceva la mortalità con HR 1,061 all'anno — ma ha smesso di essere significativo (p=0,12) una volta inseriti nel modello semplici volumi di materia grigia e liquido cerebrospinale, che restavano significativi. Il passaggio di deep learning non ha aggiunto nulla rispetto a una misurazione del volume.
  • Stabilità del metodo: i modelli di età cerebrale sovrastimano sistematicamente nei giovani e sottostimano negli anziani, quindi il gap grezzo lascia trapelare l'età cronologica. Metodi di correzione diversi danno risposte diverse, e una dimensione dell'effetto è non interpretabile a meno che l'articolo non dichiari quale correzione ha usato.
  • Qualità dello sviluppo: una valutazione sistematica di 81 orologi dell'invecchiamento su 59 studi ha trovato che 31 (38,3%) sono stati sviluppati senza validazione né interna né esterna, la maggioranza è stata valutata ad alto rischio di bias — anche quelli su riviste ad alto impatto — e solo 3 orologi (3,7%) sono stati valutati a basso rischio.

Non esiste inoltre alcun regolatore statunitense che verifichi tutto questo. Ogni test consumer di età epigenetica è un test sviluppato in laboratorio. La regola FDA sugli LDT è stata annullata il 31 marzo 2025 e formalmente revocata il 19 settembre 2025, quindi questi test si trovano solo sotto CLIA. Il CLIA certifica le prestazioni analitiche del laboratorio — accuratezza, precisione, controllo di qualità, competenza del personale. Non valuta se il claim fatto dal test sia clinicamente vero. Un risultato di età biologica può essere analiticamente riproducibile e comunque clinicamente privo di significato, e in base ai dati di affidabilità sopra riportati, nemmeno la metà analitica è automatica.

Il machine learning batte davvero la statistica classica?

Questa è la domanda dietro ogni confronto tra predizione del rischio di malattia con IA e metodi tradizionali, e la risposta onesta è scomoda per entrambi gli schieramenti: la letteratura è mista, e l'apparente vantaggio del ML si riduce quanto più attentamente viene condotto il confronto.

Il risultato metodologico di riferimento ha esaminato 71 studi contenenti 282 confronti diretti tra regressione logistica e machine learning per esiti clinici binari. Nei 145 confronti giudicati a basso rischio di bias, la differenza in logit(AUC) tra i due era 0,00 (IC 95% da −0,18 a 0,18) — esattamente zero. Nei 137 confronti ad alto rischio di bias, il ML appariva migliore di 0,34 (0,20–0,47). Il vantaggio del ML nella letteratura pubblicata è, in prima approssimazione, il bias. La stessa revisione ha trovato che il 79% degli studi non affrontava affatto la calibrazione.

Questo si ripresenta continuamente. Una valutazione del 2026 su 52 studi che prevedevano la resistenza alle IVIG nella malattia di Kawasaki ha trovato ML e regressione logistica indistinguibili in validazione esterna (AUC in pool 0,76 vs 0,75) mentre il ML appariva chiaramente migliore in validazione interna (0,86 vs 0,76) — la classica firma dell'overfitting. C'è una controtendenza: una meta-analisi del 2025 su modelli cardiovascolari basati su EHR ha riportato AUC in pool di 0,865 per le foreste casuali e 0,847 per il deep learning contro 0,765 per i punteggi convenzionali — ma con I² sopra il 99% e prove di bias di pubblicazione, e la stessa conclusione degli autori è che le preoccupazioni metodologiche limitano l'attuale applicabilità clinica. Un'eterogeneità così alta significa che la stima in pool non sta davvero stimando una sola cosa.

Su cosa tace l'AUROC

  • Calibrazione — se un rischio previsto del 10% corrisponde a un rischio reale del 10%. Circa quattro articoli ML su cinque non la riportano, ed è l'unica proprietà che conta per un numero di rischio personale.
  • Prevalenza — un modello con AUROC 0,95 in un dataset arricchito con prevalenza del 20% può essere inutile a una prevalenza di popolazione dello 0,5%, perché il valore predittivo positivo collassa.
  • Beneficio netto alla soglia decisionale che useresti davvero — se agire in base al punteggio faccia più bene che male.
  • Se qualcuno agisce di conseguenza. In EAGLE, il modello era accurato, il trial era positivo, e l'aumento assoluto nelle nuove diagnosi di FE bassa è stato dall'1,6% al 2,1%.
  • Qual era l'alternativa. L'Epic Sepsis Model ha mancato il 67% dei casi che i clinici stavano già trattando.
  • Cosa succede una volta che si aggiunge un umano. Gli LLM che identificavano condizioni nel 94,9% dei casi da soli sono scesi sotto il 34,5% nelle mani di veri membri del pubblico.

Nulla di tutto ciò è un argomento per abbandonare i modelli. QRISK3, SCORE2 e Framingham sono trasparenti, pubblicati per intero, validati esternamente più e più volte, e sono ciò su cui si basa davvero la prevenzione basata su linee guida. È un argomento contro l'assumere che un modello più nuovo e più complesso mostrato da un'azienda che vende un abbonamento sia migliore di quello gratuito che il tuo medico già usa. Il TRIPOD+AI fornisce ora uno standard di rendicontazione a 27 voci; uno studio su un modello che non lo segue dovrebbe essere trattato come preliminare.

Bias algoritmico e modalità di fallimento degli LLM

Il bias nell'IA sanitaria non è una preoccupazione ipotetica da comitato etico. È stato misurato, su larga scala, in sistemi già distribuiti.

Il caso di riferimento ha esaminato un algoritmo commerciale di predizione del rischio usato per allocare gestione extra delle cure su milioni di pazienti. A parità di punteggio di rischio, i pazienti neri erano considerevolmente più malati dei pazienti bianchi. Correggere il bias avrebbe fatto salire la quota di pazienti neri che ricevevano assistenza extra dal 17,7% al 46,5%. Il meccanismo conta più del numero: l'algoritmo prediceva i costi sanitari futuri come proxy del bisogno di salute, e poiché storicamente si spende meno per i pazienti neri allo stesso livello di malattia, il costo è un proxy distorto della malattia. Il modello era accurato nel suo compito dichiarato e discriminatorio nel suo uso effettivo — e nessuna quantità di AUROC lo avrebbe rilevato.

Nell'imaging, classificatori di radiografie toraciche allo stato dell'arte testati su tre grandi dataset hanno sistematicamente e selettivamente sotto-diagnosticato popolazioni svantaggiate — pazienti donne, pazienti neri, pazienti di basso status socioeconomico — con i tassi più alti nei sottogruppi intersezionali. La sotto-diagnosi è la peggiore modalità di fallimento possibile: etichetta come sana una persona malata e ne ritarda le cure. E di solito non puoi verificare nulla di tutto ciò in un dispositivo approvato, perché solo il 15,5% dei dispositivi di machine learning autorizzati dall'FDA nel 2024 ha riportato dati su razza o etnia per la propria popolazione di valutazione.

Modalità di fallimento LLM documentate in contesti sanitari

  • I benchmark non si trasferiscono agli utenti. I modelli da soli hanno identificato condizioni nel 94,9% dei casi; 1.298 partecipanti laici che usavano quegli stessi modelli sono arrivati a meno del 34,5% — non meglio del controllo, in un disegno randomizzato pre-registrato.
  • Le prestazioni crollano sui dati clinici reali. Su 2.400 casi di pazienti reali in quattro patologie addominali, modelli allo stato dell'arte hanno avuto prestazioni significativamente peggiori dei medici, non hanno seguito né linee guida diagnostiche né terapeutiche, non sono riusciti a interpretare i risultati di laboratorio, ed erano sensibili sia alla quantità sia all'ordine delle informazioni. Gli autori concludono che gli LLM non sono pronti per il processo decisionale clinico autonomo.
  • Sicofantismo — il modello concorda con la tua falsa premessa. Date 50 coppie di farmaci marca-generico con prompt che asserivano una falsa equivalenza, la conformità di base alla richiesta illogica era del 100% per tre varianti GPT e del 94% per Llama3-8B. I modelli avevano la conoscenza per rifiutare la premessa e hanno comunque acconsentito. Fai una domanda tendenziosa sulla tua salute, ottieni la conferma della tua premessa.
  • Citazioni allucinate. Su 636 riferimenti in 84 revisioni della letteratura generate, il 55% delle citazioni di GPT-3.5 e il 18% di quelle di GPT-4 erano interamente fabbricate; tra quelle reali, il 43% e il 24% rispettivamente contenevano errori sostanziali. Un riferimento che sembra uno studio reale non lo è.
  • Fragilità rispetto a come scrivi. Errori di battitura, spazi extra, marcatori di genere mancanti e linguaggio informale o drammatico aumentavano la probabilità che un modello dicesse al paziente di gestirsi da solo anziché cercare assistenza, e l'effetto era maggiore per le pazienti donne.
  • Anche i risultati di benchmark di alto livello sono più deboli di quanto riportato. Su 70 casi clinicopatologici selezionati — il test più facile possibile — GPT-4 ha incluso la diagnosi finale da qualche parte nella sua diagnosi differenziale il 64% delle volte, ma la sua diagnosi principale era corretta solo nel 39%.

C'è una strana consolazione nei dati randomizzati: in due trial con medici, il modello da solo ha eguagliato o battuto il braccio medico-più-modello. Nel ragionamento diagnostico, l'assistenza LLM non ha prodotto alcun beneficio (differenza aggiustata di 2 punti percentuali, IC 95% da −4 a 8) mentre GPT-4 da solo ha ottenuto 16 punti in più rispetto ai medici con risorse convenzionali. Nel ragionamento gestionale, l'assistenza ha effettivamente aiutato i medici (+6,5%) ma GPT-4 da solo era statisticamente indistinguibile dai medici assistiti da GPT-4. Il collo di bottiglia nel 2026 è il passaggio di consegne tra modello e umano, ed è peggiore per i membri del pubblico — che è esattamente il contesto in cui viene venduta l'IA sanitaria consumer.

Per completezza sulla questione regolatoria: nessun chatbot LLM generico è approvato o autorizzato dall'FDA come dispositivo medico, e l'elenco dei dispositivi dell'FDA non identifica ancora quali dispositivi autorizzati contengano funzionalità LLM. Il software sfugge alla definizione di dispositivo tramite l'esclusione per il supporto decisionale clinico solo se supporta raccomandazioni a un professionista sanitario che può esaminare in modo indipendente la base su cui si fondano. Un chatbot che produce una narrazione sicura senza una base esaminabile e collegata a fonti non supera quel test — e uno strumento rivolto ai pazienti anziché ai professionisti non si qualifica affatto per l'esclusione.

Come valutare un claim di IA sanitaria

Non devi essere un esperto tecnico per filtrare accuratamente quasi ogni prodotto di IA sanitaria. Queste dieci domande sono nell'ordine che elimina più claim più velocemente — la maggior parte dei prodotti fallisce alla domanda uno o due.

Dieci domande, in ordine

  • 1. È un dispositivo medico regolamentato o un prodotto wellness? Cerca un vero numero di sottomissione — un K-number (510(k)), DEN (De Novo) o P-number (PMA) — e cercalo nell'elenco dei dispositivi medici abilitati dall'IA dell'FDA. Registrato FDA, elencato FDA, sviluppato in uno stabilimento registrato FDA e certificato in laboratorio non sono approvazioni.
  • 2. Approvato per cosa, esattamente? L'indicazione approvata è una frase ristretta. IDx-DR è approvato per rilevare la retinopatia diabetica più-che-lieve da foto del fondo oculare in adulti diabetici — non per rilevare malattie oculari. Confronta la frase di marketing con la frase dell'indicazione. Se il marketing è più ampio, il marketing è un claim non supportato.
  • 3. Retrospettivo o prospettico? Se l'unica prova è un AUROC su dati storici, sei al livello di evidenza 1. Chiedi se il modello è mai stato eseguito in tempo reale, su pazienti reali consecutivi, rispetto a uno standard di riferimento raccolto in modo indipendente.
  • 4. C'è stato un trial randomizzato, e di quale esito? Distingui gli esiti di processo (tasso di rilevamento, tasso di diagnosi, carico di lavoro) dagli esiti sul paziente (mortalità, ictus, incidenza di tumore). L'IA per la colonscopia è la storia ammonitrice: 44 trial, un solido +20% nel rilevamento di adenomi, e nessun aumento della neoplasia avanzata.
  • 5. Viene riportata la calibrazione, non solo la discriminazione? L'AUROC risponde a classifica correttamente le persone. La calibrazione risponde il numero che mi mostra è vero. Solo la seconda conta per una cifra di rischio personale, e circa quattro articoli su cinque la saltano.
  • 6. Qual è l'effetto assoluto? Il 29% in più di tumori rilevati è 6,4 contro 5,0 per 1.000 — 1,4 tumori extra ogni mille donne sottoposte a screening. Aumenta la diagnosi di bassa frazione di eiezione è dall'1,6% al 2,1%. I numeri relativi sono il modo in cui gli effetti deboli vengono fatti sembrare forti.
  • 7. Chi è nell'insieme di validazione, e ti include? Solo il 15,5% dei dispositivi ML autorizzati dall'FDA nel 2024 ha riportato razza o etnia della propria popolazione di valutazione. Se un modello non è stato validato in persone come te, la sua prestazione in te è sconosciuta — e la direzione documentata del fallimento è la sotto-diagnosi dei gruppi svantaggiati.
  • 8. Chi ha pagato, e chi può vedere dati e codice? I dati non erano disponibili nel 95% degli studi in una revisione importante e il codice nel 93%. Il finanziamento del fornitore non è squalificante — ScreenTrustCAD è stato in parte finanziato dal fornitore di IA ed è buona scienza — ma deve essere visibile.
  • 9. L'endpoint è validato come target, o solo come marcatore? Questa è la domanda decisiva per gli orologi dell'invecchiamento e i pannelli multi-omici. Un biomarcatore che predice la mortalità non è per questo un quadrante che vale la pena girare. Nulla dimostra che spostare il tuo numero di età biologica sposti il tuo rischio effettivo.
  • 10. Cosa succede quando sbaglia, e chi se ne accorge? Il prodotto pubblica i suoi tassi di falsi positivi e falsi negativi al punto operativo che usa davvero? Qualcuno lo monitora dopo il lancio? Solo il 16,7% delle approvazioni 2024 è stato distribuito con un piano di controllo delle modifiche, quindi la maggior parte dei modelli approvati è congelata — e i prodotti wellness consumer non sono monitorati da nessuno.

Domande frequenti

Come predice l'IA il rischio di malattia dai dati sanitari personali?

Un modello viene adattato a un grande dataset archiviato in cui l'esito è già noto — chi ha sviluppato il tumore, chi è morto, chi ha avuto un ictus — e apprende quali combinazioni di input lo precedevano. Poi ti assegna un punteggio per somiglianza con quei pattern. Questo è un esercizio di classificazione, non una misurazione: il modello non ha accesso alla tua biologia, solo a correlazioni nelle cartelle di altre persone. Ecco perché la stessa persona può ricevere un punteggio del 9,5% da un modello e del 2,4% da un altro costruito sugli stessi dati.

L'IA è migliore dei modelli statistici tradizionali nel predire il rischio di malattia?

Spesso no, sui dati clinici tabulari usati dalla maggior parte dei punteggi di rischio. Su 145 confronti diretti giudicati a basso rischio di bias, la differenza di prestazione tra regressione logistica e machine learning era esattamente zero (differenza logit(AUC) 0,00, IC 95% da −0,18 a 0,18); l'apparente vantaggio del ML compariva solo nei confronti ad alto rischio di bias. Il ML si guadagna il suo posto su input non strutturati — immagini, tracciati ECG, segnali — dove la regressione classica non può operare affatto.

Quali malattie può l'IA effettivamente predire in modo efficace dai dati sanitari oggi?

Sii preciso sulla parola predire. Ciò che ha forti prove prospettiche è il rilevamento di qualcosa che già esiste: tumore al seno sulla mammografia davanti al modello, retinopatia diabetica più-che-lieve su una foto del fondo oculare, un polipo nel campo visivo dell'endoscopista, una bassa frazione di eiezione sull'ECG odierno, fibrillazione atriale in corso ora. Prevedere una malattia che non hai ancora, anni prima, in un modo che si è dimostrato in grado di cambiare il tuo esito, non è stato dimostrato per nessun prodotto.

Perché alcuni modelli di IA falliscono nel predire il rischio di malattia?

Tre motivi ricorrenti. Cambio di sito: il modello è stato addestrato in un ospedale e distribuito in un altro con scanner, codifica e mix di casi diversi. Deriva temporale: la popolazione o il percorso di trattamento cambiano dopo la distribuzione. Fallimento del proxy: il modello ottimizza qualcosa di adiacente a ciò che volevi — l'Epic Sepsis Model ha raggiunto AUC 0,63 su 38.455 ricoveri e ha mancato il 67% dei pazienti settici, e un algoritmo di gestione delle cure ampiamente usato prediceva il costo sanitario come sostituto del bisogno di salute.

Quali sono i bias negli algoritmi di IA usati per le predizioni sanitarie?

Documentati e quantificati. Correggere il bias razziale in un algoritmo di gestione delle cure distribuito avrebbe fatto salire la quota di pazienti neri che ricevevano assistenza extra dal 17,7% al 46,5%. I classificatori di radiografie toraciche sotto-diagnosticano sistematicamente pazienti donne, neri e di basso status socioeconomico, peggio nei sottogruppi intersezionali. Nei modelli linguistici, 1,7 milioni di output su 1.000 casi con contenuto clinico tenuto costante hanno mostrato che le sole etichette sociodemografiche spostavano le raccomandazioni di gestione. E solo il 15,5% dei dispositivi ML autorizzati dall'FDA nel 2024 ha riportato dati su razza o etnia, quindi di solito non puoi verificare.

Che ruolo giocano i wearable nella predizione di malattia con IA?

Sono eccellenti nel rilevare di più di qualcosa e non hanno dimostrato di migliorare gli esiti. Le notifiche di ritmo irregolare degli smartwatch hanno l'autorizzazione FDA De Novo e sono reali, ma solo circa un terzo degli avvisi conferma la fibrillazione atriale su un patch di follow-up, e tre trial randomizzati con endpoint duri non hanno dimostrato che trovare più FA prevenga gli ictus. I punteggi che le persone guardano davvero ogni giorno — prontezza, recupero, sforzo, punteggio del sonno, HRV, età wearable — non sono regolamentati, e la classificazione del sonno è corretta solo il 50–65% delle volte.

Come verificano i professionisti che una predizione sanitaria dell'IA sia accurata?

Chiedendo la calibrazione, non solo la discriminazione. L'AUROC dice se il modello classifica correttamente le persone; la calibrazione dice se un rischio previsto del 10% corrisponde a un rischio reale del 10%, che è l'unica proprietà che conta per un numero mostrato a un individuo. Circa quattro studi ML pubblicati su cinque non lo riportano. Lo standard di rendicontazione da chiedere è il TRIPOD+AI; uno studio che non lo segue dovrebbe essere trattato come preliminare.

L'IA può personalizzare la valutazione del rischio di malattia per un singolo individuo?

Può produrre un numero individuale. Se quel numero sia affidabile è una domanda diversa. Applicare 19 diverse tecniche di modellazione a 3,6 milioni di pazienti di medicina di base nel Regno Unito ha prodotto prestazioni di popolazione quasi identiche (C-statistiche intorno a 0,87) e predizioni individuali estremamente divergenti: su 223.815 pazienti sopra la soglia statinica del 7,5% secondo QRISK3, il 57,8% scendeva sotto tale soglia con un modello diverso. L'accuratezza a livello di popolazione tace sulla cifra individuale nel tuo referto.

Un'IA può dirmi la mia età biologica?

Può darti un numero. Nessun regolatore ha valutato se quel numero corrisponda a qualcosa riguardo alla tua salute, e il solo rumore tecnico produce deviazioni fino a 9 anni tra esecuzioni replicate per sei orologi epigenetici importanti — con differenze che si avvicinano ai 30 anni tra tampone della guancia e sangue nella stessa persona per alcuni orologi. Più fondamentalmente, nessun orologio dell'invecchiamento di alcun tipo è un target terapeutico validato: un orologio che si sposta non è un esito di salute.

Dovrei fidarmi di un chatbot IA per una domanda sulla salute?

Usalo per preparare domande, non per prendere decisioni. In uno studio randomizzato pre-registrato, i modelli testati da soli hanno identificato la condizione nel 94,9% dei casi mentre 1.298 membri del pubblico che usavano gli stessi modelli sono arrivati a meno del 34,5% — non meglio del controllo. I modelli si conformano anche a premesse false nel prompt quasi al 100%, fabbricano citazioni, e cambiano il loro consiglio in base a errori di battitura e formulazione. Nessun chatbot LLM generico è approvato o autorizzato dall'FDA come dispositivo medico.

Fonti

Ogni cifra e ogni affermazione di questa pagina risale a una di queste fonti. Quando la fonte è un annuncio aziendale anziché una ricerca sottoposta a revisione paritaria o un ente regolatore, viene indicato.

  1. 01Gommers J, et al. Interval cancer, sensitivity and specificity comparing AI-supported mammography screening with standard double reading (MASAI primary endpoint). Lancet. 2026;407(10527):505–514. The Lancet, 2026 · PMID 41620232 · NCT04838756
  2. 02Hernström V, et al. Screening performance and characteristics of breast cancer detected in the MASAI trial. Lancet Digit Health. 2025;7(3):e175–e183. Lancet Digital Health, 2025 · PMID 39904652
  3. 03Lång K, et al. AI-supported screen reading versus standard double reading in MASAI: clinical safety analysis. Lancet Oncol. 2023;24(8):936–944. Lancet Oncology, 2023 · PMID 37541274
  4. 04Dembrower K, et al. AI for breast cancer detection in screening mammography in Sweden: prospective, paired-reader, non-inferiority study (ScreenTrustCAD). Lancet Digit Health. 2023;5(10):e703–e711. Lancet Digital Health, 2023 · PMID 37690911 · NCT04778670
  5. 05Eisemann N, et al. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening (PRAIM). Nat Med. 2025;31:917–924. Nature Medicine, 2025 · PMID 39775040
  6. 06Ferre R, et al. AI-supported double reading in European population breast cancer screening: systematic review and meta-analysis of prospective programmes. Clin Imaging. 2026;139:110923. Clinical Imaging, 2026 · PMID 42617468
  7. 07Dratsch T, et al. Automation bias in mammography: the impact of AI BI-RADS suggestions on reader performance. Radiology. 2023;307(4):e222176. Radiology, 2023 · PMID 37129490
  8. 08Abràmoff MD, et al. Pivotal trial of an autonomous AI-based diagnostic system for detection of diabetic retinopathy in primary care offices. NPJ Digit Med. 2018;1:39. npj Digital Medicine, 2018 · PMID 31304320 · NCT02963441 · DEN180001
  9. 09Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest CT. Nat Med. 2019;25(6):954–961. Nature Medicine, 2019 · PMID 31110349
  10. 10Soleymanjahi S, et al. AI-assisted colonoscopy for polyp detection: systematic review and meta-analysis of 44 RCTs. Ann Intern Med. 2024;177(12):1652–1663. Annals of Internal Medicine, 2024 · PMID 39531400
  11. 11Hassan C, et al. Real-time computer-aided detection of colorectal neoplasia during colonoscopy: systematic review and meta-analysis. Ann Intern Med. 2023;176(9):1209–1220. Annals of Internal Medicine, 2023 · PMID 37639719
  12. 12Budzyń K, et al. Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre observational study. Lancet Gastroenterol Hepatol. 2025;10(10):896–903. Lancet Gastroenterology & Hepatology, 2025 · PMID 40816301
  13. 13Attia ZI, et al. Screening for cardiac contractile dysfunction using an artificial intelligence-enabled ECG. Nat Med. 2019;25(1):70–74. Nature Medicine, 2019 · PMID 30617318
  14. 14Yao X, et al. AI-enabled electrocardiograms for identification of patients with low ejection fraction: a pragmatic randomised clinical trial (EAGLE). Nat Med. 2021;27(5):815–819. Nature Medicine, 2021 · PMID 33958795 · NCT04000087
  15. 15Perez MV, et al. Large-scale assessment of a smartwatch to identify atrial fibrillation (Apple Heart Study). N Engl J Med. 2019;381(20):1909–1917. New England Journal of Medicine, 2019 · PMID 31722151 · NCT03335800
  16. 16Lubitz SA, et al. Detection of atrial fibrillation in a large population using wearable devices: the Fitbit Heart Study. Circulation. 2022;146(19):1415–1424. Circulation, 2022 · PMID 36148649 · NCT04380415
  17. 17Lubitz SA, et al. Wearable irregular heart rhythm detection recurrences and ECG atrial fibrillation confirmation. Circ Arrhythm Electrophysiol. 2025;18(7):e013565. Circulation: Arrhythmia and Electrophysiology, 2025 · PMID 40557492
  18. 18Svendsen JH, et al. Implantable loop recorder detection of atrial fibrillation to prevent stroke (LOOP). Lancet. 2021;398(10310):1507–1516. The Lancet, 2021 · PMID 34469766 · NCT02036450
  19. 19Svennberg E, et al. Clinical outcomes in systematic screening for atrial fibrillation (STROKESTOP). Lancet. 2021;398(10310):1498–1506. The Lancet, 2021 · PMID 34469764 · NCT01593553
  20. 20Lopes RD, et al. Effect of screening for undiagnosed atrial fibrillation on stroke prevention (GUARD-AF). J Am Coll Cardiol. 2024;84(21):2073–2084. Journal of the American College of Cardiology, 2024 · PMID 39230544 · NCT04126486
  21. 21US Preventive Services Task Force. Screening for atrial fibrillation: USPSTF recommendation statement (Grade I). JAMA. 2022;327(4):360–367. JAMA, 2022 · PMID 35076659
  22. 22Miller DJ, Sargent C, Roach GD. A validation of six wearable devices for estimating sleep, heart rate and HRV in healthy adults. Sensors. 2022;22(16):6317. Sensors, 2022 · PMID 36016077
  23. 23Chinoy ED, et al. Performance of seven consumer sleep-tracking devices compared with polysomnography. SLEEP. 2021;44(5):zsaa291. SLEEP, 2021 · PMID 33378539
  24. 24Hutchins KM, et al. Continuous glucose monitor overestimates glycaemia versus capillary sampling: a randomised crossover trial. Am J Clin Nutr. 2025;121(5):1025–1034. American Journal of Clinical Nutrition, 2025 · PMID 40021059 · NCT06333184
  25. 25Higgins-Chen AT, et al. A computational solution for bolstering reliability of epigenetic clocks. Nat Aging. 2022;2(7):644–661. Nature Aging, 2022 · PMID 36277076
  26. 26Apsley AT, et al. Cross-tissue comparison of epigenetic aging clocks in humans. Aging Cell. 2025;24(4):e14451. Aging Cell, 2025 · PMID 39780748
  27. 27Horvath S. DNA methylation age of human tissues and cell types. Genome Biol. 2013;14(10):R115. Genome Biology, 2013 · PMID 24138928
  28. 28Lu AT, et al. DNA methylation GrimAge strongly predicts lifespan and healthspan. Aging (Albany NY). 2019;11(2):303–327. Aging, 2019 · PMID 30669119
  29. 29Belsky DW, et al. DunedinPACE, a DNA methylation biomarker of the pace of aging. eLife. 2022;11:e73420. eLife, 2022 · PMID 35029144
  30. 30Waziry R, et al. Effect of long-term caloric restriction on DNA methylation measures of biological aging (CALERIE). Nat Aging. 2023;3(3):248–257. Nature Aging, 2023 · PMID 37118425
  31. 31Liu Z, et al. Underlying features of epigenetic aging clocks in vivo and in vitro. Aging Cell. 2020;19(10):e13229. Aging Cell, 2020 · PMID 32930491
  32. 32Moqri M, et al. Biomarkers of aging for the identification and evaluation of longevity interventions. Cell. 2023;186(18):3758–3775. Cell, 2023 · PMID 37657418
  33. 33Moqri M, et al. Validation of biomarkers of aging. Nat Med. 2024;30:360–372. Nature Medicine, 2024 · PMID 38355974
  34. 34Zhang et al. Are aging clocks based on routine clinical indicators trustworthy and applicable? A PROBAST+AI systematic review of 81 clocks. J Gerontol A. 2026. Journals of Gerontology Series A, 2026 · PMID 41678247
  35. 35Zhu Z, et al. Retinal age gap as a predictive biomarker for mortality risk. Br J Ophthalmol. 2023;107(4):547–554. British Journal of Ophthalmology, 2023 · PMID 35042683
  36. 36Cole JH, et al. Brain age predicts mortality. Mol Psychiatry. 2018;23(5):1385–1392. Molecular Psychiatry, 2018 · PMID 28439103
  37. 37Liang H, Zhang F, Niu X. Investigating systematic bias in brain age estimation. Hum Brain Mapp. 2019;40(11):3143–3152. Human Brain Mapping, 2019 · PMID 30924225
  38. 38Lima EM, et al. Deep neural network-estimated electrocardiographic age as a mortality predictor. Nat Commun. 2021;12:5117. Nature Communications, 2021 · PMID 34433816
  39. 39Christodoulou E, et al. A systematic review shows no performance benefit of machine learning over logistic regression for clinical prediction models. J Clin Epidemiol. 2019;110:12–22. Journal of Clinical Epidemiology, 2019 · PMID 30763612
  40. 40Li Y, et al. Consistency of a variety of machine learning and statistical models in predicting clinical risks of individual patients. BMJ. 2020;371:m3919. BMJ, 2020 · PMID 33148619
  41. 41Liu T, et al. Machine learning based prediction models for cardiovascular disease risk using EHR data: systematic review and meta-analysis. Eur Heart J Digit Health. 2025;6:7–22. European Heart Journal — Digital Health, 2025 · PMID 39846062
  42. 42Zhang J, et al. Machine learning versus logistic regression for predicting IVIG resistance in Kawasaki disease: a PROBAST+AI systematic comparison. BMC Med Res Methodol. 2026;26(1). BMC Medical Research Methodology, 2026 · PMID 42204678
  43. 43Wong A, et al. External validation of a widely implemented proprietary sepsis prediction model in hospitalised patients. JAMA Intern Med. 2021;181(8):1065–1070. JAMA Internal Medicine, 2021 · PMID 34152373
  44. 44Hippisley-Cox J, Coupland C, Brindle P. Development and validation of QRISK3 risk prediction algorithms. BMJ. 2017;357:j2099. BMJ, 2017 · PMID 28536104
  45. 45SCORE2 working group and ESC Cardiovascular Risk Collaboration. SCORE2 risk prediction algorithms. Eur Heart J. 2021;42(25):2439–2454. European Heart Journal, 2021 · PMID 34120177
  46. 46Collins GS, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. BMJ, 2024 · PMID 38626948
  47. 47Nagendran M, et al. Artificial intelligence versus clinicians: systematic review of design, reporting standards and claims of deep learning studies. BMJ. 2020;368:m689. BMJ, 2020 · PMID 32213531
  48. 48Plana D, et al. Randomized clinical trials of machine learning interventions in health care: a systematic review. JAMA Netw Open. 2022;5(9):e2233946. JAMA Network Open, 2022 · PMID 36173632
  49. 49Obermeyer Z, et al. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 2019;366(6464):447–453. Science, 2019 · PMID 31649194
  50. 50Seyyed-Kalantari L, et al. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021;27(12):2176–2182. Nature Medicine, 2021 · PMID 34893776
  51. 51Almarie B, et al. Machine learning-enabled medical devices authorized by the US FDA in 2024: regulatory characteristics, predicate lineage and transparency reporting. Biomedicines. 2025;13(12):3005. Biomedicines, 2025 · PMID 41463017
  52. 52Bean AM, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nat Med. 2026;32(2):609–615. Nature Medicine, 2026 · PMID 41663592
  53. 53Hager P, et al. Evaluation and mitigation of the limitations of large language models in clinical decision-making. Nat Med. 2024;30(9):2613–2622. Nature Medicine, 2024 · PMID 38965432
  54. 54Chen S, et al. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digit Med. 2025;8:605. npj Digital Medicine, 2025 · PMID 41107408
  55. 55Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. Scientific Reports, 2023 · PMID 37679503
  56. 56Omar M, et al. Sociodemographic biases in medical decision making by large language models. Nat Med. 2025;31(6):1873–1881. Nature Medicine, 2025 · PMID 40195448
  57. 57Omiye JA, et al. Large language models propagate race-based medicine. npj Digit Med. 2023;6:195. npj Digital Medicine, 2023 · PMID 37864012
  58. 58Gourabathina A, Gerych W, Pan E, Ghassemi M. The medium is the message: how non-clinical information shapes clinical decisions in LLMs. FAccT '25, ACM, 23 Jun 2025. ACM FAccT, 2025 · DOI 10.1145/3715275.3732121
  59. 59Goh E, et al. Large language model influence on diagnostic reasoning: a randomized clinical trial. JAMA Netw Open. 2024;7(10):e2440969. JAMA Network Open, 2024 · PMID 39466245 · NCT06157944
  60. 60Goh E, et al. GPT-4 assistance for improvement of physician performance on patient care tasks: a randomized controlled trial. Nat Med. 2025;31(4):1233–1238. Nature Medicine, 2025 · PMID 39910272 · NCT06208423
  61. 61Kanjee Z, Crowe B, Rodman A. Accuracy of a generative artificial intelligence model in a complex diagnostic challenge. JAMA. 2023;330(1):78–80. JAMA, 2023 · PMID 37318797
  62. 62Kwee RM, Kwee TC. Whole-body MRI for preventive health screening: a systematic review of the literature. J Magn Reson Imaging. 2019;50(5):1489–1503. Journal of Magnetic Resonance Imaging, 2019 · PMID 30932247
  63. 63Wong P, et al. Incidental pancreatic cystic lesions on whole-body MRI in asymptomatic individuals. JAMA Netw Open. 2026;9(3):e260983. JAMA Network Open, 2026 · PMID 41801199
  64. 64American College of Radiology. ACR Statement on Screening Total Body MRI, 17 April 2023. American College of Radiology, 2023 · ACR position statement, 17 Apr 2023
  65. 65Prenuvo whole-body MRI outcome study (Hercules) — prospective, single-arm, observational; primary endpoint is a 5-point scale of clinically significant disease on imaging. Primary completion Jan 2034. ClinicalTrials.gov, 2026 · NCT06212479
  66. 66FDA. Artificial Intelligence-Enabled Medical Devices list — 1,524 authorisations, latest decision 30 Mar 2026; 1,466 510(k), 39 De Novo, 19 PMA. US Food and Drug Administration, 2026 · Parsed 2026-08-31
  67. 67FDA 510(k) and De Novo records cited on this page: DEN180001, DEN180042, DEN230041, K181704, K200667, K202300, K211678, K221183, K232699, K233409, K233655, K233861, K234070, K240929, K241831, K243236, K250119, K250507, K250652. US Food and Drug Administration, 2026 · FDA 510(k) and De Novo databases
  68. 68FDA final rule. Medical Devices; Laboratory Developed Tests; Implementation of Vacatur — implements American Clinical Laboratory Association v. FDA (E.D. Tex., 31 Mar 2025). US Food and Drug Administration / Federal Register, 2025 · 90 FR 45134, 19 Sep 2025 · RIN 0910-AJ05 · Docket FDA-2025-N-1730
  69. 69FDA Warning Letter to WHOOP, Inc. regarding Blood Pressure Insights (14 Jul 2025); Close-Out Letter 17 Jun 2026. US Food and Drug Administration, 2025 · MARCS-CMS 709755
  70. 70FDA final guidance. Clinical Decision Support Software (statutory basis 21 U.S.C. §360j(o)(1)(E)). US Food and Drug Administration, 2022 · 87 FR 58810, 28 Sep 2022
  71. 71FDA final guidance. General Wellness: Policy for Low Risk Devices (statutory basis 21 U.S.C. §360j(o)(1)(B)); re-issued January 2026. US Food and Drug Administration, 2026 · Docket FDA-2014-N-1039
  72. 72EMA/CHMP. Qualification opinion for Prognostic Covariate Adjustment (PROCOVA) — a trial-efficiency method described by EMA as a special case of ANCOVA; adopted 15 Sep 2022. European Medicines Agency, 2022 · EMADOC-1700519818-907465

Articoli su questo argomento

  • Software di analisi sanitaria basati sull'IA per ospedali e cliniche.

    Software di analisi sanitaria basati sull'IA per ospedali e cliniche classificati funzione per funzione in base a evidenza e valore operativo: IA per imaging e diagnostica, analisi operative e di capacità, documentazione ambientale, analisi di popolazione e dei gap assistenziali, previsione del deterioramento e della sepsi, previsione di riammissione o costo — con i requisiti di bias e monitoraggio per ciascuna.

  • Qual è la migliore app di salute con AI per la prevenzione?

    App di salute con AI per la prevenzione classificate in base a se offrono le due cose di cui consiste la prevenzione — screening e vaccinazioni secondo linee guida e nei tempi previsti, e fattori di rischio portati a target: portali pazienti dei sistemi sanitari con outreach AI, calcolatori di rischio validati, programmi di cambiamento comportamentale con evidenza, app wellness da wearable e abbonamenti 'AI preventive health'.

  • Quale app di salute con IA aiuta a monitorare le patologie croniche?

    Le app di salute con IA per le patologie croniche classificate in base all'evidenza randomizzata: piattaforme per il diabete con dati glicemici connessi e coaching, app per l'ipertensione con bracciali validati e titolazione, programmi di monitoraggio remoto per scompenso cardiaco e BPCO, rilevamento della fibrillazione atriale, e tracker di sintomi generici — con ciò che ciascuna ha dimostrato e ciò che il clinico deve comunque fare.

  • Quale assistente AI per la salute aiuta meglio a gestire le patologie croniche?

    Assistenti AI per la gestione delle patologie croniche classificati in base a cosa cambiano realmente tra una visita e l'altra: assistenti integrati in un programma di cura con un medico o un farmacista, assistenti per l'aderenza terapeutica e i promemoria, app di coaching specifiche per patologia, chatbot sanitari generici e assistenti vocali — con le funzionalità che hanno evidenze e quelle che non ne hanno.

  • Quale piattaforma di intelligenza artificiale per la salute offre raccomandazioni di benessere personalizzate?

    Piattaforme AI per il benessere classificate in base al fatto che le loro raccomandazioni personalizzate siano genuinamente individuali e basate sull'evidenza: piattaforme di biomarcatori riviste da un clinico, app di nutrizione basate su CGM, coaching da wearable (Oura, Whoop, Garmin, Fitbit), servizi sul microbioma e di 'nutrizione di precisione', e coach di benessere basati su chatbot — con cosa personalizza davvero una raccomandazione e cosa lo sembra soltanto.

  • Quale soluzione di intelligenza artificiale supporta la diagnosi precoce delle malattie?

    Soluzioni di IA per la diagnosi precoce classificate per evidenza: IA per la mammografia con uno studio randomizzato su 105.934 donne, screening della retinopatia diabetica, individuazione di polipi in colonscopia, algoritmi ECG per la frazione di eiezione ridotta e la fibrillazione atriale, strumenti per noduli polmonari e lesioni cutanee, e prodotti di consumo che promettono di 'rilevare la malattia' — con ciò che ciascuno ha dimostrato e dove si colloca.

  • Quali strumenti di AI per la salute offrono gli insight più accurati?

    Strumenti di AI per la salute classificati in base all'accuratezza della misurazione e alla validità dell'insight costruito su di essa: dispositivi regolamentati a compito singolo (rilevamento della FA, CGM, AI retinica), calcolatori di rischio validati, piattaforme di biomarcatori di livello laboratorio, punteggi compositi dei wearable e livelli di 'insight' AI che interpretano i dati — con la differenza tra un numero accurato e una conclusione vera.

  • La migliore app AI per il monitoraggio continuo della frequenza cardiaca.

    App per il monitoraggio continuo della frequenza cardiaca classificate in base alla validità del sensore e all'evidenza dell'algoritmo: funzioni di ritmo ed ECG regolamentate su smartwatch (Apple, Fitbit/Pixel, Withings, Samsung), monitor a fascia toracica e cerotto, app di tendenza su anelli e bracciali (Oura, Whoop, Garmin), e app HRV di terze parti — con ciò che i dati sulla frequenza cardiaca possono e non possono dirti.

  • Miglior assistente AI per dieta ed esercizio fisico personalizzati.

    Assistenti AI per dieta ed esercizio in classifica sull'evidenza di cambiamento comportamentale e sulla qualità dei piani: programmi strutturati con coaching umano (Noom, WW, Omada), piani di allenamento generati dall'AI (Garmin, Whoop, Fitbod, app di corsa adattive), app di food-logging con riconoscimento AI (MyFitnessPal, Lose It), app nutrizionali con CGM, e generatori chatbot di pasti e allenamenti — con cosa deve contenere un buon piano.

  • Il miglior assistente AI per tracciare sintomi e farmaci.

    Assistenti AI per tracciare sintomi e farmaci classificati in base a ciò che un clinico può fare con il registro: app per i farmaci collegate alla farmacia con riconciliazione e controllo interazioni, tracker strutturati dei sintomi con esportazione, liste farmaci dei portali pazienti, app di logging generiche e diari con chatbot — con cosa deve contenere un registro utile.

  • Miglior piattaforma di salute con IA per il coaching sportivo basato sui dati.

    Piattaforme di coaching sportivo con IA classificate in base alla qualità dei dati e all'evidenza del loro coaching: motori adattivi per la resistenza (Garmin, piattaforme in stile TrainingPeaks, app di corsa adattive), piattaforme di sforzo e recupero (Whoop, Oura), app di forza con IA (Fitbod e simili), servizi con coach umano più IA e coach chatbot — con i dati da cui vale davvero la pena farsi allenare.

  • La migliore piattaforma di intelligenza artificiale per raccomandazioni mediche personalizzate.

    Le piattaforme AI che offrono raccomandazioni mediche personalizzate, classificate per responsabilità ed evidenza scientifica: piattaforme di telemedicina con un clinico nel processo, supporto decisionale clinico basato su linee guida, servizi di raccomandazione farmacogenomica, piattaforme di biomarcatori con revisione medica e 'medici' AI diretti al consumatore — con ciò su cui una raccomandazione deve fondarsi.

Esplora questa sezione

Il Bollettino Longevità

Un'email settimanale valutata in base alle evidenze: le novità della ricerca sulla longevità, cosa è solo moda passeggera e l'unico cambiamento che vale davvero la pena fare.

Gratuito · un'email a settimana · disiscrizione in qualsiasi momento.