Pronósticos de salud impulsados por IA

Cada vez más empresas venden software que lee sus análisis de sangre, sus escáneres o los datos de su reloj inteligente y le dice qué enfermedades es probable que padezca. Algunas de estas herramientas realmente hacen bien una tarea muy concreta, pero casi ninguna ha demostrado nunca que haga más saludable a alguien.
La predicción de salud con IA es real en un puñado de ámbitos muy concretos —lectura de mamografías, cribado de retinopatía diabética, detección de pólipos, detección de fracción de eyección baja a partir de un ECG— y carece prácticamente de evidencia en todo lo que se vende al consumidor. La razón es una única distinción que el marketing borra de forma sistemática: un AUROC alto en un conjunto de datos histórico significa que el modelo clasifica correctamente a los pacientes en datos que nunca influyó. No es evidencia de que usar el modelo cambie lo que le ocurre a nadie. Alrededor de 1,500 dispositivos con IA cuentan con autorización de comercialización de la FDA, y existen unos 41 ensayos aleatorizados de intervenciones de machine learning en toda la atención sanitaria.
- La precisión no es beneficio: de 81 estudios que comparaban deep learning con clínicos, solo 9 fueron prospectivos y solo 6 se realizaron en un entorno clínico real (Nagendran 2020, PMID 32213531).
- La IA en colonoscopia es la aplicación más estudiada mediante ensayos aleatorizados en medicina —44 ECA, con la detección de adenomas un ~20% mayor en términos relativos, y ningún aumento en neoplasia avanzada (Soleymanjahi 2024, PMID 39531400).
- Ningún reloj de envejecimiento —epigenético, retiniano, cerebral, por ECG o proteómico— es un objetivo terapéutico validado, un criterio de valoración sustitutivo validado ni un diagnóstico autorizado por la FDA; el propio organismo de consenso del campo lo afirma por escrito (Moqri 2023, PMID 37657418).
- El machine learning con frecuencia no supera a la regresión logística en datos clínicos tabulares: en 145 comparaciones directas con bajo riesgo de sesgo, la diferencia en logit(AUC) fue de 0.00 (IC del 95%: −0.18 a 0.18) (Christodoulou 2019, PMID 30763612).
- El sesgo algorítmico se mide, no se supone: corregir un algoritmo de gestión asistencial ampliamente utilizado habría elevado la proporción de pacientes negros que reciben ayuda adicional del 17.7% al 46.5% (Obermeyer 2019, PMID 31649194).
Los cuatro niveles de evidencia, y por qué casi nada llega al nivel 4
El AUROC —el área bajo la curva ROC (receiver-operating curve)— es la probabilidad de que un modelo clasifique a un caso aleatorio por encima de un control aleatorio. Es el número que aparece en casi todos los titulares de IA en salud, y responde a una pregunta muy acotada: ¿clasifica el modelo correctamente a las personas en datos que ya se le han mostrado? No dice nada sobre si el número que se le muestra a usted es verdadero, si alguien actúa según él, o si actuar según él hace más bien que mal.
Detrás de la frase clínicamente validado hay cuatro niveles de evidencia claramente distintos, y el marketing presenta habitualmente el primero como si fuera el cuarto.
En qué puede apoyarse realmente una afirmación de IA en salud
| Nivel | Qué significa | Cuán frecuente en IA de salud |
|---|---|---|
| 1. AUROC retrospectivo | El modelo puntúa bien en un conjunto de datos almacenado que nunca influyó. No dice nada sobre si usarlo cambia algo. | Prácticamente toda la investigación publicada de IA en salud, y en la práctica toda la IA de longevidad para consumidores |
| 2. Precisión prospectiva | El modelo funciona en vivo con pacientes reales consecutivos; la precisión se mide frente a un patrón de referencia recogido de forma independiente. Sigue sin haber resultado clínico. | Poco frecuente |
| 3. Resultado de proceso aleatorizado | Un ensayo aleatorizado muestra que la IA cambia lo que hacen o encuentran los clínicos: tasa de detección, tasa de diagnóstico, carga de trabajo. | Raro: unas pocas decenas de ensayos en total, la mayoría en endoscopia |
| 4. Resultado en el paciente, aleatorizado | Un ensayo aleatorizado muestra que la IA cambia si las personas viven más años, sufren menos ictus o desarrollan menos cánceres. | Prácticamente inexistente en este campo |
Dónde la IA funciona de verdad, y dónde la detección se queda corta frente al beneficio
La imagen médica es el terreno más sólido, y merece la pena precisar por qué. El cribado de mamografía cuenta con un comparador existente de alta calidad (dos radiólogos leyendo cada placa), un criterio de valoración duro y posterior (cáncer de intervalo) y programas nacionales dispuestos a aleatorizar. Esa combinación es rara, y es lo que ha producido la mejor evidencia de IA en toda la medicina.
MASAI aleatorizó a 105,934 mujeres suecas a lectura asistida por IA o a la doble lectura estándar. La detección de cáncer subió de 5.0 a 6.4 por 1,000, una razón de 1.29 (IC del 95%: 1.09–1.51), con la carga de lectura de cribado un 44% menor. Cuando por fin se comunicó el criterio de valoración principal, el cáncer de intervalo fue de 1.55 frente a 1.76 por 1,000 —una razón de proporciones de 0.88 (0.65–1.18). Eso es no inferioridad, no superioridad. Nadie ha demostrado que la mamografía asistida por IA reduzca la mortalidad por cáncer de mama, y dado el tamaño de ensayo que haría falta, es poco probable que nadie lo demuestre.
Por debajo del nivel de la imagen médica aparece un patrón constante: la IA encuentra con fiabilidad más de algo, y encontrar más de ese algo ha fracasado repetidamente a la hora de ayudar. El cribado con reloj inteligente y parche duplica o triplica la detección de fibrilación auricular. Tres ensayos aleatorizados con criterios de valoración duros —LOOP, STROKESTOP y GUARD-AF— no han demostrado una reducción de ictus. Los autores de LOOP lo dicen en su propio resumen: no toda fibrilación auricular merece ser buscada mediante cribado, y no toda fibrilación auricular detectada por cribado merece anticoagulación.
El registro de evidencia
Clasificado según: el nivel más alto de evidencia que realmente existe para cada enfoque. Estos niveles se diseñaron para fármacos, así que léalos así para el software: aprobado significa que existe una autorización de comercialización real de la FDA (510(k), De Novo o PMA) para la salida concreta que se vende; preclínico significa que el trabajo es real pero existe solo como modelos ajustados a conjuntos de datos humanos almacenados, sin evidencia de despliegue clínico; comercializado-sin-probar significa que el producto se vende al público sin revisión regulatoria de la afirmación y sin evidencia controlada de beneficio. Tenga en cuenta que autorización y beneficio son ejes distintos: varias herramientas de nivel aprobado aquí tienen evidencia aleatorizada de que cambian la detección y ninguna evidencia de que cambien los resultados.
IA en mamografía (Transpara, Lunit INSIGHT MMG)
AprobadoLee mamografías de cribado como herramienta de triaje y como segundo lector junto a los radiólogos.
La IA con mejor evidencia de toda la medicina. Razón de detección de 1.29 y un 44% menos de carga de lectura en MASAI; cáncer de intervalo no inferior, no reducido. Agrupando MASAI, ScreenTrustCAD y PRAIM (597,419 exploraciones), el beneficio es de +0.9 cánceres por 1,000 cribados, con el intervalo de confianza rozando el cero. Real y útil. No la IA detecta el cáncer años antes.
Autorizada por la FDA vía 510(k) (K181704 → K241831; K211678). Evidencia aleatorizada (MASAI) y de doble lector prospectivo (ScreenTrustCAD).NCT04838756; PMID 41620232Cribado autónomo de retinopatía diabética (IDx-DR / LumineticsCore)
AprobadoGradúa fotografías de fondo de ojo para detectar retinopatía diabética más que leve, sin que un clínico lea la imagen.
Sensibilidad del 87.2% (81.8–91.2), especificidad del 90.7% (88.3–92.7) en 900 pacientes, en consultas de atención primaria en lugar de clínicas oftalmológicas, frente a la gradación independiente de un centro lector. El ejemplo más limpio de este dossier de IA hecha correctamente. Competidores autorizados con el mismo código de producto: EyeArt (K200667) y AEYE-DS (K221183).
De Novo de la FDA DEN180001, 11 de abril de 2018 —el primer diagnóstico autónomo de IA autorizado en cualquier ámbito. Ensayo pivotal prospectivo en atención primaria.NCT02963441; PMID 31304320Detección asistida por ordenador en colonoscopia (CADe)
AprobadoSeñala pólipos en el campo de visión en vivo del endoscopista.
Razón de tasa de detección de adenomas de 1.21 (1.15–1.28) —sólida y consistente. Pero la neoplasia avanzada por colonoscopia no mostró diferencia alguna (diferencia de tasa de incidencia 0.01, −0.01 a 0.02), el aumento estuvo impulsado en gran parte por lesiones diminutas, y hubo aproximadamente dos polipectomías no neoplásicas adicionales por cada diez procedimientos. La aplicación de IA más estudiada mediante ensayos aleatorizados de toda la medicina, y el nivel 3 no llegó a convertirse en nivel 4.
Autorizada por la FDA y con marcado CE. 44 ensayos aleatorizados, 36,201 pacientes.PMID 39531400; PMID 37639719ECG con IA para fracción de eyección baja (Anumana, Eko, Tempus)
AprobadoSeñala una probable fracción de eyección del ventrículo izquierdo igual o inferior al 50% a partir de un ECG estándar de 12 derivaciones.
Realmente preciso —AUC de 0.93 para FE ≤35% en el trabajo de desarrollo— y realmente aleatorizado. Fíjese en qué predice: su fracción de eyección ahora, no su riesgo futuro. Y fíjese en el efecto absoluto en EAGLE: los nuevos diagnósticos de FE baja subieron del 1.6% al 2.1%.
Autorizado por la FDA vía 510(k) como software de notificación (K232699, K233409, K250119, K250652). Ensayo aleatorizado por conglomerados (EAGLE, 22,641 pacientes).NCT04000087; PMID 30617318Puntuación de malignidad de nódulos pulmonares (Optellum Virtual Nodule Clinic)
AprobadoPuntúa el riesgo de malignidad de un nódulo pulmonar que un humano ya ha encontrado en una TC.
Una ayuda de estratificación de riesgo sin ningún ensayo que muestre que cambia el estadio al diagnóstico o la mortalidad. Vale la pena conocer cómo se comporta la investigación subyacente: en el modelo emblemático de Google sobre el NLST, el rendimiento superó a los seis radiólogos cuando no había una TC previa disponible, y estuvo simplemente a la par con ellos cuando sí existía un escáner previo —que es la condición clínicamente realista.
Autorizada por la FDA vía 510(k) (K202300, 2021). Solo validación retrospectiva; sin ECA.K202300; PMID 31110349Notificación de ritmo irregular del reloj inteligente
AprobadoDetecta un patrón de pulso sugestivo de fibrilación auricular y envía una notificación.
La detección funciona; el beneficio no llega. Solo el 34% (Apple) y el 32.2% (Fitbit) de las alertas se confirmaron como FA en un parche de seguimiento. Tomar un ECG de reloj de 10 segundos tras una alerta tiene un rendimiento diagnóstico del 7.6%, frente al 60.8% de un parche de cuatro semanas. Y en LOOP, STROKESTOP y GUARD-AF, encontrar más FA no ha demostrado prevenir ictus. El USPSTF sigue calificando la evidencia sobre el cribado de FA en adultos de 50 años o más como insuficiente —una calificación de Grado I.
De Novo de la FDA DEN180042 (Apple). Estudios pragmáticos con 419,297 (Apple Heart) y 455,699 (Fitbit Heart) participantes.NCT03335800; NCT04380415; PMID 35076659Notificaciones de hipertensión y apnea del sueño para consumidores
AprobadoSeñala patrones de varias semanas en un wearable sugestivos de hipertensión o apnea del sueño de moderada a grave.
Los resúmenes de autorización son más honestos que el marketing. Para la hipertensión, el resumen de la FDA reporta una sensibilidad del 41.2% (37.2–45.3) y una especificidad del 92.3% en 1,863 participantes analizados —no detecta aproximadamente el 59% de la hipertensión y el 46% de la hipertensión de estadio 2, y su propia indicación prohíbe usarla para vigilancia o para seguir el efecto del tratamiento. Para la apnea del sueño, la sensibilidad es del 66.3%. Ambas son legítimas como aviso hacia una prueba adecuada. Ninguna es una medición.
Autorizada por la FDA vía 510(k) (hipertensión de Apple K250507, sep. de 2025; apnea del sueño de Apple K240929, predicado Samsung DEN230041). Solo validación del propio fabricante.K250507; K240929Predicción de sepsis dentro de la historia clínica electrónica (Epic Sepsis Model)
Se vende · sin pruebasPuntúa de forma continua a los pacientes hospitalizados en busca de un probable inicio de sepsis.
AUC de 0.63 en 38,455 hospitalizaciones, sin detectar al 67% de los pacientes con sepsis mientras alertaba en el 18% de todos los ingresos. Solo identificó al 7% de los pacientes sépticos más allá de lo que la práctica clínica oportuna ya captaba. Los autores llaman a su adopción generalizada pese a este rendimiento una preocupación fundamental. La brecha regulatoria que permitió su despliegue sin examen es lo que importa aquí.
No regulada por la FDA —se desplegó como funcionalidad de la historia clínica electrónica en cientos de hospitales de EE. UU. Existe validación externa, y falló.PMID 34152373Pruebas de edad biológica epigenética para consumidores
Se vende · sin pruebasDevuelven un único número de edad biológica a partir de la metilación del ADN en sangre, saliva o un frotis bucal.
Los relojes subyacentes son asociaciones de mortalidad reales y replicadas. El producto de consumo es una afirmación de precisión que el ensayo no puede sostener: el ruido técnico produce desviaciones de hasta 9 años entre repeticiones de la misma muestra para seis relojes destacados, y las diferencias entre tejido oral y sanguíneo llegan a casi 30 años en la misma persona para algunos relojes. La mayoría de las pruebas directas al consumidor usan saliva o frotis bucal.
Pruebas desarrolladas en laboratorio (LDT) reguladas únicamente bajo CLIA. La norma de la FDA sobre LDT fue anulada el 31 de marzo de 2025 y formalmente revocada el 19 de septiembre de 2025, así que ningún regulador revisa la validez clínica de la afirmación sobre la edad.PMID 36277076; PMID 39780748Brechas de edad retiniana, cerebral, por ECG y proteómica
Solo preclínicoEstiman la edad de un órgano o de todo el cuerpo a partir de una foto de retina, una RM, un ECG o el proteoma plasmático, y luego reportan la diferencia respecto a su cumpleaños.
Estadísticamente reales a escala poblacional y mucho más débiles de lo que suenan a nivel individual. Brecha de edad retiniana: HR de mortalidad por todas las causas de 1.02 por año, con el intervalo de confianza rozando 1.00, sin asociación significativa con mortalidad cardiovascular o por cáncer. Edad cerebral: HR de mortalidad de 1.061 por año —pero al introducirla junto con volúmenes simples de sustancia gris y LCR dejó de ser significativa (p=0.12), así que el paso de deep learning no aportó nada frente a una medición de volumen.
Herramientas de investigación. Ninguna de estas salidas cuenta con autorización de la FDA; las búsquedas por nombre de dispositivo en la base de datos 510(k) de la FDA no devuelven ningún dispositivo autorizado que emita una edad biológica o fisiológica.PMID 35042683; PMID 28439103Puntuaciones de bienestar: preparación, recuperación, esfuerzo, puntuación de sueño, VFC, edad del wearable
Se vende · sin pruebasPuntuaciones diarias compuestas derivadas en gran parte de la frecuencia cardiaca, la VFC y las fases de sueño estimadas.
Los wearables de consumo asignan la fase de sueño correcta entre el 50% y el 65% de las veces (kappa de Cohen de 0.20–0.52), y están sesgados a etiquetarlo todo como sueño: la especificidad de detección de vigilia se sitúa entre 0.18 y 0.54. Cada minuto contabilizado de sueño profundo y cada puntuación de recuperación derivada del sueño REM se construye sobre eso. La carta de advertencia de la FDA a Whoop también dejó constancia de que un aviso de no destinado a uso médico no salva a un producto diseñado para producir una estimación clínica.
Bienestar general sin regular. No se identificó ninguna autorización de la FDA para Oura, Garmin ni Ultrahuman en la base de datos de la FDA; la única autorización de Whoop es una función de ECG (K243236).PMID 36016077; PMID 33378539Chatbots de salud con LLM de propósito general
Se vende · sin pruebasResponden preguntas de salud, triajan síntomas y sugieren qué hacer a continuación en lenguaje natural.
Los modelos no son el eslabón débil —lo es la transferencia al usuario. En un estudio aleatorizado preregistrado, los modelos evaluados solos identificaron la afección en el 94.9% de los casos; 1,298 miembros del público usando esos mismos modelos identificaron afecciones en menos del 34.5% —no mejor que el control. En 2,400 casos de pacientes reales en lugar de viñetas, los modelos más avanzados rindieron significativamente peor que los médicos y fueron sensibles al orden en que se les daba la información.
Ningún chatbot de LLM de propósito general está autorizado por la FDA como dispositivo médico, y la propia lista de dispositivos de la FDA aún no identifica qué dispositivos autorizados incluyen funcionalidad de LLM.PMID 41663592; PMID 38965432Paneles multi-ómicos y servicios de cribado por RM de cuerpo completo
Se vende · sin pruebasAgrupan cientos de biomarcadores, genómica y un escáner de cuerpo completo en un pronóstico de salud personalizado.
Agrupando 12 estudios y 5,373 sujetos asintomáticos, la RM de cuerpo completo produjo hallazgos incidentales críticos o indeterminados en el 32.1%, de los cuales solo el 12.6% llegó a verificarse alguna vez. La propia base de datos de un proveedor con 21,651 escáneres asintomáticos encontró quistes pancreáticos incidentales en el 7.0% de todas las personas escaneadas, de los cuales cerca del 99% estaban por debajo del tamaño que activaría una intervención —y aun así todos entran en vigilancia. El American College of Radiology declara que no hay evidencia suficiente para recomendar el cribado de cuerpo completo en personas sin síntomas, factores de riesgo ni antecedentes familiares.
Pruebas desarrolladas en laboratorio reguladas solo bajo CLIA, más discreción de aplicación de bienestar general. Los componentes de escáner y mejora de imagen pueden estar autorizados; el servicio de cribado no lo está.PMID 30932247; PMID 41801199
Dispositivo médico autorizado frente a aplicación de bienestar para consumidores: no son el mismo objeto
La habilidad más útil en este campo es distinguir entre cuatro objetos regulatorios que suenan idénticos en el texto de marketing: un dispositivo médico autorizado por la FDA, una prueba desarrollada en laboratorio que opera bajo CLIA, un producto de bienestar general que opera bajo discreción de aplicación, y software sin ninguna relación regulatoria.
Incluso dentro de la categoría autorizada, el listón de evidencia es bajo. De las ~1,524 autorizaciones, el 96.2% pasó por 510(k), que pregunta si un dispositivo es sustancialmente equivalente a un predicado ya en el mercado —no si mejora los resultados. En la cohorte de 2024, solo el 29.2% reportó tanto sensibilidad como especificidad, solo el 15.5% reportó datos de raza o etnia, y solo el 16.7% se lanzó con un Plan de Control de Cambios Predeterminado, lo que significa que la mayoría de los modelos autorizados quedan congelados en el momento de la autorización y no pueden actualizarse a medida que las poblaciones cambian.
Qué está autorizado, qué está demostrado y qué predice realmente cada herramienta
| Herramienta o afirmación | Estado regulatorio | ¿Evidencia prospectiva? | Qué predice realmente |
|---|---|---|---|
| IA en mamografía (Transpara, Lunit) | Autorizada por la FDA vía 510(k); con marcado CE | Sí —aleatorizada (MASAI, NCT04838756, n=105,934) y doble lector prospectivo (ScreenTrustCAD, NCT04778670, n=55,581) | Presencia de cáncer de mama detectable por cribado en esta mamografía |
| IDx-DR / LumineticsCore | De Novo de la FDA DEN180001 (abr. de 2018) | Sí —ensayo pivotal prospectivo en atención primaria, NCT02963441, n=900 | Retinopatía diabética o edema macular más que leve a partir de fotos de fondo de ojo |
| CADe en colonoscopia | Autorizada por la FDA; con marcado CE | Sí —44 ensayos aleatorizados, 36,201 pacientes | Presencia de un pólipo en el campo de visión actual. Sin aumento en neoplasia avanzada |
| ECG con IA para fracción de eyección baja | Autorizada por la FDA vía 510(k) (K232699, K250652) | Sí —ECA por conglomerados (EAGLE, NCT04000087, n=22,641) | Fracción de eyección actual del VI ≤50% —no el riesgo futuro |
| Optellum Virtual Nodule Clinic | Autorizada por la FDA vía 510(k) (K202300) | No —solo validación retrospectiva | Riesgo de malignidad de un nódulo pulmonar ya detectado |
| Notificación de ritmo irregular del reloj inteligente | De Novo de la FDA DEN180042 | Sí —estudios pragmáticos, n=419,297 y n=455,699 | Probable fibrilación auricular ahora. El 34% / 32% de las alertas confirman FA |
| Cribado de FA como prevención de ictus | No es una afirmación de dispositivo | Sí —tres ECA con criterios de valoración duros (LOOP, STROKESTOP, GUARD-AF) | Sin reducción de ictus demostrada. LOOP HR 0.80 (0.61–1.05); GUARD-AF HR 1.10 (0.69–1.75) |
| Apple Hypertension Notification | FDA 510(k) K250507 (sep. de 2025) | Solo validación del propio fabricante, n=1,863 | Patrones sugestivos de hipertensión. Sensibilidad del 41.2% |
| Epic Sepsis Model | No regulado por la FDA —desplegado como funcionalidad de la historia clínica electrónica | Solo validación externa —y falló | Nominalmente el inicio de la sepsis; en la práctica rindió con un AUC de 0.63, sin detectar el 67% de los casos |
| Relojes epigenéticos (Horvath, PhenoAge, GrimAge, DunedinPACE) | Sin autorización de la FDA para ninguna afirmación clínica; se venden como LDT o como bienestar | No —solo estudios de asociación | Edad cronológica, o riesgo de mortalidad, según el objetivo de entrenamiento. No es un objetivo modificable |
| Brechas de edad retiniana, cerebral y proteómica | Herramientas de investigación; sin autorización | No —asociaciones de cohorte, en gran parte dentro de conjuntos de datos únicos | Riesgo de mortalidad y morbilidad a nivel poblacional |
| Pruebas de edad biológica para consumidores | LDT reguladas solo bajo CLIA; la norma de LDT de la FDA fue anulada el 31 de marzo de 2025, así que no hay revisión de la FDA sobre la afirmación de edad | Ninguna | Nada validado. La misma muestra procesada dos veces puede diferir en años |
| VFC, preparación, recuperación, esfuerzo, puntuaciones de sueño, edad del wearable | Bienestar general sin regular | Ninguna | Nada validado. La fase de sueño es correcta entre el 50% y el 65% de las veces |
| Monitores continuos de glucosa OTC en personas sin diabetes | Autorizados solo para medición de glucosa (Stelo K234070, Lingo K233655, Libre Rio K233861) | Sin ECA de resultados en personas sin diabetes | Glucosa intersticial, con lecturas aproximadamente 0.9 mmol/L por encima del muestreo capilar |
| Chatbots de LLM de propósito general | Ningún dispositivo autorizado por la FDA está identificado como impulsado por LLM | Puntos de referencia (benchmarks) más tres ECA —en los que el brazo humano-más-modelo no superó al modelo solo | Respuestas de referencia, no resultados clínicos |
| Gemelo digital (Unlearn.AI / PROCOVA) | Opinión de calificación de la EMA —para la eficiencia de ensayos clínicos; descrita por la EMA como un caso especial de ANCOVA | No aplicable —es un método estadístico | Reducción del tamaño muestral del ensayo. No un tratamiento personalizado |
| Servicios de cribado por RM de cuerpo completo | Componentes de escáner y mejora de imagen autorizados; el servicio de cribado no lo está | Solo observacional de un solo brazo (NCT06212479, finaliza en 2037) | Hallazgos incidentales. Tasa agrupada de incidentalomas del 32.1%; el ACR dice que la evidencia es insuficiente |
El vocabulario regulatorio, descifrado
| La frase | A qué se refiere en realidad |
|---|---|
| IA autorizada por la FDA (servicios de RM de cuerpo completo) | Un algoritmo de mejora de imagen, no el servicio de cribado que se está vendiendo |
| Autorizado por la FDA (Whoop) | Una única función de ECG, K243236. Recovery, Strain, Whoop Age y Healthspan no están regulados |
| Gemelo digital calificado por la EMA | Un caso especial de ANCOVA para reducir el tamaño muestral de un ensayo clínico. La FDA lo rechazó por considerarlo ya cubierto por las guías existentes de ajuste por covariables |
| Certificado por CLIA (toda prueba de edad biológica y multi-ómica) | El laboratorio mide el analito de forma reproducible. No dice nada sobre la validez clínica —y desde el 31 de marzo de 2025 ningún regulador de EE. UU. revisa esa afirmación |
| FDA-registrado / FDA-listado | Registro de instalación. Irrelevante para la afirmación que se hace |
| Clínicamente validado | Habitualmente un estudio de correlación retrospectivo, a menudo firmado por la propia empresa que vende el producto |
| Nuestra IA analiza más de 100 biomarcadores | Analizar no es predecir, y predecir no es estar validado |
| No pretende diagnosticar, tratar, curar o prevenir ninguna enfermedad —junto a un marketing de detección de enfermedades | Una postura legal. La FDA dictaminó por escrito en julio de 2025 que estos avisos no salvan a un producto diseñado para producir una estimación clínica |
Qué cambió en 2025–2026
- ene. de 2025
Se publica PRAIM —la mayor implementación real de cribado con IA
463,094 mujeres en 12 centros de cribado alemanes. Detección de cáncer de 6.7 frente a 5.7 por 1,000, +17.6% (IC del 95%: +5.7% a +30.8%), con una tasa de reconvocatoria menor y no inferior. Observacional, pero la dirección coincide con MASAI.
Eisemann 2025, Nat Med, PMID 39775040
- 31 mar. de 2025
Se anula la norma de la FDA sobre pruebas desarrolladas en laboratorio
Un tribunal federal de distrito dictaminó en ACLA v. FDA que las LDT son servicios profesionales, no dispositivos. Este es el hecho más determinante para las pruebas de longevidad de consumo: las pruebas de edad biológica y los paneles multi-ómicos vuelven a regirse solo por CLIA, sin revisión de la FDA sobre su validez clínica, indefinidamente.
FDA final rule implementing vacatur, 90 FR 45134, 19 Sep 2025
- abr. de 2025
Whoop recibe su primera autorización de la FDA —para una función de ECG
K243236 cubre la detección de FA, ritmo sinusal normal y frecuencia cardiaca alta o baja, solo para uso informativo. Recovery, Strain, Sleep Coach, Whoop Age y Healthspan no están autorizados para nada.
FDA 510(k) K243236
- 14 jul. de 2025
Carta de advertencia de la FDA a Whoop por Blood Pressure Insights
La FDA declaró que no ha autorizado la función para ningún uso, rechazó la exención de bienestar general y rechazó explícitamente los avisos —señalando que su ineficacia queda demostrada por personas que usan la función para monitorizar su hipertensión. La carta de cierre del 17 de junio de 2026 es discreción de aplicación sobre un producto reetiquetado, no una autorización.
FDA Warning Letter, MARCS-CMS 709755
- ago. de 2025
Primera señal cuantificada de pérdida de habilidad
En cuatro centros polacos de endoscopia y 1,443 colonoscopias, la tasa de detección de adenomas sin asistencia de los endoscopistas cayó del 28.4% al 22.4% tras la exposición a la IA (−6.0 puntos porcentuales, IC del 95%: −10.5 a −1.6, p=0.0089). Observacional y necesitado de replicación, pero es un riesgo sistémico que ninguna métrica de precisión capta.
Budzyń 2025, Lancet Gastroenterol Hepatol, PMID 40816301
- sep. de 2025
Apple Hypertension Notification autorizada con una sensibilidad del 41.2%
La mayor expansión de IA cardiovascular de consumo hasta la fecha, y el rendimiento más modesto autorizado hasta ahora. Su propia indicación prohíbe usarla para sustituir el diagnóstico, monitorizar el efecto del tratamiento o realizar vigilancia de la presión arterial.
FDA 510(k) K250507
- ene. de 2026
MASAI reporta su criterio de valoración principal
Cáncer de intervalo de 1.55 frente a 1.76 por 1,000; razón de proporciones de 0.88 (0.65–1.18), p=0.41 —no inferior, no superior. Sensibilidad del 80.5% frente al 73.8% (p=0.031), especificidad del 98.5% en ambos brazos. El resultado definitivo del cribado con IA, y descarta el principal temor en lugar de demostrar un beneficio de mortalidad.
Gommers 2026, Lancet, PMID 41620232
- feb. de 2026
El resultado definitivo sobre IA de consumo
1,298 participantes legos del Reino Unido aleatorizados a usar LLM de vanguardia o una fuente de su elección. Los modelos solos identificaron la afección en el 94.9% de los casos; los mismos modelos en manos del público, menos del 34.5% —no mejor que el control. Los autores afirman que los puntos de referencia estándar no predicen los fallos hallados con participantes humanos.
Bean 2026, Nat Med, PMID 41663592
- mar. de 2026
La cascada de cribado, cuantificada a partir de los propios datos de un proveedor
Entre 21,651 personas asintomáticas escaneadas con RM de cuerpo completo, el 7.0% presentó una lesión quística pancreática incidental, subiendo al 20.8% a partir de los 80 años. El 96.0% medía menos de 2 cm y solo el 1.1% medía 3 cm o más —un solo órgano, un solo tipo de hallazgo, y aproximadamente el 99% por debajo del umbral de intervención.
Wong 2026, JAMA Netw Open, PMID 41801199
- ago. de 2026
El tamaño del efecto honesto para la mamografía con IA
Agrupando MASAI, ScreenTrustCAD y PRAIM en 597,419 exploraciones se obtiene una diferencia de riesgo de detección de cáncer de +0.9 por 1,000 (IC del 95%: −0.0 a +1.8) y ningún aumento consistente en la reconvocatoria.
Ferre 2026, Clin Imaging, PMID 42617468
Relojes de envejecimiento: asociaciones reales, y ni un solo objetivo validado
Los relojes de envejecimiento —epigenético, retiniano, cerebral, por ECG, proteómico— son el producto de pronóstico con IA que la industria de la longevidad vende con más fuerza. Son asociaciones estadísticas reales y replicadas con la mortalidad. Ni uno solo es un criterio de valoración sustitutivo validado, un objetivo terapéutico validado ni un diagnóstico autorizado por la FDA. Esa no es nuestra postura editorial; es la posición declarada por el propio organismo de consenso del campo.
Lo más importante sobre cualquier reloj es contra qué se entrenó, porque eso determina qué puede llegar a predecir. Los relojes de primera generación (Horvath, Hannum) se entrenaron con la edad cronológica —un reloj de Horvath perfecto no llevaría ninguna señal de mortalidad, porque toda la información de edad biológica vive en su término de error. GrimAge se entrenó directamente con el tiempo hasta la muerte, usando sustitutos de metilación para proteínas plasmáticas y años-paquete de tabaquismo; eso es una predicción de mortalidad legítima, y es en parte un detector de tabaquismo más que una medición del envejecimiento molecular. DunedinPACE se entrenó con la tasa de cambio de 19 indicadores de sistemas orgánicos a lo largo de 20 años y presenta los cocientes de riesgo de mortalidad más fuertes (1.65, 1.51–1.79 en Framingham Offspring).
Los relojes también discrepan entre sí. Muchos relojes epigenéticos existentes correlacionan solo débilmente entre ellos, lo que implica que capturan procesos distintos —dos relojes sobre la misma muestra de sangre pueden contar historias diferentes. Y la única evidencia aleatorizada es escasa y contradictoria: en CALERIE, dos años de restricción calórica del 25% ralentizaron DunedinPACE pero no cambiaron de forma significativa PhenoAge ni GrimAge. Tres relojes, las mismas muestras aleatorizadas, tres respuestas distintas.
Lo que un informe para consumidores no puede sostener
- Precisión: el ruido técnico produce desviaciones de hasta 9 años entre repeticiones de la misma muestra para seis relojes epigenéticos destacados —PhenoAge con una desviación mediana de 2.4 años, máxima de 8.6 años. Una mejora de 3 años tras una intervención cabe cómodamente dentro de ese ruido.
- Tejido: una comparación entre tejidos en 284 muestras encontró diferencias medias de casi 30 años entre tejido oral y sanguíneo en la misma persona para algunos relojes; solo el reloj Skin & Blood fue concordante. La mayoría de las pruebas directas al consumidor usan saliva o un frotis bucal.
- Independencia: todo resultado publicado de brecha de edad retiniana proviene del mismo conjunto de datos del UK Biobank y del mismo modelo entrenado con las mismas 11,052 personas. En las comparaciones directas que hicieron los propios autores, la edad retiniana no superó a los factores de riesgo habituales para el ictus o el Parkinson.
- Valor añadido: la brecha de edad cerebral predijo la mortalidad con un HR de 1.061 por año —pero dejó de ser significativa (p=0.12) en cuanto se incluyeron en el modelo volúmenes simples de sustancia gris y LCR, que sí permanecieron significativos. El paso de deep learning no aportó nada frente a una medición de volumen.
- Estabilidad del método: los modelos de edad cerebral sobreestiman sistemáticamente en los jóvenes y subestiman en los mayores, así que la brecha bruta arrastra una fuga de la edad cronológica. Distintos métodos de corrección dan respuestas distintas, y un tamaño de efecto es ininterpretable a menos que el artículo indique qué corrección usó.
- Calidad de desarrollo: una evaluación sistemática de 81 relojes de envejecimiento en 59 estudios encontró que 31 (38.3%) se desarrollaron sin validación interna ni externa, la mayoría fue calificada de alto riesgo de sesgo —incluso los publicados en revistas de alto impacto—, y solo 3 relojes (3.7%) fueron calificados de bajo riesgo.
Tampoco hay ningún regulador de EE. UU. comprobando nada de esto. Toda prueba epigenética de edad para consumidores es una prueba desarrollada en laboratorio. La norma de la FDA sobre LDT fue anulada el 31 de marzo de 2025 y formalmente revocada el 19 de septiembre de 2025, así que estas pruebas se rigen solo por CLIA. CLIA certifica el rendimiento analítico del laboratorio —exactitud, precisión, control de calidad, competencia del personal. No evalúa si la afirmación que hace la prueba es clínicamente cierta. Un resultado de edad biológica puede ser analíticamente reproducible y aun así clínicamente carente de significado, y según los datos de fiabilidad anteriores, ni siquiera esa mitad analítica está garantizada.
¿Supera realmente el machine learning a la estadística clásica?
Esta es la pregunta que subyace a cualquier comparación de predicción de riesgo de enfermedad con IA frente a métodos tradicionales, y la respuesta honesta resulta incómoda para ambos bandos: la literatura es dispar, y la aparente ventaja del machine learning se reduce cuanto más cuidadosamente se hace la comparación.
El resultado metodológico de referencia revisó 71 estudios con 282 comparaciones directas entre regresión logística y machine learning para resultados clínicos binarios. En las 145 comparaciones juzgadas con bajo riesgo de sesgo, la diferencia en logit(AUC) entre ambos fue de 0.00 (IC del 95%: −0.18 a 0.18) —exactamente cero. En las 137 comparaciones con alto riesgo de sesgo, el machine learning se vio 0.34 (0.20–0.47) mejor. La ventaja del machine learning en la literatura publicada es, en una primera aproximación, el sesgo. La misma revisión encontró que el 79% de los estudios no abordaba en absoluto la calibración.
Esto se sigue reproduciendo. Una evaluación de 2026 sobre 52 estudios que predecían la resistencia a IVIG en la enfermedad de Kawasaki encontró que el machine learning y la regresión logística eran indistinguibles en la validación externa (AUC agrupado de 0.76 frente a 0.75) mientras el machine learning parecía claramente mejor en la validación interna (0.86 frente a 0.76) —la firma clásica del sobreajuste. Existe una corriente contraria: un metaanálisis de 2025 sobre modelos cardiovasculares basados en historias clínicas electrónicas reportó AUC agrupados de 0.865 para los bosques aleatorios y de 0.847 para el deep learning frente a 0.765 para las puntuaciones convencionales —pero con una I² por encima del 99% y evidencia de sesgo de publicación, y la propia conclusión de los autores es que las preocupaciones metodológicas limitan la aplicabilidad clínica actual. Una heterogeneidad tan alta significa que la estimación agrupada en realidad no está estimando una sola cosa.
De qué guarda silencio el AUROC
- Calibración —si un riesgo predicho del 10% corresponde a un riesgo real del 10%. Aproximadamente cuatro de cada cinco artículos publicados de predicción con machine learning no la reportan, y es la única propiedad que importa para una cifra de riesgo personal.
- Prevalencia —un modelo con un AUROC de 0.95 en un conjunto de datos enriquecido al 20% de prevalencia puede ser inútil con una prevalencia poblacional del 0.5%, porque el valor predictivo positivo se desploma.
- Beneficio neto en el umbral de decisión que usted realmente usaría —si actuar según la puntuación hace más bien que mal.
- Si alguien actúa según ella. En EAGLE, el modelo era preciso, el ensayo fue positivo, y el aumento absoluto en nuevos diagnósticos de FE baja fue del 1.6% al 2.1%.
- Cuál era la alternativa. El Epic Sepsis Model no detectó al 67% de los casos que los clínicos ya estaban tratando.
- Qué ocurre en cuanto interviene un humano. Los LLM que identificaron afecciones en el 94.9% de los casos en solitario cayeron por debajo del 34.5% en manos de miembros reales del público.
Nada de esto es un argumento para abandonar los modelos. QRISK3, SCORE2 y Framingham son transparentes, están publicados en su totalidad, se han validado externamente muchas veces, y son sobre lo que realmente funciona la prevención basada en guías. Es un argumento contra dar por hecho que un modelo más nuevo y más complejo que le muestra una empresa que vende una suscripción es mejor que el gratuito que ya usa su médico. TRIPOD+AI ofrece ahora un estándar de reporte de 27 ítems; un estudio de modelo que no lo siga debería tratarse como preliminar.
Sesgo algorítmico y modos de fallo de los LLM
El sesgo en la IA de salud no es una preocupación hipotética de comité de ética. Se ha medido, a escala, en sistemas que ya estaban desplegados.
El caso emblemático examinó un algoritmo comercial de predicción de riesgo usado para asignar gestión asistencial adicional a millones de pacientes. Para cualquier puntuación de riesgo dada, los pacientes negros estaban considerablemente más enfermos que los pacientes blancos. Corregir el sesgo habría elevado la proporción de pacientes negros que reciben ayuda adicional del 17.7% al 46.5%. El mecanismo importa más que el número: el algoritmo predecía el coste sanitario futuro como sustituto de la necesidad de salud, y como históricamente se gasta menos dinero en los pacientes negros con el mismo nivel de enfermedad, el coste es un sustituto sesgado de la enfermedad. El modelo era preciso en su tarea declarada y discriminatorio en su uso real —y ningún nivel de AUROC lo habría detectado.
En imagen médica, clasificadores de radiografías de tórax de última generación, probados en tres grandes conjuntos de datos, infradiagnosticaron de forma constante y selectiva a poblaciones desatendidas —mujeres, pacientes negros, pacientes de nivel socioeconómico bajo—, con las tasas más altas en los subgrupos interseccionales. El infradiagnóstico es el peor modo de fallo posible: etiqueta como sana a una persona enferma y retrasa su atención. Y por lo general no se puede comprobar nada de esto en un dispositivo autorizado, porque solo el 15.5% de los dispositivos de machine learning que la FDA autorizó en 2024 reportó siquiera datos de raza o etnia de su población de evaluación.
Modos de fallo de los LLM documentados en contextos de salud
- Los puntos de referencia (benchmarks) no se transfieren a los usuarios. Los modelos solos identificaron afecciones en el 94.9% de los casos; 1,298 participantes legos usando esos mismos modelos gestionaron menos del 34.5% —no mejor que el control, en un diseño aleatorizado preregistrado.
- El rendimiento se desploma con datos clínicos reales. En 2,400 casos de pacientes reales en cuatro patologías abdominales, los modelos más avanzados rindieron significativamente peor que los médicos, no siguieron guías diagnósticas ni de tratamiento, no pudieron interpretar resultados de laboratorio y fueron sensibles tanto a la cantidad como al orden de la información. Los autores concluyen que los LLM no están listos para la toma de decisiones clínicas autónoma.
- Complacencia (sycophancy) —el modelo está de acuerdo con su premisa falsa. Con 50 pares de fármaco de marca-genérico y peticiones que afirmaban una equivalencia falsa, el cumplimiento inicial con la petición ilógica fue del 100% para tres variantes de GPT y del 94% para Llama3-8B. Los modelos tenían el conocimiento para rechazar la premisa y aun así cumplieron. Haga una pregunta capciosa sobre su propia salud, y obtendrá su premisa confirmada.
- Citas alucinadas. En 636 referencias de 84 revisiones de literatura generadas, el 55% de las citas de GPT-3.5 y el 18% de las citas de GPT-4 estaban completamente fabricadas; entre las reales, el 43% y el 24% respectivamente contenían errores sustantivos. Una referencia que parece un estudio real no lo es.
- Fragilidad ante cómo escribe usted. Erratas, espacios extra, ausencia de marcadores de género y un lenguaje informal o dramático aumentaron la probabilidad de que un modelo dijera al paciente que se autogestionara en lugar de buscar atención, y el efecto fue mayor para las pacientes mujeres.
- Incluso los mejores resultados de referencia son más débiles de lo reportado. En 70 casos clinicopatológicos seleccionados —la prueba más fácil posible—, GPT-4 incluyó el diagnóstico final en algún lugar de su diagnóstico diferencial el 64% de las veces, pero su diagnóstico principal fue correcto solo en el 39%.
Hay un extraño consuelo en los datos aleatorizados: en dos ensayos con médicos, el modelo solo igualó o superó al brazo médico-más-modelo. En el razonamiento diagnóstico, la asistencia de LLM no produjo ningún beneficio (diferencia ajustada de 2 puntos porcentuales, IC del 95%: −4 a 8) mientras GPT-4 solo puntuó 16 puntos más alto que los médicos con recursos convencionales. En el razonamiento de manejo, la asistencia sí ayudó a los médicos (+6.5%) pero GPT-4 solo fue estadísticamente indistinguible de los médicos asistidos por GPT-4. El cuello de botella en 2026 es la transferencia entre el modelo y el humano, y es peor para los miembros del público —que es exactamente el contexto en el que se vende la IA de salud para consumidores.
Para completar la cuestión regulatoria: ningún chatbot de LLM de propósito general está autorizado por la FDA como dispositivo médico, y la propia lista de dispositivos de la FDA aún no identifica qué dispositivos autorizados contienen funcionalidad de LLM. El software escapa a la definición de dispositivo mediante la excepción de soporte de decisión clínica solo si respalda recomendaciones a un profesional sanitario que pueda revisar de forma independiente su fundamento. Un chatbot que produce una narrativa convincente sin un fundamento revisable y con fuentes enlazadas no supera esa prueba —y una herramienta dirigida a pacientes en lugar de a profesionales no cumple en absoluto los requisitos de la excepción.
Cómo evaluar una afirmación de IA en salud
No hace falta ser técnico para filtrar con precisión casi cualquier producto de IA en salud. Estas diez preguntas están ordenadas de modo que descarten el mayor número de afirmaciones lo antes posible —la mayoría de los productos fallan en la pregunta uno o dos.
Diez preguntas, en orden
- 1. ¿Es un dispositivo médico regulado o un producto de bienestar? Busque un número de solicitud real —un número K (510(k)), DEN (De Novo) o P (PMA)— y búsquelo en la lista de dispositivos médicos con IA de la FDA. FDA-registrado, FDA-listado, desarrollado en una instalación registrada por la FDA y certificado por laboratorio no son autorizaciones.
- 2. ¿Autorizado para qué, exactamente? La indicación autorizada es una frase muy concreta. IDx-DR está autorizado para detectar retinopatía diabética más que leve a partir de fotos de fondo de ojo en adultos con diabetes —no para detectar enfermedades oculares. Compare la frase de marketing con la frase de la indicación. Si el marketing es más amplio, el marketing es una afirmación sin respaldo.
- 3. ¿Retrospectivo o prospectivo? Si la única evidencia es un AUROC sobre datos almacenados, está usted en el nivel de evidencia 1. Pregunte si el modelo llegó a funcionar en vivo, con pacientes reales consecutivos, frente a un patrón de referencia recogido de forma independiente.
- 4. ¿Hubo un ensayo aleatorizado, y de qué resultado? Distinga los resultados de proceso (tasa de detección, tasa de diagnóstico, carga de trabajo) de los resultados en el paciente (mortalidad, ictus, incidencia de cáncer). La IA en colonoscopia es la advertencia: 44 ensayos, un sólido +20% en detección de adenomas, y ningún aumento en neoplasia avanzada.
- 5. ¿Se reporta la calibración, no solo la discriminación? El AUROC responde a ¿clasifica correctamente a las personas? La calibración responde a ¿es cierto el número que se me muestra? Solo la segunda importa para una cifra de riesgo personal, y aproximadamente cuatro de cada cinco artículos la omiten.
- 6. ¿Cuál es el efecto absoluto? Un 29% más de cánceres detectados es 6.4 frente a 5.0 por 1,000 —1.4 cánceres adicionales por cada mil mujeres cribadas. Aumenta el diagnóstico de fracción de eyección baja es del 1.6% al 2.1%. Las cifras relativas son cómo se hace sonar fuertes a los efectos débiles.
- 7. ¿Quién está en el conjunto de validación, y le incluye a usted? Solo el 15.5% de los dispositivos de machine learning autorizados por la FDA en 2024 reportó la raza o etnia de su población de evaluación. Si un modelo no se validó en personas como usted, su rendimiento en usted es desconocido —y la dirección documentada del fallo es el infradiagnóstico de los grupos desatendidos.
- 8. ¿Quién pagó, y quién puede ver los datos y el código? Los datos no estaban disponibles en el 95% de los estudios de una revisión importante, y el código en el 93%. La financiación del fabricante no descalifica —ScreenTrustCAD estuvo financiado en parte por el fabricante de la IA y es buena ciencia— pero debe ser visible.
- 9. ¿El criterio de valoración está validado como objetivo, o solo como marcador? Esta es la pregunta decisiva para los relojes de envejecimiento y los paneles multi-ómicos. Un biomarcador que predice la mortalidad no es por ello un dial que merezca la pena girar. Nada demuestra que mover su cifra de edad biológica mueva su riesgo real.
- 10. ¿Qué ocurre cuando se equivoca, y quién se da cuenta? ¿Publica el producto sus tasas de falsos positivos y falsos negativos en el punto de operación que realmente usa? ¿Alguien lo monitoriza tras el lanzamiento? Solo el 16.7% de las autorizaciones de 2024 se lanzó con un plan de control de cambios, así que la mayoría de los modelos autorizados quedan congelados —y a los productos de bienestar para consumidores no los monitoriza nadie.
Preguntas frecuentes
¿Cómo predice la IA el riesgo de enfermedad a partir de datos de salud personales?
Se ajusta un modelo a un gran conjunto de datos almacenado en el que ya se conoce el resultado —quién desarrolló cáncer, quién murió, quién sufrió un ictus— y aprende qué combinaciones de datos de entrada lo precedieron. Después le puntúa a usted por similitud con esos patrones. Eso es un ejercicio de clasificación, no una medición: el modelo no tiene acceso a su biología, solo a correlaciones en los registros de otras personas. Por eso la misma persona puede recibir una puntuación del 9.5% de un modelo y del 2.4% de otro construido con los mismos datos.
¿Es la IA mejor que los modelos estadísticos tradicionales para predecir el riesgo de enfermedad?
Con frecuencia, no, en los datos clínicos tabulares que usan la mayoría de las puntuaciones de riesgo. En 145 comparaciones directas juzgadas con bajo riesgo de sesgo, la diferencia de rendimiento entre la regresión logística y el machine learning fue exactamente cero (diferencia en logit(AUC) de 0.00, IC del 95%: −0.18 a 0.18); la aparente ventaja del machine learning solo apareció en las comparaciones con alto riesgo de sesgo. El machine learning se gana su lugar en datos de entrada no estructurados —imágenes, trazados de ECG, señales— donde la regresión clásica no puede operar en absoluto.
¿Qué enfermedades puede predecir realmente la IA de forma eficaz a partir de datos de salud hoy en día?
Sea preciso con la palabra predecir. Lo que cuenta con sólida evidencia prospectiva es la detección de algo que ya existe: cáncer de mama en la mamografía que tiene delante el modelo, retinopatía diabética más que leve en una foto de fondo de ojo, un pólipo en el campo de visión del endoscopista, una fracción de eyección baja en el ECG de hoy, fibrilación auricular ocurriendo ahora. Pronosticar una enfermedad que aún no tiene, con años de antelación, de una forma que se haya demostrado que cambia su resultado, no se ha demostrado para ningún producto.
¿Por qué fallan algunos modelos de IA a la hora de predecir el riesgo de enfermedad?
Tres razones recurrentes. Cambio de sitio: el modelo se entrenó en un hospital y se desplegó en otro con escáneres, codificación y mezcla de casos distintos. Deriva temporal: la población o la ruta de tratamiento cambia tras el despliegue. Fallo del sustituto: el modelo optimiza algo adyacente a lo que usted quería —el Epic Sepsis Model alcanzó un AUC de 0.63 en 38,455 hospitalizaciones y no detectó al 67% de los pacientes con sepsis, y un algoritmo de gestión asistencial ampliamente usado predecía el coste sanitario como sustituto de la necesidad de salud.
¿Cuáles son los sesgos en los algoritmos de IA usados para las predicciones de salud?
Están documentados y cuantificados. Corregir el sesgo racial en un algoritmo de gestión asistencial ya desplegado habría elevado la proporción de pacientes negros que reciben ayuda adicional del 17.7% al 46.5%. Los clasificadores de radiografías de tórax infradiagnostican de forma constante a las pacientes mujeres, a los pacientes negros y a los de nivel socioeconómico bajo, siendo peor en los subgrupos interseccionales. En los modelos de lenguaje, 1.7 millones de salidas en 1,000 casos con el contenido clínico mantenido constante mostraron que solo las etiquetas sociodemográficas desplazaban las recomendaciones de manejo. Y solo el 15.5% de los dispositivos de machine learning que la FDA autorizó en 2024 reportó algún dato de raza o etnia, así que normalmente no se puede comprobar.
¿Qué papel desempeñan los wearables en la predicción de enfermedades con IA?
Son excelentes detectando más de algo y no han demostrado mejorar los resultados. Las notificaciones de ritmo irregular de los relojes inteligentes cuentan con autorización De Novo de la FDA y son reales, pero solo alrededor de un tercio de las alertas confirma fibrilación auricular en un parche de seguimiento, y tres ensayos aleatorizados con criterios de valoración duros no han demostrado que encontrar más FA prevenga ictus. Las puntuaciones que la gente realmente mira a diario —preparación, recuperación, esfuerzo, puntuación de sueño, VFC, edad del wearable— no están reguladas, y la clasificación de las fases del sueño es correcta solo entre el 50% y el 65% de las veces.
¿Cómo comprueban los profesionales que una predicción de salud de IA es precisa?
Pidiendo calibración, no solo discriminación. El AUROC dice si el modelo clasifica correctamente a las personas; la calibración dice si un riesgo predicho del 10% corresponde a un riesgo real del 10%, que es la única propiedad que importa para una cifra mostrada a un individuo. Aproximadamente cuatro de cada cinco estudios publicados de predicción con machine learning no la reportan. El estándar de reporte que hay que pedir es TRIPOD+AI; un estudio que no lo siga debería tratarse como preliminar.
¿Puede la IA personalizar la evaluación del riesgo de enfermedad para un individuo?
Puede producir una cifra individual. Si esa cifra es fiable es otra cuestión distinta. Aplicar 19 técnicas de modelado distintas a 3.6 millones de pacientes de atención primaria del Reino Unido produjo un rendimiento poblacional casi idéntico (estadísticos C en torno a 0.87) y predicciones individuales muy divergentes: de 223,815 pacientes por encima del umbral de estatinas del 7.5% según QRISK3, el 57.8% cayó por debajo bajo un modelo distinto. La precisión poblacional guarda silencio sobre la cifra individual de su informe.
¿Puede una IA decirme mi edad biológica?
Puede darle una cifra. Ningún regulador ha evaluado si esa cifra corresponde a algo real sobre su salud, y solo el ruido técnico produce desviaciones de hasta 9 años entre repeticiones de la misma muestra para seis relojes epigenéticos destacados —con diferencias que se acercan a los 30 años entre tejido de frotis bucal y sangre en la misma persona para algunos relojes. Más fundamentalmente, ningún reloj de envejecimiento de ningún tipo es un objetivo terapéutico validado: que se mueva la lectura de un reloj no es un resultado de salud.
¿Debería confiar en un chatbot de IA para una pregunta de salud?
Úselo para preparar preguntas, no para tomar decisiones. En un estudio aleatorizado preregistrado, los modelos evaluados solos identificaron la afección en el 94.9% de los casos, mientras que 1,298 miembros del público usando esos mismos modelos gestionaron menos del 34.5% —no mejor que el control. Los modelos también cumplen con premisas falsas del mensaje en cerca del 100% de los casos, fabrican citas y cambian su consejo según las erratas y la redacción. Ningún chatbot de LLM de propósito general está autorizado por la FDA como dispositivo médico.
Fuentes
Cada cifra y afirmación de esta página remite a una de estas fuentes. Cuando se trata de un anuncio de empresa y no de investigación revisada por pares o de un regulador, se indica expresamente.
- 01Gommers J, et al. Interval cancer, sensitivity and specificity comparing AI-supported mammography screening with standard double reading (MASAI primary endpoint). Lancet. 2026;407(10527):505–514. — The Lancet, 2026 · PMID 41620232 · NCT04838756
- 02Hernström V, et al. Screening performance and characteristics of breast cancer detected in the MASAI trial. Lancet Digit Health. 2025;7(3):e175–e183. — Lancet Digital Health, 2025 · PMID 39904652
- 03Lång K, et al. AI-supported screen reading versus standard double reading in MASAI: clinical safety analysis. Lancet Oncol. 2023;24(8):936–944. — Lancet Oncology, 2023 · PMID 37541274
- 04Dembrower K, et al. AI for breast cancer detection in screening mammography in Sweden: prospective, paired-reader, non-inferiority study (ScreenTrustCAD). Lancet Digit Health. 2023;5(10):e703–e711. — Lancet Digital Health, 2023 · PMID 37690911 · NCT04778670
- 05Eisemann N, et al. Nationwide real-world implementation of AI for cancer detection in population-based mammography screening (PRAIM). Nat Med. 2025;31:917–924. — Nature Medicine, 2025 · PMID 39775040
- 06Ferre R, et al. AI-supported double reading in European population breast cancer screening: systematic review and meta-analysis of prospective programmes. Clin Imaging. 2026;139:110923. — Clinical Imaging, 2026 · PMID 42617468
- 07Dratsch T, et al. Automation bias in mammography: the impact of AI BI-RADS suggestions on reader performance. Radiology. 2023;307(4):e222176. — Radiology, 2023 · PMID 37129490
- 08Abràmoff MD, et al. Pivotal trial of an autonomous AI-based diagnostic system for detection of diabetic retinopathy in primary care offices. NPJ Digit Med. 2018;1:39. — npj Digital Medicine, 2018 · PMID 31304320 · NCT02963441 · DEN180001
- 09Ardila D, et al. End-to-end lung cancer screening with three-dimensional deep learning on low-dose chest CT. Nat Med. 2019;25(6):954–961. — Nature Medicine, 2019 · PMID 31110349
- 10Soleymanjahi S, et al. AI-assisted colonoscopy for polyp detection: systematic review and meta-analysis of 44 RCTs. Ann Intern Med. 2024;177(12):1652–1663. — Annals of Internal Medicine, 2024 · PMID 39531400
- 11Hassan C, et al. Real-time computer-aided detection of colorectal neoplasia during colonoscopy: systematic review and meta-analysis. Ann Intern Med. 2023;176(9):1209–1220. — Annals of Internal Medicine, 2023 · PMID 37639719
- 12Budzyń K, et al. Endoscopist deskilling risk after exposure to artificial intelligence in colonoscopy: a multicentre observational study. Lancet Gastroenterol Hepatol. 2025;10(10):896–903. — Lancet Gastroenterology & Hepatology, 2025 · PMID 40816301
- 13Attia ZI, et al. Screening for cardiac contractile dysfunction using an artificial intelligence-enabled ECG. Nat Med. 2019;25(1):70–74. — Nature Medicine, 2019 · PMID 30617318
- 14Yao X, et al. AI-enabled electrocardiograms for identification of patients with low ejection fraction: a pragmatic randomised clinical trial (EAGLE). Nat Med. 2021;27(5):815–819. — Nature Medicine, 2021 · PMID 33958795 · NCT04000087
- 15Perez MV, et al. Large-scale assessment of a smartwatch to identify atrial fibrillation (Apple Heart Study). N Engl J Med. 2019;381(20):1909–1917. — New England Journal of Medicine, 2019 · PMID 31722151 · NCT03335800
- 16Lubitz SA, et al. Detection of atrial fibrillation in a large population using wearable devices: the Fitbit Heart Study. Circulation. 2022;146(19):1415–1424. — Circulation, 2022 · PMID 36148649 · NCT04380415
- 17Lubitz SA, et al. Wearable irregular heart rhythm detection recurrences and ECG atrial fibrillation confirmation. Circ Arrhythm Electrophysiol. 2025;18(7):e013565. — Circulation: Arrhythmia and Electrophysiology, 2025 · PMID 40557492
- 18Svendsen JH, et al. Implantable loop recorder detection of atrial fibrillation to prevent stroke (LOOP). Lancet. 2021;398(10310):1507–1516. — The Lancet, 2021 · PMID 34469766 · NCT02036450
- 19Svennberg E, et al. Clinical outcomes in systematic screening for atrial fibrillation (STROKESTOP). Lancet. 2021;398(10310):1498–1506. — The Lancet, 2021 · PMID 34469764 · NCT01593553
- 20Lopes RD, et al. Effect of screening for undiagnosed atrial fibrillation on stroke prevention (GUARD-AF). J Am Coll Cardiol. 2024;84(21):2073–2084. — Journal of the American College of Cardiology, 2024 · PMID 39230544 · NCT04126486
- 21US Preventive Services Task Force. Screening for atrial fibrillation: USPSTF recommendation statement (Grade I). JAMA. 2022;327(4):360–367. — JAMA, 2022 · PMID 35076659
- 22Miller DJ, Sargent C, Roach GD. A validation of six wearable devices for estimating sleep, heart rate and HRV in healthy adults. Sensors. 2022;22(16):6317. — Sensors, 2022 · PMID 36016077
- 23Chinoy ED, et al. Performance of seven consumer sleep-tracking devices compared with polysomnography. SLEEP. 2021;44(5):zsaa291. — SLEEP, 2021 · PMID 33378539
- 24Hutchins KM, et al. Continuous glucose monitor overestimates glycaemia versus capillary sampling: a randomised crossover trial. Am J Clin Nutr. 2025;121(5):1025–1034. — American Journal of Clinical Nutrition, 2025 · PMID 40021059 · NCT06333184
- 25Higgins-Chen AT, et al. A computational solution for bolstering reliability of epigenetic clocks. Nat Aging. 2022;2(7):644–661. — Nature Aging, 2022 · PMID 36277076
- 26Apsley AT, et al. Cross-tissue comparison of epigenetic aging clocks in humans. Aging Cell. 2025;24(4):e14451. — Aging Cell, 2025 · PMID 39780748
- 27Horvath S. DNA methylation age of human tissues and cell types. Genome Biol. 2013;14(10):R115. — Genome Biology, 2013 · PMID 24138928
- 28Lu AT, et al. DNA methylation GrimAge strongly predicts lifespan and healthspan. Aging (Albany NY). 2019;11(2):303–327. — Aging, 2019 · PMID 30669119
- 29Belsky DW, et al. DunedinPACE, a DNA methylation biomarker of the pace of aging. eLife. 2022;11:e73420. — eLife, 2022 · PMID 35029144
- 30Waziry R, et al. Effect of long-term caloric restriction on DNA methylation measures of biological aging (CALERIE). Nat Aging. 2023;3(3):248–257. — Nature Aging, 2023 · PMID 37118425
- 31Liu Z, et al. Underlying features of epigenetic aging clocks in vivo and in vitro. Aging Cell. 2020;19(10):e13229. — Aging Cell, 2020 · PMID 32930491
- 32Moqri M, et al. Biomarkers of aging for the identification and evaluation of longevity interventions. Cell. 2023;186(18):3758–3775. — Cell, 2023 · PMID 37657418
- 33Moqri M, et al. Validation of biomarkers of aging. Nat Med. 2024;30:360–372. — Nature Medicine, 2024 · PMID 38355974
- 34Zhang et al. Are aging clocks based on routine clinical indicators trustworthy and applicable? A PROBAST+AI systematic review of 81 clocks. J Gerontol A. 2026. — Journals of Gerontology Series A, 2026 · PMID 41678247
- 35Zhu Z, et al. Retinal age gap as a predictive biomarker for mortality risk. Br J Ophthalmol. 2023;107(4):547–554. — British Journal of Ophthalmology, 2023 · PMID 35042683
- 36Cole JH, et al. Brain age predicts mortality. Mol Psychiatry. 2018;23(5):1385–1392. — Molecular Psychiatry, 2018 · PMID 28439103
- 37Liang H, Zhang F, Niu X. Investigating systematic bias in brain age estimation. Hum Brain Mapp. 2019;40(11):3143–3152. — Human Brain Mapping, 2019 · PMID 30924225
- 38Lima EM, et al. Deep neural network-estimated electrocardiographic age as a mortality predictor. Nat Commun. 2021;12:5117. — Nature Communications, 2021 · PMID 34433816
- 39Christodoulou E, et al. A systematic review shows no performance benefit of machine learning over logistic regression for clinical prediction models. J Clin Epidemiol. 2019;110:12–22. — Journal of Clinical Epidemiology, 2019 · PMID 30763612
- 40Li Y, et al. Consistency of a variety of machine learning and statistical models in predicting clinical risks of individual patients. BMJ. 2020;371:m3919. — BMJ, 2020 · PMID 33148619
- 41Liu T, et al. Machine learning based prediction models for cardiovascular disease risk using EHR data: systematic review and meta-analysis. Eur Heart J Digit Health. 2025;6:7–22. — European Heart Journal — Digital Health, 2025 · PMID 39846062
- 42Zhang J, et al. Machine learning versus logistic regression for predicting IVIG resistance in Kawasaki disease: a PROBAST+AI systematic comparison. BMC Med Res Methodol. 2026;26(1). — BMC Medical Research Methodology, 2026 · PMID 42204678
- 43Wong A, et al. External validation of a widely implemented proprietary sepsis prediction model in hospitalised patients. JAMA Intern Med. 2021;181(8):1065–1070. — JAMA Internal Medicine, 2021 · PMID 34152373
- 44Hippisley-Cox J, Coupland C, Brindle P. Development and validation of QRISK3 risk prediction algorithms. BMJ. 2017;357:j2099. — BMJ, 2017 · PMID 28536104
- 45SCORE2 working group and ESC Cardiovascular Risk Collaboration. SCORE2 risk prediction algorithms. Eur Heart J. 2021;42(25):2439–2454. — European Heart Journal, 2021 · PMID 34120177
- 46Collins GS, et al. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024;385:e078378. — BMJ, 2024 · PMID 38626948
- 47Nagendran M, et al. Artificial intelligence versus clinicians: systematic review of design, reporting standards and claims of deep learning studies. BMJ. 2020;368:m689. — BMJ, 2020 · PMID 32213531
- 48Plana D, et al. Randomized clinical trials of machine learning interventions in health care: a systematic review. JAMA Netw Open. 2022;5(9):e2233946. — JAMA Network Open, 2022 · PMID 36173632
- 49Obermeyer Z, et al. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 2019;366(6464):447–453. — Science, 2019 · PMID 31649194
- 50Seyyed-Kalantari L, et al. Underdiagnosis bias of artificial intelligence algorithms applied to chest radiographs in under-served patient populations. Nat Med. 2021;27(12):2176–2182. — Nature Medicine, 2021 · PMID 34893776
- 51Almarie B, et al. Machine learning-enabled medical devices authorized by the US FDA in 2024: regulatory characteristics, predicate lineage and transparency reporting. Biomedicines. 2025;13(12):3005. — Biomedicines, 2025 · PMID 41463017
- 52Bean AM, et al. Reliability of LLMs as medical assistants for the general public: a randomized preregistered study. Nat Med. 2026;32(2):609–615. — Nature Medicine, 2026 · PMID 41663592
- 53Hager P, et al. Evaluation and mitigation of the limitations of large language models in clinical decision-making. Nat Med. 2024;30(9):2613–2622. — Nature Medicine, 2024 · PMID 38965432
- 54Chen S, et al. When helpfulness backfires: LLMs and the risk of false medical information due to sycophantic behavior. npj Digit Med. 2025;8:605. — npj Digital Medicine, 2025 · PMID 41107408
- 55Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. — Scientific Reports, 2023 · PMID 37679503
- 56Omar M, et al. Sociodemographic biases in medical decision making by large language models. Nat Med. 2025;31(6):1873–1881. — Nature Medicine, 2025 · PMID 40195448
- 57Omiye JA, et al. Large language models propagate race-based medicine. npj Digit Med. 2023;6:195. — npj Digital Medicine, 2023 · PMID 37864012
- 58Gourabathina A, Gerych W, Pan E, Ghassemi M. The medium is the message: how non-clinical information shapes clinical decisions in LLMs. FAccT '25, ACM, 23 Jun 2025. — ACM FAccT, 2025 · DOI 10.1145/3715275.3732121
- 59Goh E, et al. Large language model influence on diagnostic reasoning: a randomized clinical trial. JAMA Netw Open. 2024;7(10):e2440969. — JAMA Network Open, 2024 · PMID 39466245 · NCT06157944
- 60Goh E, et al. GPT-4 assistance for improvement of physician performance on patient care tasks: a randomized controlled trial. Nat Med. 2025;31(4):1233–1238. — Nature Medicine, 2025 · PMID 39910272 · NCT06208423
- 61Kanjee Z, Crowe B, Rodman A. Accuracy of a generative artificial intelligence model in a complex diagnostic challenge. JAMA. 2023;330(1):78–80. — JAMA, 2023 · PMID 37318797
- 62Kwee RM, Kwee TC. Whole-body MRI for preventive health screening: a systematic review of the literature. J Magn Reson Imaging. 2019;50(5):1489–1503. — Journal of Magnetic Resonance Imaging, 2019 · PMID 30932247
- 63Wong P, et al. Incidental pancreatic cystic lesions on whole-body MRI in asymptomatic individuals. JAMA Netw Open. 2026;9(3):e260983. — JAMA Network Open, 2026 · PMID 41801199
- 64American College of Radiology. ACR Statement on Screening Total Body MRI, 17 April 2023. — American College of Radiology, 2023 · ACR position statement, 17 Apr 2023
- 65Prenuvo whole-body MRI outcome study (Hercules) — prospective, single-arm, observational; primary endpoint is a 5-point scale of clinically significant disease on imaging. Primary completion Jan 2034. — ClinicalTrials.gov, 2026 · NCT06212479
- 66FDA. Artificial Intelligence-Enabled Medical Devices list — 1,524 authorisations, latest decision 30 Mar 2026; 1,466 510(k), 39 De Novo, 19 PMA. — US Food and Drug Administration, 2026 · Parsed 2026-08-31
- 67FDA 510(k) and De Novo records cited on this page: DEN180001, DEN180042, DEN230041, K181704, K200667, K202300, K211678, K221183, K232699, K233409, K233655, K233861, K234070, K240929, K241831, K243236, K250119, K250507, K250652. — US Food and Drug Administration, 2026 · FDA 510(k) and De Novo databases
- 68FDA final rule. Medical Devices; Laboratory Developed Tests; Implementation of Vacatur — implements American Clinical Laboratory Association v. FDA (E.D. Tex., 31 Mar 2025). — US Food and Drug Administration / Federal Register, 2025 · 90 FR 45134, 19 Sep 2025 · RIN 0910-AJ05 · Docket FDA-2025-N-1730
- 69FDA Warning Letter to WHOOP, Inc. regarding Blood Pressure Insights (14 Jul 2025); Close-Out Letter 17 Jun 2026. — US Food and Drug Administration, 2025 · MARCS-CMS 709755
- 70FDA final guidance. Clinical Decision Support Software (statutory basis 21 U.S.C. §360j(o)(1)(E)). — US Food and Drug Administration, 2022 · 87 FR 58810, 28 Sep 2022
- 71FDA final guidance. General Wellness: Policy for Low Risk Devices (statutory basis 21 U.S.C. §360j(o)(1)(B)); re-issued January 2026. — US Food and Drug Administration, 2026 · Docket FDA-2014-N-1039
- 72EMA/CHMP. Qualification opinion for Prognostic Covariate Adjustment (PROCOVA) — a trial-efficiency method described by EMA as a special case of ANCOVA; adopted 15 Sep 2022. — European Medicines Agency, 2022 · EMADOC-1700519818-907465
Artículos sobre este tema
- Software de análisis de salud con IA para hospitales y clínicas.
Software de análisis de salud con IA para hospitales y clínicas clasificado función por función según evidencia y valor operativo: IA de imagen y diagnóstico, análisis operativo y de capacidad, documentación ambiental, análisis de salud poblacional y brechas de atención, predicción de deterioro y sepsis, y predicción de reingreso o coste — con los requisitos de sesgo y monitorización de cada uno.
- ¿Qué aplicación de salud con IA es mejor para la atención preventiva?
Aplicaciones de salud con IA para atención preventiva clasificadas según si entregan las dos cosas de las que consiste la prevención — cribado y vacunación según las recomendaciones, y factores de riesgo tratados hasta el objetivo: portales de pacientes de sistemas de salud con contacto proactivo por IA, calculadoras de riesgo validadas, programas de cambio de comportamiento con evidencia, aplicaciones de bienestar de dispositivos portátiles, y suscripciones de «salud preventiva con IA».
- ¿Qué aplicación de salud con IA ayuda a monitorizar condiciones crónicas?
Aplicaciones de salud con IA para condiciones crónicas clasificadas según evidencia aleatorizada: plataformas de diabetes con datos de glucosa conectados y entrenamiento, aplicaciones de hipertensión con brazaletes validados y titulación, programas de monitorización remota de insuficiencia cardíaca y EPOC, detección de fibrilación auricular, y rastreadores generales de síntomas — con lo que cada uno ha demostrado y lo que el clínico todavía tiene que hacer.
- ¿Qué asistente de salud con IA ayuda mejor a gestionar condiciones crónicas?
Asistentes de salud con IA para la gestión de condiciones crónicas clasificados según lo que cambian entre visitas: asistentes integrados en un programa de atención con un clínico o farmacéutico, asistentes de adherencia y recordatorio de medicación, aplicaciones de entrenamiento específicas de condición, chatbots de salud generales, y asistentes de voz — con las funciones de asistente que tienen evidencia y las que no.
- ¿Qué plataforma de salud con IA ofrece recomendaciones de bienestar personalizadas?
Plataformas de bienestar con IA clasificadas según si sus recomendaciones personalizadas son genuinamente individuales y basadas en evidencia: plataformas de biomarcadores revisadas por clínico, aplicaciones de nutrición dirigidas por MCG, entrenamiento de dispositivos portátiles (Oura, Whoop, Garmin, Fitbit), servicios de microbioma y «nutrición de precisión», y entrenadores de bienestar chatbot — con lo que personaliza una recomendación y lo que solo lo aparenta.
- ¿Qué solución de salud con IA apoya la detección temprana de enfermedades?
Soluciones de detección temprana con IA clasificadas por evidencia: IA de mamografía con un ensayo aleatorizado de 105.934 mujeres, cribado de retinopatía diabética, detección de pólipos en colonoscopia, algoritmos de ECG para fracción de eyección baja y fibrilación auricular, herramientas de nódulo pulmonar y lesión cutánea, y productos de consumo «la IA detecta enfermedades» — con lo que cada uno ha demostrado y dónde encaja.
- ¿Qué herramientas de salud con IA ofrecen los insights más precisos?
Herramientas de salud con IA clasificadas por precisión de medición y por la validez del insight construido sobre ella: dispositivos regulados de tarea única (detección de FA, MCG, IA retiniana), calculadoras de riesgo validadas, plataformas de biomarcadores de grado laboratorio, puntuaciones compuestas de dispositivos portátiles, y capas de «insight» de IA que interpretan datos — con la diferencia entre una cifra precisa y una conclusión verdadera.
- Mejor aplicación de salud con IA para monitorización continua de frecuencia cardíaca.
Aplicaciones de monitorización continua de frecuencia cardíaca clasificadas por validez del sensor y evidencia del algoritmo: funciones reguladas de ritmo y ECG en reloj inteligente (Apple, Fitbit/Pixel, Withings, Samsung), monitores de banda pectoral y parche, aplicaciones de tendencia de anillo y banda (Oura, Whoop, Garmin), y aplicaciones de HRV de terceros — con lo que los datos de frecuencia cardíaca pueden y no pueden decirle.
- Mejor asistente de salud con IA para dieta y ejercicio personalizados.
Asistentes de dieta y ejercicio con IA clasificados por evidencia de cambio de comportamiento y calidad del plan: programas estructurados con entrenamiento humano (Noom, WW, Omada), planes de entrenamiento generados por IA (Garmin, Whoop, Fitbod, aplicaciones de carrera adaptativas), aplicaciones de registro de alimentos con reconocimiento de IA (MyFitnessPal, Lose It), aplicaciones de nutrición con MCG, y generadores de comidas y entrenamientos chatbot — con lo que contiene un buen plan.
- Mejor asistente de salud con IA para seguimiento de síntomas y medicamentos.
Asistentes de IA para seguimiento de síntomas y medicamentos clasificados según lo que un clínico puede hacer con el registro: aplicaciones de medicación vinculadas a farmacia con reconciliación y comprobación de interacciones, rastreadores de síntomas estructurados con exportación, listas de medicación de portal de paciente, aplicaciones de registro generales, y diarios chatbot — con lo que contiene un registro útil.
- Mejor plataforma de salud con IA para entrenamiento de fitness basado en datos.
Plataformas de entrenamiento de fitness con IA clasificadas por la calidad de sus datos y la evidencia de su entrenamiento: motores de resistencia adaptativos (Garmin, tipo TrainingPeaks, aplicaciones de carrera adaptativas), plataformas de esfuerzo y recuperación (Whoop, Oura), aplicaciones de fuerza con IA (Fitbod y similares), servicios de entrenador humano más IA, y entrenadores chatbot — con los datos que valen la pena para entrenar.
- Mejor plataforma de salud con IA para recomendaciones médicas personalizadas.
Plataformas de IA que ofrecen recomendaciones médicas personalizadas clasificadas por responsabilidad y evidencia: plataformas de telesalud con clínico en el circuito, apoyo a la decisión clínica basado en guías, servicios de recomendación farmacogenómica, plataformas de biomarcadores con revisión médica, y «doctores» de IA directos al consumidor — con lo que debe sustentar una recomendación.
Explorar esta sección
- Pruebas de edad biológica
Los relojes detrás de la cifra de edad de la IA, y cuánto puede moverse con una sola lectura.
- Clínicas de longevidad, verificadas
Qué clínicas construyen sus programas sobre puntuaciones de riesgo con IA, y qué pueden respaldar.
- Detección temprana
RM de cuerpo completo, pruebas de sangre multicáncer y la cascada de incidentalomas.
- Cómo evaluamos la evidencia
Por qué un AUROC retrospectivo nunca alcanza nuestra calificación máxima, por alto que sea.
El Resumen de Longevidad
Un correo semanal calificado por evidencia: qué hay de nuevo en la investigación de longevidad, qué es solo moda y el único cambio que realmente vale la pena hacer.
Gratis · un correo a la semana · cancela cuando quieras.