Los avances de la IA médica superan la evidencia de mejores resultados para los pacientes
Puntos clave
- •Un ensayo aleatorizado en 16 instalaciones de Penda Health en Kenia encontró que el soporte de modelos de lenguaje de gran escala mejoró la documentación y la calidad diagnóstica, pero no redujo significativamente el fracaso del tratamiento a 14 días, que ocurrió en el 2.2% del grupo con IA frente al 2% de los controles.
- •La FDA de EE. UU. publicó un documento de discusión el 18 de agosto sobre la regulación de dispositivos médicos con IA generativa, abierto a comentarios públicos hasta el 19 de octubre, que aborda la evaluación de riesgos, la evaluación previa a la comercialización y el monitoreo posterior.
- •Un ensayo multicountry encontró que GPT-4o mejoró el desempeño de 249 médicos en viñetas clínicas entre un 7.2% y un 18%, pero el estudio usó casos simulados y no evaluó daños, por lo que los beneficios reales para los pacientes siguen sin establecerse.
- •Un comentario en npj Digital Medicine advirtió que tener un clínico en el circuito no garantiza una supervisión efectiva, porque el sesgo de automatización puede aumentar la probabilidad de aceptar recomendaciones defectuosas de la IA.
- •MarketsandMarkets proyecta que el mercado de IA en salud crecerá de 36.67 mil millones de dólares en 2026 a 194.79 mil millones de dólares para 2031, una tasa de crecimiento anual compuesta del 39.7%.

Un cuerpo creciente de investigación en 2026 destaca una brecha persistente en la inteligencia artificial médica: estos sistemas pueden influir en las decisiones de los médicos y producir resultados diagnósticos impresionantes sin demostrar que los pacientes finalmente mejoren de salud.
El tema importa a los hospitales que evalúan herramientas de IA, a las empresas que buscan demostrar su valor y a los reguladores que deciden qué evidencia debería requerirse después de que estos sistemas entren a la práctica clínica.
Los reguladores examinan el problema de prueba de la IA médica
La brecha entre el rendimiento reportado de la IA y los beneficios demostrados para los pacientes es cada vez más difícil de pasar por alto. El Financial Times resumió el problema en un titular: "La IA médica tiene un problema de prueba."
La cuestión ha trascendido el debate académico. La Administración de Alimentos y Medicamentos de EE. UU. (FDA) está examinando muchas de las mismas cuestiones mientras considera cómo evaluar los dispositivos médicos habilitados con IA antes y después de su despliegue. Un documento de discusión del 18 de agosto, abierto a comentarios públicos hasta el 19 de octubre, aborda la evaluación de riesgos, la evaluación previa a la comercialización y el monitoreo posterior a la comercialización.
La FDA enfatizó que el documento es únicamente un documento de discusión. No es un borrador de directriz, una propuesta de cambio de política ni una indicación de expectativas regulatorias futuras. Aun así, la ventana abierta de comentarios brinda a hospitales, fabricantes de dispositivos e investigadores un canal formal para exponer qué tipos de evidencia consideran que debería requerir el despliegue clínico.
Una solicitud anterior de comentarios públicos de la FDA sobre la medición y evaluación del desempeño en el mundo real de dispositivos médicos habilitados con IA también planteó inquietudes sobre la deriva de los modelos y las limitaciones de depender de métricas estáticas. La deriva del modelo —la degradación que puede ocurrir cuando los pacientes reales o los patrones de práctica se alejan de los datos de entrenamiento de un modelo— es una de las razones por las que una herramienta validada al lanzamiento puede comportarse de manera diferente meses después. Eso deja una pregunta más amplia: ¿cómo deberían medirse la seguridad y la eficacia después de que un sistema de IA sale del labor y entra a la atención clínica?
El soporte de IA no redujo los fracasos del tratamiento en Kenia
Un estudio publicado en Nature Medicine el 26 de junio examinó si un LLM utilizado para la toma de decisiones clínicas mejoraba los resultados de los pacientes. El estudio involucró a 103 oficiales clínicos en 16 instalaciones de Penda Health en los condados de Nairobi y Kiambu. Los oficiales trataron a los pacientes con o sin la asistencia de un modelo de lenguaje de gran escala.
De los 9,691 pacientes registrados, 9,347 fueron incluidos en el análisis primario. El fracaso del tratamiento a los 14 días ocurrió en el 2.2% del grupo con IA y en el 2% del grupo de control. La razón de probabilidades ajustada fue 0.77, pero la diferencia no fue estadísticamente significativa (P=0.13). No se asociaron eventos adversos graves con la intervención.
El grupo con soporte de IA mostró mejor documentación y diagnósticos y planes de tratamiento más apropiados. Sin embargo, esas mejoras en las métricas de proceso no produjeron una mejora en los resultados de los pacientes. Esa brecha es la esencia del problema de prueba: métricas como la documentación y la calidad del diagnóstico son mucho más fáciles de recopilar que resultados como el fracaso del tratamiento, pero los resultados de Penda sugieren que ambas pueden evolucionar de forma independiente.
Un patrón similar apareció en el ensayo RAPIDx AI de 2024. Entre 3,029 pacientes en el análisis primario, el resultado compuesto a seis meses de muerte cardiovascular, infarto de miocardio o reingreso cardiovascular no planificado ocurrió en el 26% de los pacientes que recibieron atención con soporte de IA, en comparación con el 26.4% de quienes recibieron atención estándar. Dentro del grupo de infarto de miocardio no tipo 1, sin embargo, la angiografía coronaria invasiva se realizó un 47% menos con la atención con soporte de IA.
Mayores puntajes de prueba no han establecido beneficios en el mundo real
Un ensayo aleatorizado multicountry liderado por Nicholas Rounding encontró que GPT-4o mejoró el desempeño de 249 médicos en viñetas clínicas en un 18% en Kenia, 10.7% en Indonesia y 7.2% en los Países Bajos (P<0.001). La investigación, sin embargo, utilizó casos simulados en lugar de situaciones clínicas reales. Los participantes del grupo de control no pudieron usar internet ni protocolos clínicos, y el estudio no evaluó daños.
Los resultados muestran que la IA puede mejorar el desempeño en entornos controlados, pero no establecen un efecto sobre los resultados de los pacientes. Esa distinción entre entornos controlados y el mundo real es precisamente el terreno al que apuntan las preguntas de la FDA sobre la evaluación previa y posterior a la comercialización.
Otro estudio de Nature Medicine de Li Zhang, Jakob Nikolas Kather y colegas reportó una precisión del 90.04% en un benchmark de siete enfermedades. Al aplicar un umbral de consistencia, el agente local retuvo el 49.4% de los casos con una precisión del 98.9%, mientras que profesionales humanos revisaron los casos restantes. Los autores dijeron que los hallazgos requieren confirmación adicional en ensayos realizados en entornos clínicos reales. El estudio está disponible aquí.
Un médico en el circuito no es suficiente
Un mapa de evidencia elaborado por Joy Xu, Justin Ko y Joseph Kvedar encontró que la IA agéntica se utiliza no solo para trabajo administrativo, sino también para diagnóstico, gestión y otras tareas de salud. Como resultado, la capacidad de gobernar y auditar estos sistemas se vuelve cada vez más importante. El mapa de evidencia está disponible aquí.
Un comentario aparte en npj Digital Medicine argumentó que simplemente tener un clínico involucrado no garantiza una supervisión ni una gobernanza efectivas. El sesgo de automatización puede hacer que las personas sean más propas a aceptar una recomendación defectuosa. Una supervisión significativa requiere conocimiento, tiempo y autoridad suficientes para cuestionar el sistema e intervenir cuando sea necesario.
Sin esas condiciones, advirtieron los autores, la supervisión humana puede convertirse en poco más que un respaldo de responsabilidad:
La responsabilidad puede recaer sobre clínicos a quienes se espera detecten errores que no están en buena posición para detectar o corregir ... una zona de aplastamiento moral.
El debate, por lo tanto, va más allá de si un humano está técnicamente "en el circuito". También se refiere a si esa persona está equipada para cuestionar, anular y detener el sistema cuando sea necesario. El comentario está disponible aquí.
Los intereses comerciales aumentan la importancia de la evidencia
MarketsandMarkets proyecta que el mercado de IA en salud crecerá de 36.67 mil millones de dólares en 2026 a 194.79 mil millones de dólares para 2031, lo que representa una tasa de crecimiento anual compuesta del 39.7%. La previsión de mercado llega mientras los hospitales se preparan para tomar más decisiones de compra de IA, al tiempo que la evidencia de mejoras en los resultados de los pacientes sigue siendo desigual.
Ese entorno podría aumentar la presión por formas de validación más difíciles de comercializar pero más valiosas para los proveedores: pruebas prospectivas, monitoreo del desempeño local y supervisión que pueda auditarse de forma independiente. Un indicador a corto plazo serán los comentarios que la FDA reciba sobre su documento de discusión, que permanece abierto a comentarios públicos hasta el 19 de octubre.