Saltar al contenido
Salud y Ciencia

ActualidadEstudios explicados4 min de lectura

Una IA lee notas clínicas con un 99% de precisión validada por médicos

Publicado en Nature Medicine, una IA lee notas clínicas con un 99% de precisión validada por médicos y se aplica a 16.000 adultos con GLP-1.

Artículo validado por

Marina Sarrias, Médica

Col·legi Oficial de Metges de Barcelona · nº 64943

Fechas

Publicado
Notas clínicas manuscritas junto a una pantalla con historia clínica electrónica
Notas clínicas manuscritas junto a una pantalla con historia clínica electrónica

En resumen4 claves

  1. 01Una IA lee notas clínicas con un 99,4% de precisión, validada con casos revisados por médicos certificados.
  2. 02El sistema convierte texto libre de las consultas en datos organizados y fáciles de analizar.
  3. 03Analizó a más de 16.000 adultos que empezaron un medicamento GLP-1 y sacó a la luz patrones no visibles en los códigos.
  4. 04Es un hallazgo observacional: quienes tenían mejor control de azúcar al inicio perdieron más peso y más rápido con el fármaco.

Qué se ha descubierto

Un equipo internacional publicó en Nature Medicine un sistema de inteligencia artificial. El sistema lee las notas que escriben los médicos durante la consulta. Saca de ellas datos que las casillas y los códigos de la historia clínica no llegan a recoger. Frente a un estándar fijado por médicos certificados, la herramienta alcanzó un 99,4% de precisión.

Para mostrar qué se puede hacer con esa lectura a gran escala, los autores la aplicaron a más de 16.000 adultos. Todos ellos habían empezado un tratamiento con GLP-1, una familia de fármacos que incluye la semaglutida y la tirzepatida. El sistema sacó a la luz matices presentes solo en el texto libre. Por ejemplo, los motivos del médico para subir o bajar la dosis, o los efectos secundarios que el paciente mencionó de pasada.

Escritorio con documentos clínicos impresos y un bloc de notas manuscritas junto a un portátil cerrado
La validación se hizo frase por frase, comparando la nota original con lo extraído por la IA.

Cómo se hizo el estudio

El trabajo lo lideró RespondHealth, junto a médicos y estadísticos de la Universidad de Drexel y colaboradores de Stanford, la Universidad de Miami, la Universidad de Pensilvania y la Escuela de Medicina Icahn en Mount Sinai. Aparece en Nature Medicine.

Para saber si la herramienta era fiable, los investigadores pidieron a médicos certificados de centros independientes que compararan, frase por frase, lo que había extraído la inteligencia artificial con la nota original. Un médico revisó 100 visitas procedentes de 96 profesionales y 86 centros, con cuatro sistemas distintos de historia clínica electrónica. Un segundo médico revisó una parte de esas visitas. Un tercero, que no sabía qué había dicho cada revisor, resolvió las discrepancias.

Los cinco médicos tardaron unas 70 horas en revisar 120 historias clínicas. El sistema completó cada revisión en segundos. Frente al estándar del tercer revisor, la herramienta alcanzó un 99,4% combinando lo que acertó con lo que se le escapó. Los propios médicos coincidieron entre sí en el 94,7% de las afirmaciones que ambos revisaron, un recordatorio de que el juicio experto también varía.

Después aplicaron el sistema a más de 16.000 adultos que empezaron un GLP-1 en consulta, fuera por diabetes o por pérdida de peso, y siguieron su evolución durante meses.

Qué significa y qué no

El estudio muestra que se puede leer texto clínico a gran escala. La fiabilidad es cercana a la del médico, siempre que esa lectura se compare con revisores humanos.

También aporta un hallazgo concreto sobre los GLP-1, aunque es observacional. Las personas con el azúcar en sangre más controlado al inicio perdieron más peso y más rápido. A los 12 meses, quienes partían con valores normales habían perdido alrededor del 7,7% de su peso corporal. Los que tenían la diabetes mal controlada al comenzar perdieron cerca del 2,7%. El tiempo hasta alcanzar una pérdida del 5% siguió el mismo patrón: unos 210 días para los primeros, y bastante más para los segundos.

Esto no significa que el fármaco funcione mejor en unos pacientes que en otros de forma misteriosa. Es una asociación observada en datos de práctica real. El estudio no descarta que influyan otros factores no medidos, como el apoyo dietético o la actividad física.

Contexto

La mayor parte de la historia clínica vive en texto libre, no en códigos. El paciente cuenta sus síntomas, el médico anota matices, justifica cambios de medicación y registra efectos adversos. La investigación con datos del mundo real suele apoyarse solo en los códigos. Deja fuera ese texto, lo que limita los estudios sobre todo lo que no se codifica de manera sistemática.

En los últimos años se han publicado trabajos aplicando procesamiento de lenguaje natural (técnicas que permiten a una computadora leer y entender texto) a notas clínicas en áreas como odontología, detección de hipoglucemias (bajadas de azúcar en sangre), gravedad del ictus (accidente cerebrovascular) o anotaciones de raza y etnia. La misma idea de comparar el resultado de la herramienta con el criterio de médicos revisores se ha aplicado también a detectar anemia con una foto del párpado y a delimitar el corazón en resonancias magnéticas. El nuevo estudio aporta un sistema generalista validado por múltiples revisores y aplicado a un caso con miles de pacientes.

Qué falta por saber

Quedan preguntas abiertas. El sistema se entrenó y validó sobre notas de consultas ambulatorias en Estados Unidos. Habría que ver si mantiene esa precisión en otros idiomas, sistemas sanitarios y entornos, como urgencias u hospitalización.

Falta también medir su comportamiento ante notas ambiguas, incompletas o mal escritas, algo frecuente en la práctica. Los autores insisten en que cualquier dato extraído por el sistema debe pasar por revisión humana antes de usarse en decisiones clínicas.

Sobre el hallazgo de los GLP-1, hay que recordar que es observacional: muestra una asociación en miles de pacientes reales, pero no sustituye a un ensayo clínico controlado que aclare si los pacientes con peor control de azúcar pierden menos peso por causas biológicas o por otros factores no incluidos en el análisis.

Compartir

Fuentes

5 referencias
  1. [1]
  2. [2]
  3. [3]
    Natural language processing for clinical notes in dentistry: A systematic review. · Journal of biomedical informatics · 2023 · pubmed.ncbi.nlm.nih.gov
  4. [4]
  5. [5]
    Automated Extraction of Stroke Severity From Unstructured Electronic Health Records Using Natural Language Processing. · Journal of the American Heart Association · 2024 · pubmed.ncbi.nlm.nih.gov

Preguntas frecuentes

3
¿Puede una IA equivocarse al leer la historia clínica?
Sí. Por eso el estudio hizo revisar los casos por médicos certificados. Alcanzó un 99,4% frente al estándar fijado por un tercer revisor, pero los propios autores insisten en que los datos extraídos deben pasar por una persona antes de usarse.
¿Qué descubrió el sistema sobre los medicamentos GLP-1?
Que las personas con mejor control de azúcar al inicio perdieron más peso y más rápido que quienes tenían la diabetes peor controlada. A los 12 meses, la pérdida media fue del 7,7% frente al 2,7%. Es un hallazgo observacional, no una causalidad demostrada.
¿La IA va a sustituir a los médicos en la lectura de las notas?
No. La herramienta está pensada para ampliar la investigación a partir de historias clínicas, no para reemplazar el juicio clínico. En el estudio se compara con médicos, no se plantea como sustituto.

Sigue leyendo

Más de Ciencia