Volver a Noticias Científicas
Investigación Científica

Detalles del Artículo

Evaluación de modelos de lenguaje de gran tamaño para la asistencia en la preparación para la colonoscopia: corrección y diversidad en diálogos sintéticos.

¿Qué significa esto para los pacientes?

AI

Inicia sesión o regístrate para generar explicaciones con IA

Antecedentes: El cáncer colorrectal es una de las principales causas de muerte relacionada con el cáncer en los Estados Unidos, y la colonoscopia sigue siendo el método de referencia para la detección y prevención temprana.

Sin embargo, muchos procedimientos se posponen debido a una preparación intestinal inadecuada, un fallo prevenible que a menudo se debe a la dificultad de los pacientes para comprender o seguir las instrucciones escritas de preparación. Intervenciones previas, como aplicaciones de recordatorio y vídeos instructivos, han mejorado la adherencia solo modestamente, en gran medida porque no pueden responder a las preguntas específicas de los pacientes.

Los recientes avances en los modelos de lenguaje grandes (LLM) plantean la posibilidad de desarrollar asistentes conversacionales que puedan proporcionar apoyo interactivo a los pacientes en la preparación para el procedimiento. Objetivo: Este estudio evaluó la corrección, la peligrosidad y la diversidad de los diálogos sintéticos generados por los principales LLM, que actuaron tanto como simulaciones de entrenadores de IA como de pacientes para la preparación de la colonoscopia. Métodos: Se utilizaron cinco LLM líderes, OpenAI o3, GPT-4.1 y GPT-5.1, Meta Llama 3.3 70B y Mistral Large-2411, para generar 250 diálogos entre el paciente y el entrenador de IA por modelo. Los diálogos consistieron en 3-7 pares de preguntas y respuestas sobre la dieta, los medicamentos y otros temas relacionados con la preparación. Se diseñó un enfoque de múltiples indicaciones y múltiples preguntas para obtener diversas preguntas de los pacientes, y se estableció una taxonomía de errores para evaluar las capacidades de los modelos para responder a las preguntas. Evaluadores humanos, incluidos tres expertos médicos, evaluaron las preguntas generadas en cuanto a dificultad y las respuestas en cuanto a corrección, tipo de error y posible peligrosidad.

La evaluación automática mediante un enfoque de LLM como juez complementó la evaluación humana. La diversidad de las preguntas se evaluó utilizando métricas de diversidad léxica (Distinct-1, Distinct-2) y entropía.

Además, evaluamos un mecanismo de filtrado de seguridad en el que las respuestas consideradas incorrectas por un evaluador automatizado se reemplazaron con un mensaje de derivación que indicaba a los pacientes que se pusieran en contacto con su proveedor de atención médica. Las diferencias en la corrección de las respuestas entre los modelos se evaluaron utilizando pruebas de permutación realizadas a nivel de diálogo. El acuerdo inter-evaluador entre los evaluadores humanos se evaluó utilizando la estadística AC1 de Gwets.

El estudio se llevó a cabo entre mayo y septiembre de 2025. Resultados: Los resultados de la evaluación automática se alinearon estrechamente con los juicios humanos: los modelos líderes se acercaron, pero no alcanzaron, un rendimiento adecuado. Los modelos de peso cerrado (GPT-5.1, GPT-4.1 y o3) superaron a los modelos de peso abierto (Llama, Mistral) en cuanto a corrección, y los modelos de razonamiento (GPT-5.1 y o3) obtuvieron el mejor rendimiento. Esta clasificación a nivel de turno se mantuvo en la línea de base suplementaria de una sola indicación, aunque las clasificaciones a nivel de diálogo fueron diferentes. Todos los modelos produjeron errores peligrosos, principalmente debido a omisiones o interpretaciones erróneas de las instrucciones de preparación.

La estrategia de generación de múltiples indicaciones aumentó sustancialmente la diversidad de las preguntas de los pacientes en comparación con una línea de base de una sola indicación.

La aplicación de un filtro de seguridad automatizado redujo las tasas generales de error, pero no eliminó las respuestas peligrosas. Conclusiones: Si bien los LLM demuestran un gran potencial para el apoyo a la preparación de la colonoscopia, ninguno es lo suficientemente fiable para su despliegue no supervisado en contextos dirigidos al paciente. Los errores peligrosos persistentes y la eficacia limitada de los mecanismos de filtrado simples resaltan la necesidad de mejorar la adherencia a las instrucciones, fortalecer los mecanismos de seguridad y realizar la validación utilizando consultas reales de los pacientes.

Inicia sesión o regístrate para acceder al texto completo

Se abre en una nueva pestaña en la publicación original

Compartir y Discutir

Comentarios

¡Aún no hay comentarios. Sé el primero en comentar!

Enviar a mi oncólogo

Artículo: Evaluating Large Language Models for Colonoscopy Preparation Assistance: Correctness and Diversity in Synthetic Dialogues

Autores: Kaumenova, T.; Chakraborty, S.; Fosler-Lussier, E.; Gofar, K.; Metcalf, I.; Perrault, A.; White, M.
Publicado: 2026-07-22

Enlace: https://crcwarriors.org/article-detail.php?id=2786

¡Regístrate para usar esta función!

Crea una cuenta gratuita para enviar artículos científicos directamente a tu oncólogo y acceder a muchas más funcionalidades personalizadas.

Regístrate gratis