Volver a Noticias Científicas
Investigación Científica

Detalles del Artículo

Mejorando la precisión y la explicabilidad en la clasificación de lesiones colorrectales con Transformadores de Visión supervisados por atención.

¿Qué significa esto para los pacientes?

AI

Inicia sesión o regístrate para generar explicaciones con IA

La evaluación precisa de la morfología de lesiones colorrectales durante la colonoscopia es esencial para guiar el tratamiento y estimar el riesgo de cáncer. La clasificación de París se adopta ampliamente con este fin, pero sufre de una variabilidad interobservador significativa, mientras que los Vision Transformers (ViTs) basan sus decisiones en patrones de atención difusos y fuera de la lesión que son difíciles de interpretar.

Este estudio investiga si supervisar directamente las mapas de atención del ViT con anotaciones expertas de lesiones puede mejorar concurrentemente el rendimiento de la clasificación de París y la explicabilidad del modelo. Proponemos una Pérdida de Atención Focalizada en Lesión (LLFA), un objetivo de preentrenamiento supervisado por atención que utiliza cajas limitantes de polipos expertas para enfocar la atención [CLS] de la última capa en las regiones anotadas de lesiones, seguido de afinado estándar con entropía cruzada. LLFA se aplica a seis arquitecturas de ViT y se evalúa en el conjunto de datos público SUN para clasificación binaria (0-I vs. 0-II) y triclasificatoria (0-Ip, 0-Is, 0-IIa) de París. El rendimiento se evalúa utilizando precisión por cuadro y AttIn, además realizamos un estudio ablativo contra una base de consistencia Grad-CAM.

La preentrenamiento supervisado por atención genera ganancias consistentes tanto en precisión como en atención focalizada en lesiones. En los seis ViTs, agregar LLFA mejora la precisión triclasificatoria hasta en 7 puntos porcentuales. En un estudio ablativo detallado sobre ViT-B/16, LLFA supera a una base de consistencia Grad-CAM en aproximadamente 5-13 puntos porcentuales en las tareas binarias y triclasificadoras, y pruebas ?2 confirman una asociación significativa entre AttIn alto y predicciones correctas. La supervisión directa de la atención del ViT con LLFA aprovecha el conocimiento experto para mejorar concurrentemente la precisión de clasificación de París y la interpretabilidad espacial, y compara favorablemente con la regularización basada en explicaciones Grad-CAM.

El código fuente y las particiones del conjunto de datos están disponibles públicamente en https://github.com/LucaCarlini/SUNDatasetPretraining.

Inicia sesión o regístrate para acceder al texto completo

Se abre en una nueva pestaña en la publicación original

Compartir y Discutir

Comentarios

¡Aún no hay comentarios. Sé el primero en comentar!

Enviar a mi oncólogo

Artículo: Enhancing accuracy and explainability in colorectal lesion classification with attention-supervised Vision Transformers.

Autores: Carlini L, Di Stefano L, Lena C, Massimi D, Rizkala T, Hassan C, De Momi E
Publicado: 2026-02-20
PMID: 41581326

Enlace: https://crcwarriors.org/article-detail.php?id=1310 | https://pubmed.ncbi.nlm.nih.gov/41581326/

¡Regístrate para usar esta función!

Crea una cuenta gratuita para enviar artículos científicos directamente a tu oncólogo y acceder a muchas más funcionalidades personalizadas.

Regístrate gratis