La evaluación precisa de la morfología de lesiones colorrectales durante la colonoscopia es esencial para guiar el tratamiento y estimar el riesgo de cáncer. La clasificación de París se adopta ampliamente con este fin, pero sufre de una variabilidad interobservador significativa, mientras que los Vision Transformers (ViTs) basan sus decisiones en patrones de atención difusos y fuera de la lesión que son difíciles de interpretar.
Este estudio investiga si supervisar directamente las mapas de atención del ViT con anotaciones expertas de lesiones puede mejorar concurrentemente el rendimiento de la clasificación de París y la explicabilidad del modelo. Proponemos una Pérdida de Atención Focalizada en Lesión (LLFA), un objetivo de preentrenamiento supervisado por atención que utiliza cajas limitantes de polipos expertas para enfocar la atención [CLS] de la última capa en las regiones anotadas de lesiones, seguido de afinado estándar con entropía cruzada. LLFA se aplica a seis arquitecturas de ViT y se evalúa en el conjunto de datos público SUN para clasificación binaria (0-I vs. 0-II) y triclasificatoria (0-Ip, 0-Is, 0-IIa) de París. El rendimiento se evalúa utilizando precisión por cuadro y AttIn, además realizamos un estudio ablativo contra una base de consistencia Grad-CAM.
La preentrenamiento supervisado por atención genera ganancias consistentes tanto en precisión como en atención focalizada en lesiones. En los seis ViTs, agregar LLFA mejora la precisión triclasificatoria hasta en 7 puntos porcentuales. En un estudio ablativo detallado sobre ViT-B/16, LLFA supera a una base de consistencia Grad-CAM en aproximadamente 5-13 puntos porcentuales en las tareas binarias y triclasificadoras, y pruebas ?2 confirman una asociación significativa entre AttIn alto y predicciones correctas. La supervisión directa de la atención del ViT con LLFA aprovecha el conocimiento experto para mejorar concurrentemente la precisión de clasificación de París y la interpretabilidad espacial, y compara favorablemente con la regularización basada en explicaciones Grad-CAM.
El código fuente y las particiones del conjunto de datos están disponibles públicamente en https://github.com/LucaCarlini/SUNDatasetPretraining.
Inicia sesión o regístrate para acceder al texto completo
¡Aún no hay comentarios. Sé el primero en comentar!