Antecedentes: El análisis del perfil de metilación del ADN libre en plasma (cfDNA) es prometedor para la detección mínimamente invasiva del cáncer, pero su aplicación se ve limitada por la gran cantidad de datos, el tamaño modesto de las cohortes de cfDNA y la dificultad para definir conjuntos de características con una base biológica sólida. CpGPT, un modelo base de metilación del ADN basado en transformadores, preentrenado con grandes conjuntos de datos de metilación de tejidos, puede permitir la transferencia de representaciones de metilación aprendidas a aplicaciones de cfDNA con datos limitados.
Evaluamos un marco basado en regiones metiladas diferencialmente (DMR) para el ajuste fino de CpGPT para la clasificación del cáncer gastrointestinal utilizando datos de metilación del cfDNA plasmático. Métodos: Se obtuvieron datos de metilación del cfDNA plasmático de la cohorte EpiPanGI Dx, que incluía 254 muestras de cáncer gastrointestinal y 46 controles sin cáncer. Los datos de metilación de tejidos tumorales y normales correspondientes incluyeron 967 pares tumor-normal de 18 tipos de cáncer del The Cancer Genome Atlas (TCGA). Las DMR derivadas de tejidos y las DMR derivadas de cfDNA se identificaron de forma independiente y se cruzaron para definir un conjunto candidato de 20.499 sitios CpG. Se evaluó CpGPT en un análisis de sensibilidad técnica utilizando el panel panGI de 896 CpG publicado previamente y en un ajuste fino basado en DMR utilizando el conjunto candidato de 20.499 CpG.
El rendimiento se comparó con máquinas de vectores de soporte de kernel radial (SVM radial), regresión logística de red elástica, máquinas de impulso de gradiente (GBM) y modelos de bosque aleatorio utilizando las mismas particiones de datos. Resultados: En el análisis de sensibilidad técnica utilizando el panel panGI publicado previamente, la configuración base de CpGPT logró un área media bajo la curva ROC (AUROC) de 0,9799 (IC del 95 %, 0,9654-0,9944) en cuatro semillas aleatorias fijas. Los AUROC individuales variaron de 0,9597 a 0,9927, mientras que las configuraciones vecinas lograron AUROC medios de 0,9661 a 0,9716. Utilizando el conjunto candidato basado en DMR, CpGPT logró un AUROC medio de 0,9904 (IC del 95 %, 0,9715-1,0000) en tres ejecuciones divididas. Los AUROC medios fueron de 0,9573 para SVM radial, 0,9420 para red elástica, 0,8460 para GBM y 0,8408 para bosque aleatorio.
Los AUROC medios específicos del tipo de cáncer variaron de 0,9600 para el adenocarcinoma de páncreas a 1,0000 para el carcinoma de células escamosas esofágico, el cáncer colorrectal y el adenocarcinoma esofágico. Conclusiones: El ajuste fino de CpGPT basado en DMR logró una alta discriminación interna y un AUROC medio más alto que los modelos clásicos de aprendizaje automático evaluados. La integración de la evidencia de metilación del cfDNA plasmático y del tejido proporciona un espacio de características con restricciones biológicas para adaptar un modelo base preentrenado en matrices de tejidos a la clasificación de cfDNA. Se necesita una validación externa independiente, poblaciones de control representativas de la práctica clínica y una mayor reducción del conjunto de características antes de su aplicación en un ensayo de cfDNA dirigido.
Inicia sesión o regístrate para acceder al texto completo
¡Aún no hay comentarios. Sé el primero en comentar!