El cáncer colorrectal (CCR) es difícil de estudiar debido a que sus cambios moleculares son muy complejos a medida que la enfermedad progresa, lo que plantea importantes desafíos para el descubrimiento de biomarcadores robustos. En este estudio, desarrollamos un marco de aprendizaje automático integrando la progresión monótona y el enfoque StepMiner. Realizamos una validación externa para identificar biomarcadores transcripómicos reproducibles y consistentes asociados con la progresión del CCR. Se analizaron conjuntos de datos de expresión génica de cuatro estados de la enfermedad obtenidos de GEO de acceso público: colon normal, adenoma, cáncer colorrectal primario y metástasis.
Primero, identificamos los genes con expresión monótona y, luego, utilizamos el enfoque StepMiner para identificar los genes que actúan como interruptores entre las etapas. Se utilizó una firma de 74 genes equilibrada para la clasificación mediante aprendizaje automático con un Random Forest. La validación externa mostró un buen rendimiento en los conjuntos de datos basados en tejidos.
Sin embargo, las firmas derivadas de tejidos y los conjuntos de datos basados en plasma y sangre mostraron un rendimiento deficiente, lo que destaca las diferencias biológicas entre los perfiles transcripómicos. Se realizó un filtrado cruzado entre los genes derivados de tejidos y los conjuntos de datos de expresión sanguínea, lo que resultó en la selección de 62 firmas de genes compatibles con la sangre. El reentrenamiento sin fugas en GSE164191 logró un AUC medio de 0,868 con una precisión equilibrada. El análisis de enriquecimiento funcional mostró que estos genes están muy activos en el crecimiento del cáncer.
Específicamente, los genes CBX3, S100A11, PDK4, NCOR1 y SOX4 demostraron un rendimiento estable y fiable en todas las divisiones de validación. En general, nuestro estudio presenta un marco transcripómico consciente de la progresión para el descubrimiento de biomarcadores del CCR y demuestra la importancia de la validación externa.
Además, evaluamos si las firmas derivadas de tejidos pueden predecir los perfiles sanguíneos. Este enfoque propuesto puede ayudar al futuro desarrollo de diagnósticos basados en tejidos y estrategias mínimamente invasivas de biopsia líquida para el CCR. Para garantizar la reproducibilidad, nuestro flujo de trabajo propuesto se automatizó como una canalización Nextflow. El modelo derivado de tejidos se implementó como una aplicación utilizando Angular, ASP.NET Core y Plumber (R).
Inicia sesión o regístrate para acceder al texto completo
¡Aún no hay comentarios. Sé el primero en comentar!