El análisis de sobre-representación (ORA) es la herramienta de interpretación más utilizada para las listas de genes, a pesar de sus limitaciones bien documentadas: los límites de las vías de señalización son fijos, se asume que los genes son independientes y los resultados dependen del conjunto de referencia. Los métodos basados en redes abordan estos problemas utilizando la modularidad de la red de interacción, pero introducen un sesgo de nodo central: los genes altamente conectados aparecen agrupados en hipótesis nulas ingenuas porque las redes seleccionadas sobre-representan los genes bien estudiados. Las correcciones existentes son imperfectas: la permutación de aristas destruye la topología sobre la que debería basarse la prueba, y los métodos de propagación ocultan el factor de confusión en el ajuste de parámetros. Presentamos MANGO (Autocorrelación de Moran para la sobre-representación de genes en redes), que plantea una pregunta condicional: ¿la autocorrelación espacial de un conjunto de genes en una red biológica fija supera lo que su composición de grado por sí sola predeciría?
MANGO calcula el índice de Moran global bajo una hipótesis nula que condiciona tanto la red como la distribución de grado agrupada del conjunto de genes, y luego descompone las señales significativas a nivel de componente y de gen. En las pruebas de referencia, las hipótesis nulas uniformes producen una tasa de falsos positivos de 1,0 en los conjuntos de genes enriquecidos con nodos centrales sin un agrupamiento real; las hipótesis nulas estratificadas por grado en diez grupos reducen esto a 0,0 sin pérdida de potencia (AUC ≥ 0,98; en las señales de grado típico, |ΔAUC| ≤ 0,004). Las simulaciones de "spike-in" de vías de señalización confirman la detección de un agrupamiento biológico real en diversas vías de señalización y perfiles de grado. Aplicado al estudio de asociación del genoma completo (GWAS) del cáncer colorrectal FIGI (204 SNPs), el conjunto es de grado típico (p de Kolmogorov-Smirnov = 0,83), pero el índice de Moran es altamente significativo (p < 0,001).
El análisis de sensibilidad a nivel de componente localiza toda la señal en un único módulo de 24 genes que abarca TGF-β, Wnt/caderina y vías de señalización relacionadas, con cuatro cuellos de botella (SMAD3, MYC, CTNNB1, PTPN1) que coinciden con la biología de los genes impulsores del cáncer colorrectal (CRC) ya establecida.
Inicia sesión o regístrate para acceder al texto completo
¡Aún no hay comentarios. Sé el primero en comentar!