Volver a Noticias Científicas
Investigación Científica

Detalles del Artículo

Aprendizaje de representación gráfica multimodal para la identificación de células malignas a partir de datos de secuenciación de ARN de células individuales (scRNA-seq) mediante DeepMalignant.

¿Qué significa esto para los pacientes?

AI

Inicia sesión o regístrate para generar explicaciones con IA

Distinguir las células malignas de las células normales en los datos de secuenciación de ARN de una sola célula sigue siendo una tarea fundamental pero desafiante en la genómica del cáncer. Los métodos existentes a menudo sufren de una precisión deficiente, una aplicabilidad limitada a diferentes tipos de cáncer y una menor solidez en las distintas plataformas de secuenciación. Desarrollamos DeepMalignant, un autoencoder de atención de grafos multimodal no supervisado para la identificación de células malignas que integra conjuntamente la información de la expresión génica y las alteraciones del número de copias (CNA). Aplicamos DeepMalignant a cinco conjuntos de datos que abarcan 26 muestras y cuatro tipos de cáncer (cáncer de mama, colorrectal, páncreas y ovario), generados por tres plataformas (10x Genomics, inDrop y Drop-seq) para la evaluación comparativa, y lo comparamos con los métodos de última generación existentes, como scMalignantFinder, PreCanCell, CopyKAT, ikarus y Cancer-Finder.

DeepMalignant logró el mejor equilibrio general de precisión y exhaustividad, y superó constantemente a los métodos existentes que utilizaban la expresión génica o el CNA en las puntuaciones F1. Los estudios de ablación mostraron que tanto la ponderación de los bordes basada en el CNA como la agregación de la atención del grafo contribuyen de forma independiente al rendimiento, y el análisis de atribución indicó además que las incrustaciones aprendidas capturan programas malignos biológicamente significativos. Aplicamos además DeepMalignant a dos muestras de carcinoma ductal in situ (CDIS), DCIS2 y DCIS1, que tienen datos de transcriptómica espacial y secuenciación de ARN de una sola célula coincidentes. DeepMalignant identificó regiones enriquecidas en tumores que eran muy consistentes con la imagen histológica correspondiente.

El análisis posterior de las comunicaciones célula-célula reveló que tanto la C3 como la MIF derivadas de los fibroblastos dirigían la señalización más hacia las células epiteliales normales que hacia las células epiteliales tumorales, lo que demuestra que la clasificación precisa de las células tumorales y normales mediante DeepMalignant permite una investigación biológicamente significativa del microambiente tumoral y revela cómo las células del estroma se comunican de forma diferente con las poblaciones epiteliales malignas y normales.

Acceso Abierto ~18,339 palabras · 92 min de lectura

La Figura 1 proporciona una descripción general del flujo de trabajo de DeepMalignant y los análisis posteriores. DeepMalignant toma como entrada datos de secuenciación de ARN de una sola célula, incluyendo una matriz de expresión génica y una matriz inferida de alteraciones del número de copias (CNA) (Figura 1A). La matriz de expresión génica se utiliza para definir características de nodos derivadas del ARN basadas en genes de firma asociados al cáncer, mientras que la matriz de CNA se utiliza para construir relaciones célula-célula informadas por CNA. Específicamente, la similitud de CNA por pares se utiliza para definir aristas ponderadas entre células, produciendo un gráfico en el que cada nodo representa una célula y cada arista refleja la similitud genómica entre las células (Figura 1B). Este gráfico multimodal se pasa luego a un autoencoder de atención de grafos, donde el codificador aprende incrustaciones celulares de baja dimensión a través del paso de mensajes ponderado por CNA y el decodificador reconstruye las características de entrada para estabilizar el aprendizaje de la representación (Figura 1C). Las incrustaciones aprendidas se agrupan posteriormente en el espacio latente de baja dimensión utilizando el algoritmo de detección de comunidades Leiden [[15]] (Figura 1D). Para asignar etiquetas biológicas a estos grupos, DeepMalignant calcula las puntuaciones de carga de CNA a nivel de grupo y ajusta un modelo de mezcla gaussiana de dos componentes, donde los grupos con mayor carga de CNA se clasifican como malignos y los grupos restantes se clasifican como normales (Figura 1E-F). Más allá de la identificación de células malignas, el modelo aprendido también admite la interpretación y las aplicaciones posteriores. Cuantificamos la contribución relativa de CNA y las vías transcripcionales relacionadas con el cáncer utilizando puntuaciones de importancia basadas en perturbaciones y aplicamos además DeepMalignant a datos de transcriptómica espacial para identificar regiones enriquecidas en tumores y composiciones de tipos de células en puntos normales, y caracterizar las comunicaciones célula-célula (Figura 1G-I).

Descripción general de la evaluación comparativa

Evaluamos exhaustivamente la precisión, la exhaustividad y la exactitud (puntuación F1) de DeepMalignant aplicándolo a múltiples datos de scRNA-seq, que abarcan cuatro tipos de cáncer (mama, ovario, colorrectal y páncreas), tres tecnologías de secuenciación (10x Genomics, Drop-seq e inDrop) y un total de 26 muestras (detalles de los conjuntos de datos que se pueden ver en Apéndice suplementario Tabla 1). Estos conjuntos de datos se obtuvieron del Curated Cancer Cell Atlas, que proporcionó el etiquetado de referencia de las células malignas. Comparamos DeepMalignant con cinco métodos de última generación, incluyendo scMalignantFinder, PreCanCell, ikarus, Cancer-Finder y CopyKAT. Los resultados detallados para cada muestra y cada método se informan en Conjunto de datos S1.

La Figura 2A presenta la exhaustividad, la precisión y las puntuaciones F1 en los cinco conjuntos de datos de referencia, proporcionando una descripción general del rendimiento de los seis métodos, incluido DeepMalignant. Entre los seis métodos, ikarus tiene el peor rendimiento, con puntuaciones medianas de exhaustividad y F1 de 0. scMalignantFinder exhibe la menor precisión en general; su patrón característico de alta exhaustividad combinado con baja precisión se ha informado previamente [[4]]. PreCanCell muestra un perfil de rendimiento similar a scMalignantFinder, aunque con una precisión ligeramente mayor. CopyKAT, CancerFinder y DeepMalignant son sustancialmente más competitivos que ikarus, scMalignantFinder y PreCanCell. Aunque CopyKAT alcanza puntuaciones medianas de precisión (0.9651) y F1 (0.9528) ligeramente superiores a las de DeepMalignant (0.9519, 0.9459), su puntuación mediana de exhaustividad (0.9819) es menor (0.9909), y produce puntuaciones F1 cero para varias muestras, probablemente atribuible a una selección incorrecta de la línea de base diploide. CancerFinder alcanza la mayor exhaustividad de todos los métodos; sin embargo, su precisión mediana (0.8956) es inferior a la de DeepMalignant (0.9519), y su puntuación F1 mediana (0.9437), aunque cercana, sigue siendo inferior a la de DeepMalignant (0.9459). En general, DeepMalignant obtuvo las segundas puntuaciones F1 medianas más altas al tiempo que mantenía el mejor equilibrio entre la exhaustividad y la precisión, y la robustez. Las siguientes secciones examinan el rendimiento de cada método en conjuntos de datos individuales, organizados por tipo de cáncer y plataforma de secuenciación, para proporcionar una comprensión más detallada de las fortalezas y limitaciones de cada método. Apéndice suplementario: detalles de la ejecución de los métodos existentes enumera los detalles de la implementación de la evaluación comparativa para cada método.

DeepMalignant logró una identificación precisa y robusta de células malignas en los conjuntos de datos de cáncer de mama y cáncer colorrectal secuenciados por 10x Genomics

Primero aplicamos DeepMalignant a dos conjuntos de datos de scRNA-seq de cáncer de mama generados por 10x Genomics: Gao et al. [[1]] y Qian et al. [[16]], que comprenden un total de 11 muestras de cáncer de mama y 20 673 células. El conjunto de datos de Gao et al. incluye una muestra de carcinoma ductal in situ (DCIS1) y tres muestras de cáncer de mama triple negativo (TNBC1-TNBC3), mientras que el conjunto de datos de Qian et al. incluye siete muestras adicionales de cáncer de mama. Para ambos conjuntos de datos, se obtuvieron etiquetas de células malignas y normales de las anotaciones de referencia, y las matrices de expresión génica se preprocesaron utilizando procedimientos estándar de filtrado y normalización antes de la construcción del gráfico.

Para estos dos conjuntos de datos de cáncer de mama, evaluamos DeepMalignant y los cinco métodos de última generación utilizando la precisión, la exhaustividad y la puntuación F1 por muestra para las células malignas, como se muestra en la Figura 2B. DeepMalignant logró consistentemente la puntuación F1 más alta (puntuación F1 mediana: 0.9713). CopyKAT y CancerFinder ocuparon el segundo y tercer lugar (puntuación F1 mediana: 0.9600 y 0.9480, respectivamente), mientras que PreCanCell, scMalignantFinder e Ikarus tuvieron un rendimiento sustancialmente peor (puntuación F1 mediana < 0.7 para los tres). En este conjunto de datos, la puntuación F1 de CopyKAT exhibió una varianza considerablemente mayor (0.1097) que la de DeepMalignant (0.0022), y una muestra (Qian et al., muestra 42) produjo una puntuación F1 cero, lo que indica una selección incorrecta de la línea de base diploide por parte de CopyKAT. CancerFinder logró la mayor exhaustividad de todos los métodos (mediana: 0.9997), superando ligeramente a DeepMalignant (mediana: 0.9923); por el contrario, la precisión de DeepMalignant (mediana: 0.9575) fue sustancialmente mayor que la de CancerFinder (mediana: 0.9011). Aunque CopyKAT obtuvo la mayor precisión mediana en general, produjo una puntuación de precisión cero para la muestra 42 en Qian et al., lo que socava su robustez. En general, en los conjuntos de datos de cáncer de mama de Gao et al. y Qian et al. secuenciados con 10x, DeepMalignant logró la puntuación F1 más alta y el mejor equilibrio entre la exhaustividad y la precisión.

Luego, evaluamos DeepMalignant en el conjunto de datos de scRNA-seq de cáncer colorrectal de Lee et al. [[17]] generado por la tecnología 10x Genomics. Este conjunto de datos comprende 14 muestras de cáncer colorrectal y 20 977 células. DeepMalignant mostró un rendimiento favorable en comparación con la mayoría de los métodos de última generación para este conjunto de datos (Figuras 2C). En particular, DeepMalignant logró la segunda puntuación F1 mediana más alta (0.973) entre los seis métodos, solo después de CopyKAT (0.9818). Aunque DeepMalignant sufrió una baja precisión para una muestra de cáncer colorrectal (precisión = 0.2268, puntuación F1 = 0.3697) en este conjunto de datos, la precisión y la puntuación F1 de todas las demás muestras se mantuvieron altas (precisión ≥ 0.7394, F1 ≥ 0.8502). CopyKAT sufrió una baja puntuación F1 para dos muestras (0 y 0.3553), lo que demuestra que no es tan robusto como DeepMalignant en este conjunto de datos de cáncer colorrectal. Investigamos más a fondo la muestra en la que la puntuación F1 de CopyKAT fue cero (muestra SMC18) y descubrimos que CopyKAT informó que encontraron "baja confianza en la clasificación", lo que demuestra que no pudieron establecer de manera confiable una línea de base diploide. Cuando CopyKAT seleccionó la línea de base incorrecta, sus etiquetas aneuploides y diploides se invirtieron, lo que provocó una puntuación F1 cercana a cero para la muestra. Esto demostró que CopyKAT estaba muy restringido por su selección de la línea de base normal, que dependía del número de células normales en la muestra y los perfiles de CNA de las células normales.

En general, DeepMalignant obtuvo la mayor precisión y consistencia en los conjuntos de datos de cáncer de mama y cáncer colorrectal de 10x Genomics. Cancer-Finder y CopyKAT fueron los siguientes métodos más competitivos. Sin embargo, CopyKAT sufrió una mala exhaustividad, precisión y puntuación F1 para algunas muestras atípicas en los conjuntos de datos de Qian y Lee. También dependía en gran medida de la selección correcta de la línea de base normal. Cancer-Finder, por otro lado, tuvo una menor precisión y puntuación F1 medianas que DeepMalignant en los tres conjuntos de datos.

DeepMalignant fue robusto para las muestras de cáncer de ovario secuenciadas por Drop-seq

Evaluamos aún más DeepMalignant en un conjunto de datos de cáncer de ovario metastásico secuenciado por Drop-seq de Olalekan et al. [[18]]. Este conjunto de datos contiene seis muestras que comprenden un total de 6018 células. Aplicamos los seis métodos (DeepMalignant, ikarus, scMalignantFinder, PreCanCell, CopyKAT y Cancer-Finder), de los cuales ikarus no pudo ejecutarse correctamente en este conjunto de datos utilizando la canalización predeterminada recomendada por los autores y, por lo tanto, se excluyó de la comparación cuantitativa.

De los cinco métodos, DeepMalignant demostró un rendimiento robusto, sólido y equilibrado entre la exhaustividad y la precisión en este conjunto de datos de cáncer de ovario (Figuras 2D). Su puntuación F1 mediana (0.873) fue la segunda más alta después de CopyKAT (0.936). Sin embargo, CopyKAT sufrió una baja exhaustividad en las muestras atípicas, y su puntuación F1 más baja fue inferior a 0.5, posiblemente porque dependía únicamente de las señales del número de copias. En contraste, DeepMalignant demostró un buen equilibrio entre la exhaustividad y la precisión, gracias a que incorporó tanto la expresión génica como las señales del número de copias. Al igual que en los conjuntos de datos de 10x Genomics, scMalignantFinder y PreCanCell mostraron resultados menos favorables que DeepMalignant en la exhaustividad, la precisión y la puntuación F1 en este conjunto de datos. Cancer-Finder demostró una alta exhaustividad en general, pero su puntuación F1 mediana (0.836) es inferior a la de DeepMalignant (0.8731).

En general, DeepMalignant demostró su capacidad para aplicarse a un conjunto de datos de Drop-seq en el conjunto de datos de cáncer de ovario metastásico, lo que destaca su equilibrio, robustez y alta puntuación F1 entre la exhaustividad y la precisión.

DeepMalignant mantuvo de forma única una identificación robusta de células malignas en un conjunto de datos de cáncer de páncreas secuenciado mediante la secuenciación inDrop

Para evaluar aún más DeepMalignant en un tipo de tumor y una plataforma de secuenciación distintos, aplicamos DeepMalignant y otros cinco métodos de última generación a un conjunto de datos de adenocarcinoma ductal pancreático (PDAC) de una sola célula generado utilizando la tecnología inDrop de Moncada et al. [[19]]. Este conjunto de datos contiene dos muestras de cáncer de páncreas, PDACA y PDACB, que comprenden 1590 y 1257 células, respectivamente.

Dado que solo había dos muestras, mostramos la exhaustividad y la precisión utilizando un gráfico de radar (Figura 3A). En este conjunto de datos, DeepMalignant demostró de forma única un rendimiento sólido y muy equilibrado para ambas muestras de PDAC, logrando puntuaciones F1 casi idénticas de 0.9449 en PDACA y 0.9448 en PDACB. En contraste, CopyKAT falló en PDACB tanto en la exhaustividad como en la precisión, y su puntuación F1 se redujo a 0.0073. Otros métodos, como PreCanCell, Cancer-Finder y scMalignant, mostraron una alta exhaustividad para PDACA y PDAC_B, pero una baja precisión, lo que se muestra en el gráfico de radar como una forma más de diamante que de cuadrado. En este conjunto de datos, ikarus no pudo ejecutarse correctamente utilizando la canalización predeterminada recomendada por los autores y, por lo tanto, se excluyó de la evaluación comparativa.

Para dilucidar las razones del fracaso de los métodos de última generación en las dos muestras de cáncer de páncreas, visualizamos las proyecciones UMAP del conjunto de genes de firma de entrada para ambas muestras, PDACA (Figura 3B) y PDACB (Figura 3C). En ambos casos, los perfiles transcriptómicos de las células malignas se superponían sustancialmente con los de las células normales, lo que ilustra la dificultad inherente de depender únicamente de las características transcriptómicas para la identificación de células malignas en este conjunto de datos. En contraste, las muestras de cáncer de mama de Gao et al. (DCIS1, TNBC1–3) exhibieron una separación marcadamente más clara entre las células malignas y las normales, con límites de clústeres bien definidos observados de manera consistente en las cuatro muestras (Apéndice suplementario, Figura S1). En conjunto, estos resultados demostraron que las diferencias transcriptómicas entre las células malignas y las normales eran considerablemente más ambiguas en el conjunto de datos de cáncer de páncreas de Moncada que en la cohorte de cáncer de mama, lo que refuerza la necesidad de incorporar modalidades complementarias más allá de la expresión génica para una identificación robusta de células malignas.

Para investigar el fracaso de CopyKAT en PDACB, examinamos los recuentos de expresión normalizados para ambas muestras (Figura 3D). El análisis de PDACB reveló una variación escasa del número de copias en todo el genoma, caracterizada por una única amplificación en el cromosoma 7 y deleciones aisladas en los cromosomas 5, 15, 16, 17 y 22. Atribuimos el bajo rendimiento de los métodos existentes a la debilidad concomitante tanto de las señales transcriptómicas como de la variación del número de copias en esta muestra, que individualmente resultaron insuficientes para una identificación fiable de células malignas. Estos hallazgos destacaron una ventaja clave de DeepMalignant: al aprovechar conjuntamente ambas modalidades, mantuvo una discriminación robusta entre las células malignas y las normales, incluso cuando cualquiera de las dos señales por sí sola no era informativa.

DeepMalignant identificó correctamente las áreas malignas y normales en dos muestras de transcriptómica espacial de DCIS

Evaluamos además la capacidad de DeepMalignant para generalizar más allá de scRNA-seq a datos de transcriptómica espacial aplicándolo a dos muestras de carcinoma ductal in situ (DCIS), DCIS1 y DCIS2, del estudio de Wei et al. [[20]], que se analizaron utilizando la plataforma 10x Genomics Visium, que incluía las coordenadas espaciales para cada punto.

Presentamos las distribuciones espaciales de las predicciones de áreas malignas (naranja) y normales (azul) para la muestra DCIS2 en DeepMalignant (Figura 4A), DeepMalignant con pesos de borde constantes (Figura 4B) y cuatro métodos existentes (Figura 4C–F). Se incluyó la variante de DeepMalignant con pesos de borde constantes para examinar la contribución de los perfiles del número de copias al rendimiento general del modelo en DeepMalignant. Como referencia, se muestra la imagen de histopatología correspondiente con las regiones tumorales anotadas por expertos, adaptada de [[20]], en la Figura 4H, que corresponde a la subregión delimitada por el cuadro rojo en la Figura 4A. Como se describe en [[20]], esta subregión abarca once regiones tumorales anotadas (T1–T11). La región enmarcada de la Figura 4A se amplió para que coincidiera con el tamaño de la imagen de histopatología en la Figura 4H, lo que dio como resultado la Figura 4G. En la misma figura, también agrupamos manualmente las áreas malignas en función de sus posiciones, al compararlas con la anotación de expertos de la imagen de histopatología en la Figura 4H, lo que mostró que las predicciones de DeepMalignant de las áreas malignas para DCIS2 tenían una concordancia casi perfecta con las anotaciones derivadas de la histopatología. El examen de las Figuras 4B–F reveló que los métodos de la competencia obtuvieron resultados sustancialmente peores. La eliminación de los perfiles del número de copias de los pesos de borde en la variante de peso de borde constante interrumpió la coherencia espacial entre las áreas malignas, lo que dio como resultado regiones de predicción fragmentadas. CopyKAT (Figura 4C) y Cancer-Finder (Figura 4E) exhibieron una tendencia sistemática a sobreestimar las áreas malignas, fusionando erróneamente T5 con T6 y T7 a través de T9 en regiones contiguas. Esta sobreestimación de las áreas malignas se exacerbó aún más en scMalignantFinder y PreCanCell, y scMalignantFinder clasificó casi todos los puntos como malignos. En conjunto, DeepMalignant logró la mayor precisión espacial en la identificación de áreas malignas en el conjunto de datos DCIS2 10x Visium.

Luego aplicamos DeepMalignant a DCIS1 y encontramos un patrón similar al de DCIS2 (Apéndice suplementario, Figura S4). Como en DCIS2, DeepMalignant produjo regiones tumorales espacialmente coherentes, mientras que DeepMalignant con peso de borde constante y los cuatro métodos de la competencia mostraron regiones de áreas malignas fragmentadas o áreas malignas sobreestimadas.

En conjunto, estos resultados demostraron que DeepMalignant distinguió con precisión las áreas malignas de las normales en los datos de transcriptómica espacial basados en Visium, debido a su integración conjunta de los perfiles transcriptómicos y del número de copias. Las predicciones espacialmente fragmentadas observadas en la variante de peso de borde constante, que carecía de la entrada del perfil del número de copias, destacaron el papel complementario indispensable de las señales de variación del número de copias junto con la expresión génica para lograr una identificación de áreas malignas coherente y precisa.

Las identidades celulares espaciales y las comunicaciones célula-célula en DCIS2 revelan señales contrastantes de fibroblastos a células epiteliales entre células epiteliales normales y malignas

Dado que DeepMalignant nos proporcionó la capacidad de identificar las áreas normales en los datos de 10x Visium, integramos además la predicción de áreas normales en DCIS2 con una referencia de scRNA-seq coincidente (Métodos: Anotación de tipo celular y análisis de comunicación espacial en DCIS2) para anotar las composiciones de tipo celular de cada área normal utilizando RCTD [[21]]. La Figura 5A muestra el gráfico circular resultante para cada área, mientras que el tamaño de cada gráfico se basa en los pesos inferidos de RCTD para el tipo celular correspondiente. El compartimento normal estaba dominado por las contribuciones epiteliales en gran parte del tejido, mientras que las mezclas enriquecidas en fibroblastos y mieloides eran más prominentes en regiones localizadas, particularmente en las porciones central e inferior-central de la sección. Las contribuciones de células endoteliales, células B, células T y células NK eran comparativamente escasas y espacialmente dispersas. Las regiones tumorales ocupaban áreas espacialmente distintas de la sección y estaban en gran medida separadas de estas mezclas normales heterogéneas.

Luego investigamos más a fondo la comunicación célula-célula en DCIS2 ejecutando COMMOT [[22]], dadas las anotaciones de las áreas malignas y normales de DeepMalignant, lo que nos permitió analizar los pares de ligandos y receptores entre los diferentes tipos de células (Métodos: Anotación de tipo celular y análisis de comunicación espacial en DCIS2). Descubrimos que el C3 y el MIF derivados de los fibroblastos dirigían la señalización preferentemente hacia las células epiteliales normales en lugar de las células epiteliales tumorales en el microambiente de DCIS, a través de los ejes C3–C3AR1 y MIF–CD74/CD44, respectivamente (Figura 5B-C), lo que refleja un patrón más amplio en el que las células epiteliales tumorales de DCIS parecen desconectarse de los circuitos parácrinos homeostáticos de los fibroblastos. Para el eje C3–C3AR1, proponemos que la señalización preferencial hacia las células epiteliales normales está impulsada por la pérdida de la expresión de C3AR1 en las células epiteliales tumorales, un fenómeno que se atribuyó previamente al silenciamiento epigenético a través de la metilación del promotor en múltiples tipos de cáncer, mientras que las células epiteliales normales conservan la expresión intacta de C3AR1 y siguen siendo los principales receptores de la señal [[23]].

Para el eje MIF–CD74/CD44, la transducción de señal eficaz requiere la formación de un complejo cis entre CD74 y CD44 como un requisito absoluto para la activación posterior de ERK1/2 [[24], [25]]; especulamos que en DCIS2 positivo para ER/negativo para RP, CD74 se redujo en el compartimento epitelial tumoral, lo que hizo que el complejo receptor fuera no funcional y redirigiera el MIF de los fibroblastos hacia el epitelio normal adyacente donde se mantuvo la expresión de CD74 [[26], [27]].

En conjunto, estos hallazgos sugieren que las células epiteliales tumorales de DCIS podrían retirarse de la señalización homeostática derivada de los fibroblastos a través de la pérdida convergente de receptores, lo que apunta a la desconexión del estroma como una característica temprana y coordinada de la evasión inmunitaria en el cáncer de mama preinvasivo.

El análisis de ablación destacó las contribuciones de la señal del número de copias, la atención y la selección de genes

Para cuantificar la contribución de los componentes individuales de DeepMalignant, realizamos un análisis de ablación en el que se eliminaron o modificaron los elementos clave del marco de trabajo uno a la vez, incluidos 1) reemplazar el peso de borde como un número constante para todos los bordes y, por lo tanto, eliminar la ponderación basada en el número de copias; 2) utilizar un autoencoder de solo expresión entrenado en el mismo conjunto de características de ARN y, por lo tanto, eliminar la agregación de vecinos basada en gráficos y la ponderación de CNA; 3) eliminar las características de genes más informativas (Métodos: Selección de genes altamente correlacionados). La comparación del modelo completo y cada uno de estos tres ajustes se muestra en la Tabla 1.

El modelo completo logró de manera consistente el mejor rendimiento en PDACA y PDACB, con puntajes F1 de 0,945 en ambos conjuntos de datos. El recall alcanzó los 0,934 y 0,912, mientras que la precisión alcanzó los 0,956 y 0,980 para PDACA y PDACB, respectivamente.

La eliminación de la ponderación del gráfico basada en el número de copias resultó en una reducción sustancial del rendimiento, con puntajes F1 que disminuyeron en un 14% y un 17% en PDACA y PDACB, respectivamente. Tanto la precisión como el recall disminuyeron, lo que indica que la información del número de copias contribuye ampliamente a la discriminación entre células malignas y no malignas.

La mayor degradación del rendimiento se observó cuando se eliminó el mecanismo de atención. En este entorno, el puntaje F1 disminuyó en un 78% y un 65% en relación con el modelo completo en PDACA y PDACB, respectivamente. En ambas muestras, esta degradación se acompañó de una marcada pérdida de precisión, lo que indica una sobreestimación sustancial de las células malignas cuando se eliminó la agregación de vecinos basada en gráficos. Estos resultados sugieren que, en el conjunto de datos de cáncer de páncreas de Moncada, las características de ARN por sí solas no fueron suficientes para separar de manera robusta las células malignas de las no malignas, mientras que el marco de atención del gráfico proporcionó información contextual esencial que mejoró la separación de clases en el espacio latente. Este patrón fue consistente con la menor precisión observada en los enfoques de solo ARN, como scMalignantFinder, PreCanCell y Cancer-Finder en ambas muestras. En términos más generales, estos resultados indicaron que, en los conjuntos de datos con un ruido biológico y técnico sustancial, la integración adaptativa de la información derivada de los vecinos fue fundamental para lograr predicciones estables y precisas.

Finalmente, la exclusión de las características de genes más informativas redujo el puntaje F1 en un 36% en PDACA y un 16% en PDACB, lo que demuestra que estos genes proporcionaron señales importantes para identificar las células malignas. Este resultado también proporcionó un apoyo funcional para el análisis de atribución, lo que indica que los genes identificados a través del análisis de correlación de genes y la incrustación no solo estaban asociados con la representación aprendida, sino que también hicieron una contribución importante a su utilidad predictiva.

En conjunto, estos resultados de ablación demostraron que múltiples componentes contribuyeron al fuerte rendimiento de DeepMalignant. La ponderación de los bordes informada por el número de copias mejoró la calidad de la representación del gráfico subyacente, la agregación basada en la atención mejoró el aprendizaje de la representación y la inclusión de características de genes altamente informativas fortaleció las señales discriminatorias en el espacio latente. La pronunciada degradación del rendimiento observada al eliminar el mecanismo de atención indicó aún más que la agregación consciente del gráfico fue particularmente importante en conjuntos de datos desafiantes como Moncada et al., donde la señal biológica era más débil y los datos eran más ruidosos.

El análisis de atribución identificó los conjuntos de genes más relevantes desde el punto de vista biológico para las muestras de cáncer de mama

SPANISH TRANSLATION:

En cada muestra de Gao et al., seleccionamos además los genes principales que estaban altamente correlacionados con las incrustaciones GAT (Métodos: Selección de genes altamente correlacionados) e identificamos los genes que aparecían en las listas principales de al menos cinco dimensiones de incrustación, formando un subconjunto de genes recurrentemente importantes. Luego, realizamos una anotación funcional y un análisis de enriquecimiento de vías utilizando la Base de datos para la anotación, visualización y descubrimiento integrados (DAVID) [[28]] (Conjunto de datos S2) para investigar más a fondo si estos genes eran indicativos del tipo de cáncer representado por cada muestra. Los resultados respaldaron la relevancia biológica de los genes recurrentemente importantes para el cáncer de mama, y las firmas más distintas se observaron en DCIS1. La anotación funcional de los genes seleccionados de DCIS1 reveló dos programas estrechamente acoplados. El primero fue un programa transcripcional sensible a las hormonas, evidenciado por el enriquecimiento de la vía de señalización de estrógenos (HSP90AA1, TFF1, FKBP4, ESR1), respuesta a estrógenos (HSP90AA1, CCND1, ESR1), unión del receptor de estrógenos nuclear (XBP1, ESR1) y resistencia endocrina (CCND1, CDK4, ESR1). El segundo fue un programa de ciclo celular proliferativo, evidenciado por el enriquecimiento de la vía del ciclo celular (CCND1, CDK4, RAD21, YWHAZ, MAD2L1), división celular (CCND1, CDK4, RAD21, BIRC5, MAD2L1), transición G1/S del ciclo celular mitótico (CCND1, CDK4) y el punto de control del ensamblaje del huso (BIRC5, MAD2L1). Ambos programas convergieron en el cáncer de mama y en las vías relacionadas con el cáncer (CCND1, CDK4, ESR1, HSP90AA1, BIRC5), lo que confirmó que los genes seleccionados de DCIS1 capturan un programa canónico del cáncer de mama impulsado por hormonas que conecta la señalización endocrina con la aceleración de la entrada al ciclo celular. TNBC1 estuvo dominado por genes relacionados con la respuesta al estrés y las chaperonas, como HSP90AB1, HSPA1A/HSPA1B y FKBP4. TNBC2 incluyó genes como CDKN2A, LGALS1, HDAC2 y CTSD, lo que es consistente con procesos oncogénicos y regulatorios más amplios. TNBC3 mostró un enriquecimiento de los programas del ciclo celular y el estrés oxidativo, con genes representativos que incluyen CDKN2A, MYBL2, NQO1, HMGA1 y YWHAZ. En general, estos resultados sugirieron que los genes altamente correlacionados con la incrustación capturan vías biológicamente significativas relevantes para el cáncer de mama, y el enriquecimiento más claro específico del cáncer de mama se observó en DCIS1 y programas malignos más amplios representados en las muestras de TNBC. El análisis de perturbación reveló la contribución de las CNA y el programa transcripcional a la separación tumoral-normal en múltiples tipos de cáncer.

Para cuantificar las contribuciones relativas de las CNA y los programas transcripcionales a la separación tumoral-normal final en múltiples tipos de cáncer, realizamos un análisis de atribución basado en la perturbación. En este análisis, tratamos la asignación tumoral-normal final obtenida del modelo completo como el resultado de referencia y, luego, perturbamos un componente a la vez, manteniendo todos los demás ajustes del modelo sin cambios.

Específicamente, mantuvimos todo en nuestro modelo igual, excepto que eliminamos alternativamente los siguientes componentes: 1) CNA, genes relacionados con 2) el ciclo celular, 3) el daño al ADN, 4) la reparación del ADN, 5) la invasión, 6) la evasión de los supresores del crecimiento, 7) la habilitación de la inmortalidad replicativa, 8) la inestabilidad del genoma y la mutación, 9) la resistencia a la muerte celular y 10) el enriquecimiento normal (Métodos: análisis de contribución basado en la perturbación). A cada componente se le asignó una puntuación S, que cuantificó la contribución de este componente. Un valor más grande de S indicó una mayor contribución del componente. La Figura 6A-D mostró las puntuaciones de perturbación en cuatro conjuntos de datos que abarcan el cáncer de mama, ovario y colon.

Entre los cuatro conjuntos de datos, el conjunto de datos de cáncer de mama de Qian et al. tuvo las puntuaciones de perturbación más contrastantes entre los diez componentes. En más detalle, la CNA, el enriquecimiento normal y el ciclo celular tuvieron una puntuación de perturbación mucho mayor que el resto de los componentes. Esto era de esperar y reflejó la composición del conjunto de datos, dado que el conjunto de datos de Qian et al. fue un atlas del microambiente tumoral (MET) pancanceroso centrado en la heterogeneidad de las células estromales. Específicamente, la CNA distinguió las raras células epiteliales malignas de las poblaciones estromales dominantes. Las firmas de enriquecimiento normal capturaron la similitud transcripcional de la mayoría estromal con el tejido normal. Los genes del ciclo celular representaron la característica transcripcional más discriminativa de la minoría epitelial maligna.

Luego, realizamos el análisis del modelo nulo para cuatro muestras de cáncer seleccionadas, las muestras de cáncer de páncreas de Moncada et al., PDACA y PDACB, la muestra de cáncer de mama de Gao et al., DCIS1, y la muestra de cáncer de colon de Lee et al., SMC01 (Figura 6E-H, Métodos: análisis de contribución basado en la perturbación). PDACA mostró una puntuación de perturbación significativamente mayor para la evasión de los supresores del crecimiento, mientras que DCIS1 mostró una puntuación de perturbación significativamente mayor para la invasión. La puntuación de perturbación elevada para la evasión de los supresores del crecimiento en PDACA fue consistente con la co-inactivación casi universal de CDKN2A/p16, TP53 y SMAD4 en el cáncer de páncreas [[29][31]], lo que convierte a esta característica en uno de los discriminadores transcripcionales más fuertes entre las células tumorales y normales del páncreas. Por el contrario, la puntuación de invasión elevada en DCIS1 reflejó la transcripción activa de los programas de remodelación de la MEC y relacionados con la invasión en las células epiteliales de DCIS a medida que se preparan para la ruptura del estroma [[32], [33]], lo que hace que la invasión sea altamente específica de la población maligna, a pesar de que DCIS es una lesión preinvasiva.

Descripción general del método

La Figura 1 proporciona una descripción general del flujo de trabajo de DeepMalignant y los análisis posteriores. DeepMalignant toma datos de secuenciación de ARN de una sola célula como entrada, incluido un matriz de expresión génica y una matriz de alteraciones del número de copias (CNA) inferida (Figura 1A). La matriz de expresión génica se utiliza para definir las características de los nodos derivados del ARN en función de los genes de firma asociados con el cáncer seleccionados, mientras que la matriz de CNA se utiliza para construir relaciones célula-célula informadas por CNA. Específicamente, la similitud de CNA por pares se utiliza para definir los bordes ponderados entre las células, lo que produce un gráfico en el que cada nodo representa una célula y cada borde refleja la similitud genómica entre las células (Figura 1B). Este gráfico multimodal se pasa luego a un autoencoder de atención de gráficos, donde el codificador aprende incrustaciones celulares de baja dimensión a través del paso de mensajes ponderado por CNA y el decodificador reconstruye las características de entrada para estabilizar el aprendizaje de la representación (Figura 1C). Las incrustaciones aprendidas se agrupan posteriormente en el espacio latente de baja dimensión utilizando el algoritmo de detección de comunidades Leiden [[15]] (Figura 1D). Para asignar etiquetas biológicas a estos grupos, DeepMalignant calcula las puntuaciones de carga de CNA a nivel de grupo y ajusta un modelo de mezcla gaussiana de dos componentes, donde los grupos con una carga de CNA más alta se clasifican como malignos y los grupos restantes se clasifican como normales (Figura 1E-F). Además de la identificación de células malignas, el modelo aprendido también admite la interpretación y las aplicaciones posteriores. Cuantificamos la contribución relativa de las CNA y las vías transcripcionales relacionadas con el cáncer utilizando puntuaciones de importancia basadas en la perturbación y aplicamos además DeepMalignant a los datos de transcriptómica espacial para identificar las regiones enriquecidas con tumores y las composiciones de tipos de células de puntos normales, y caracterizar las comunicaciones célula-célula (Figura 1G-I).

Descripción general de la evaluación comparativa

Evaluamos a fondo la precisión, la exhaustividad y la exactitud (puntuación F1) de DeepMalignant aplicándolo a múltiples datos de scRNA-seq, que abarcan cuatro tipos de cáncer (mama, ovario, colon y páncreas), tres tecnologías de secuenciación (10x Genomics, Drop-seq e inDrop) y un total de 26 muestras (detalles de los conjuntos de datos que se ven en Apéndice complementario Tabla 1). Estos conjuntos de datos se obtuvieron del Catálogo de células cancerosas seleccionadas, que proporcionó el etiquetado de verdad fundamental de las células malignas. Comparamos DeepMalignant con cinco métodos de última generación, que incluyen scMalignantFinder, PreCanCell, ikarus, Cancer-Finder y CopyKAT. Los resultados detallados de cada muestra y cada método se informan en el Conjunto de datos S1.

La Figura 2A presenta las puntuaciones de exhaustividad, precisión y F1 en los cinco conjuntos de datos de referencia, lo que proporciona una descripción general del rendimiento de los seis métodos, incluido DeepMalignant. Entre los seis métodos, ikarus tiene el peor rendimiento, con puntuaciones de exhaustividad y F1 medianas de 0. scMalignantFinder exhibe la precisión más baja en general; su patrón característico de alta exhaustividad junto con baja precisión se ha informado previamente [[4]]. PreCanCell muestra un perfil de rendimiento similar a scMalignantFinder, aunque con una precisión ligeramente mayor. CopyKAT, CancerFinder y DeepMalignant son sustancialmente más competitivos que ikarus, scMalignantFinder y PreCanCell. Aunque CopyKAT logra puntuaciones de precisión (0,9651) y F1 (0,9528) medianas ligeramente más altas que las de DeepMalignant (0,9519, 0,9459), su puntuación de exhaustividad mediana (0,9819) es más baja (0,9909) y produce puntuaciones F1 cero para varias muestras, probablemente debido a una selección incorrecta de la línea de base diploide por parte de CopyKAT. CancerFinder logra la exhaustividad más alta de todos los métodos; sin embargo, su precisión mediana (0,8956) es inferior a la de DeepMalignant (0,9519) y su puntuación F1 mediana (0,9437), aunque cercana, sigue siendo inferior a la de DeepMalignant (0,9459). En general, DeepMalignant logró las segundas puntuaciones F1 medianas más altas al tiempo que mantuvo el mejor equilibrio entre la exhaustividad y la precisión y la solidez. Las siguientes secciones examinan el rendimiento de cada método en conjuntos de datos individuales, organizados por tipo de cáncer y plataforma de secuenciación, para proporcionar una comprensión más detallada de las fortalezas y limitaciones de cada método. Apéndice complementario: detalles de la ejecución de los métodos existentes enumera los detalles de la implementación de la evaluación comparativa para cada método.

DeepMalignant logró una identificación de células malignas precisa y sólida en los conjuntos de datos de cáncer de mama y colon secuenciados por 10x Genomics

Primero, aplicamos DeepMalignant a dos conjuntos de datos de scRNA-seq de cáncer de mama generados por 10x Genomics: Gao et al. [[1]] y Qian et al. [[16]], que comprenden un total de 11 muestras de cáncer de mama y 20 673 células. El conjunto de datos de Gao et al. incluye una muestra de carcinoma ductal in situ (DCIS1) y tres muestras de cáncer de mama triple negativo (TNBC1-TNBC3), mientras que el conjunto de datos de Qian et al. incluye siete muestras adicionales de cáncer de mama. Para ambos conjuntos de datos, las etiquetas de células malignas y normales de verdad fundamental se obtuvieron de las anotaciones de referencia y las matrices de expresión génica se preprocesaron utilizando procedimientos estándar de filtrado y normalización antes de la construcción del gráfico.

Para estos dos conjuntos de datos de cáncer de mama, evaluamos DeepMalignant y los cinco métodos de última generación utilizando la precisión, la exhaustividad y la puntuación F1 por muestra para las células malignas, como se muestra en la Figura 2B. DeepMalignant logró constantemente la puntuación F1 más alta (puntuación F1 mediana: 0,9713). CopyKAT y CancerFinder ocuparon el segundo y tercer lugar (puntuación F1 mediana: 0,9600 y 0,9480, respectivamente), mientras que PreCanCell, scMalignantFinder e Ikarus tuvieron un rendimiento sustancialmente peor (puntuación F1 mediana < 0,7 para los tres). En este conjunto de datos, la puntuación F1 de CopyKAT exhibió una varianza considerablemente mayor (0,1097) que la de DeepMalignant (0,0022), y una muestra (Qian et al., muestra 42) produjo una puntuación F1 cero, lo que indica una selección incorrecta de la línea de base diploide por parte de CopyKAT. CancerFinder logró la exhaustividad más alta de todos los métodos (mediana: 0,9997), superando ligeramente a DeepMalignant (mediana: 0,9923); por el contrario, la precisión de DeepMalignant (mediana: 0,9575) fue sustancialmente mayor que la de CancerFinder (mediana: 0,9011). Aunque CopyKAT logró la precisión mediana más alta en general, produjo una puntuación de precisión cero para la muestra 42 en Qian et al., lo que socava su solidez. En general, en los conjuntos de datos de cáncer de mama de Gao et al. y Qian et al. secuenciados con 10x, DeepMalignant logró la puntuación F1 más alta y el mejor equilibrio entre la exhaustividad y la precisión.

A continuación, evaluamos DeepMalignant en el conjunto de datos de secuenciación de ARN de células individuales (scRNA-seq) de cáncer colorrectal de Lee et al. [[17]], generado con la tecnología 10x Genomics. Este conjunto de datos comprende 14 muestras de cáncer colorrectal y 20.977 células. DeepMalignant mostró un rendimiento favorable en comparación con la mayoría de los métodos de vanguardia para este conjunto de datos (Figuras 2C). En particular, DeepMalignant obtuvo la segunda puntuación mediana F1 más alta (0,973) entre los seis métodos, solo superado por CopyKAT (0,9818). Aunque DeepMalignant tuvo una baja precisión para una muestra de cáncer colorrectal (precisión = 0,2268, puntuación F1 = 0,3697) en este conjunto de datos, la precisión y la puntuación F1 de todas las demás muestras se mantuvieron altas (precisión ≥ 0,7394, F1 ≥ 0,8502). CopyKAT tuvo una baja puntuación F1 para dos muestras (0 y 0,3553), lo que demuestra que no es tan robusto como DeepMalignant en este conjunto de datos de cáncer colorrectal. Investigamos más a fondo la muestra para la que CopyKAT obtuvo una puntuación F1 de cero (muestra SMC18) y descubrimos que CopyKAT informó que encontró "baja confianza en la clasificación", lo que indica que no pudo establecer de manera confiable una línea de base diploide. Cuando CopyKAT seleccionó el clúster de línea de base incorrecto, sus etiquetas aneuploides y diploides se invirtieron, lo que resultó en una puntuación F1 cercana a cero para la muestra. Esto demostró que CopyKAT estaba muy restringido por su selección de la línea de base normal, lo que dependía del número de células normales en la muestra y de los perfiles de CNA de las células normales.

En general, DeepMalignant obtuvo la mayor precisión y consistencia en los conjuntos de datos de cáncer de mama y cáncer colorrectal de 10x Genomics. Cancer-Finder y CopyKAT fueron los siguientes métodos más competitivos. Sin embargo, CopyKAT sufrió una mala sensibilidad, precisión y puntuación F1 para algunas muestras atípicas en los conjuntos de datos de Qian y Lee. También dependía en gran medida de la selección correcta de la línea de base normal. Cancer-Finder, por otro lado, tuvo una menor precisión y puntuación F1 que DeepMalignant en los tres conjuntos de datos.

DeepMalignant fue robusto frente a las muestras de cáncer de ovario secuenciadas por Drop-seq

Evaluamos más a fondo DeepMalignant en un conjunto de datos de cáncer de ovario metastásico secuenciado por Drop-seq de Olalekan et al. [[18]]. Este conjunto de datos contiene seis muestras que comprenden un total de 6.018 células. Aplicamos los seis métodos (DeepMalignant, ikarus, scMalignantFinder, PreCanCell, CopyKAT y Cancer-Finder), de los cuales ikarus no se pudo ejecutar correctamente en este conjunto de datos utilizando el flujo de trabajo predeterminado recomendado por los autores y, por lo tanto, se excluyó de la comparación cuantitativa.

De todos los cinco métodos, DeepMalignant demostró un rendimiento robusto, sólido y equilibrado entre la sensibilidad y la precisión en este conjunto de datos de cáncer de ovario (Figuras 2D). Su puntuación F1 mediana (0,873) fue la segunda más alta después de CopyKAT (0,936). Sin embargo, CopyKAT sufrió una baja sensibilidad en las muestras atípicas, y su puntuación F1 más baja fue inferior a 0,5, posiblemente porque dependía únicamente de las señales de número de copias. En contraste, DeepMalignant demostró un buen equilibrio entre la sensibilidad y la precisión, gracias a que incorporó tanto la expresión génica como las señales de número de copias. Al igual que en los conjuntos de datos de 10x Genomics, scMalignantFinder y PreCanCell mostraron resultados menos favorables que DeepMalignant en la sensibilidad, la precisión y la puntuación F1 en este conjunto de datos. Cancer-Finder demostró una alta sensibilidad en general, pero su puntuación F1 mediana (0,836) es inferior a la de DeepMalignant (0,8731).

En general, DeepMalignant demostró su capacidad para aplicarse al conjunto de datos de Drop-seq en el conjunto de datos de cáncer de ovario metastásico, destacando su equilibrio entre la sensibilidad y la precisión, su robustez y su alta puntuación F1.

DeepMalignant mantuvo de manera única una identificación robusta de las células malignas en un conjunto de datos de cáncer de páncreas secuenciado por inDrop

Para evaluar más a fondo DeepMalignant en un tipo de tumor y una plataforma de secuenciación distintos, aplicamos DeepMalignant y otros cinco métodos de vanguardia a un conjunto de datos de células individuales de adenocarcinoma ductal pancreático (PDAC) generado utilizando la tecnología inDrop de Moncada et al. [[19]]. Este conjunto de datos contiene dos muestras de cáncer de páncreas, PDACA y PDACB, que comprenden 1.590 y 1.257 células, respectivamente.

Dado que solo había dos muestras, mostramos la sensibilidad y la precisión utilizando un gráfico de radar (Figura 3A). En este conjunto de datos, DeepMalignant demostró de manera única un rendimiento sólido y muy equilibrado para ambas muestras de PDAC, logrando puntuaciones F1 casi idénticas de 0,9449 en PDACA y 0,9448 en PDACB. En contraste, CopyKAT falló en PDACB tanto en la sensibilidad como en la precisión, y su puntuación F1 disminuyó a 0,0073. Otros métodos, como PreCanCell, Cancer-Finder y scMalignant, mostraron una alta sensibilidad para PDACA y PDAC_B, pero una baja precisión, lo que se muestra en el gráfico de radar como una forma más parecida a un diamante que a un cuadrado. En este conjunto de datos, ikarus no se pudo ejecutar correctamente utilizando el flujo de trabajo predeterminado recomendado por los autores y, por lo tanto, se excluyó de la evaluación comparativa.

Para dilucidar el fracaso de los métodos de vanguardia en las dos muestras de cáncer de páncreas, visualizamos las proyecciones UMAP del conjunto de genes de firma de entrada para PDACA (Figura 3B) y PDACB (Figura 3C). En ambos casos, los perfiles transcriptómicos de las células malignas se superpusieron sustancialmente con los de las células normales, lo que ilustra la dificultad inherente de depender únicamente de las características transcriptómicas para la identificación de células malignas en este conjunto de datos. En contraste, las muestras de cáncer de mama de Gao et al. (DCIS1, TNBC1–3) exhibieron una separación marcadamente más clara entre las células malignas y las normales, con límites de clúster bien definidos observados de manera consistente en las cuatro muestras (Apéndice complementario, Figura S1). En conjunto, estos resultados demostraron que las diferencias transcriptómicas entre las células malignas y las normales eran considerablemente más ambiguas en el conjunto de datos de Moncada de cáncer de páncreas que en la cohorte de cáncer de mama, lo que refuerza la necesidad de incorporar modalidades complementarias más allá de la expresión génica para una identificación robusta de las células malignas.

Para investigar el fracaso de CopyKAT en PDACB, examinamos los recuentos de expresión normalizados para ambas muestras (Figura 3D). El análisis de PDACB reveló una variación escasa del número de copias en todo el genoma, caracterizada por una única amplificación en el cromosoma 7 y deleciones aisladas en los cromosomas 5, 15, 16, 17 y 22. Atribuimos el mal rendimiento de los métodos existentes a la debilidad concomitante de las señales transcriptómicas y de variación del número de copias en esta muestra, que individualmente resultaron insuficientes para una identificación confiable de las células malignas. Estos hallazgos destacaron una ventaja clave de DeepMalignant: al aprovechar conjuntamente ambas modalidades, mantuvo una discriminación robusta entre las células malignas y las normales, incluso cuando una de las señales por sí sola era informativa.

DeepMalignant identificó correctamente las áreas malignas y normales en dos muestras de transcriptómica espacial de DCIS

Evaluamos más a fondo la capacidad de DeepMalignant para generalizarse más allá de scRNA-seq a los datos de transcriptómica espacial aplicándolo a dos muestras de carcinoma ductal in situ (DCIS), DCIS1 y DCIS2, del estudio de Wei et al. [[20]], que se analizaron utilizando la plataforma 10x Genomics Visium, que incluía las coordenadas espaciales para cada punto.

Presentamos las distribuciones espaciales de las predicciones malignas (naranja) y normales (azul) para la muestra DCIS2 en DeepMalignant (Figura 4A), DeepMalignant con pesos de borde constantes (Figura 4B) y cuatro métodos existentes (Figura 4C–F). Se incluyó la variante de peso de borde constante de DeepMalignant para examinar la contribución de los perfiles de número de copias al rendimiento general del modelo en DeepMalignant. Como referencia, se muestra la imagen de histopatología correspondiente con las regiones tumorales anotadas por expertos, adaptada de [[20]], en la Figura 4H, que corresponde a la subregión delimitada por el cuadro rojo en la Figura 4A. Como se describe en [[20]], esta subregión abarca once regiones tumorales anotadas (T1–T11). Luego, se amplió la región enmarcada de la Figura 4A para que coincida con el tamaño de la imagen de histopatología en la Figura 4H, lo que resultó en la Figura 4G. En la misma figura, también agrupamos manualmente los puntos malignos según sus posiciones mientras los comparamos con la anotación de expertos de la imagen de histopatología en la Figura 4H, lo que mostró que las predicciones de DeepMalignant de los puntos malignos para DCIS2 tenían una concordancia casi perfecta con las anotaciones derivadas de la histopatología. El examen de las Figuras 4B–F reveló que los métodos de la competencia tuvieron un rendimiento sustancialmente peor. La eliminación de los perfiles de número de copias de los pesos de borde en la variante de peso de borde constante interrumpió la coherencia espacial entre los puntos malignos, lo que resultó en regiones de predicción fragmentadas. CopyKAT (Figura 4C) y Cancer-Finder (Figura 4E) exhibieron una tendencia sistemática a sobreestimar los puntos malignos, fusionando erróneamente T5 con T6 y T7 a través de T9 en regiones contiguas. Esta sobreestimación de los puntos malignos se exacerbó aún más en scMalignantFinder y PreCanCell, con scMalignantFinder clasificando casi todos los puntos como malignos. En conjunto, DeepMalignant logró la mayor precisión espacial en la identificación de puntos malignos en el conjunto de datos de DCIS2 10x Visium.

Luego, aplicamos DeepMalignant a DCIS1 y encontramos un patrón similar al de DCIS2 (Apéndice complementario, Figura S4). Como en DCIS2, DeepMalignant produjo regiones tumorales espacialmente coherentes, mientras que la variante de DeepMalignant con peso de borde constante y los cuatro métodos de la competencia mostraron regiones de puntos malignos fragmentadas o sobreestimaron los puntos malignos.

En conjunto, estos resultados demostraron que DeepMalignant distinguió con precisión las áreas malignas de las normales en los datos de transcriptómica espacial basados en Visium, debido a su integración conjunta de los perfiles transcriptómicos y de número de copias. Las predicciones espacialmente fragmentadas observadas en la variante de peso de borde constante, que carecía de la entrada del perfil de número de copias, destacaron el papel complementario indispensable de las señales de variación del número de copias junto con la expresión génica para lograr una identificación coherente y precisa de los puntos malignos.

Las identidades de tipo celular espacial y las comunicaciones célula-célula en DCIS2 revelan señales contrastantes de fibroblastos a epitelio entre las células epiteliales normales y malignas

Dado que DeepMalignant nos proporcionó la capacidad de identificar los puntos normales en los datos de 10x Visium, integramos más a fondo la predicción de puntos normales en DCIS2 con una referencia de scRNA-seq coincidente (Métodos: Anotación de tipo celular y análisis de comunicación espacial en DCIS2) para anotar las composiciones de tipo celular de cada punto normal utilizando RCTD [[21]]. La Figura 5A muestra el gráfico circular resultante para cada punto, mientras que el tamaño de cada gráfico proviene de los pesos inferidos por RCTD para el tipo celular correspondiente. El compartimento normal estaba dominado por las contribuciones epiteliales en gran parte del tejido, mientras que las mezclas enriquecidas con fibroblastos y mieloides eran más prominentes en regiones localizadas, particularmente en las porciones central e inferior central de la sección. Las contribuciones de las células endoteliales, de células B, de células T y de células NK fueron comparativamente escasas y espacialmente dispersas. Las regiones tumorales ocuparon áreas espacialmente distintas de la sección y estuvieron en gran medida separadas de estas mezclas normales heterogéneas.

A continuación, investigamos más a fondo la comunicación entre células en DCIS2 mediante la ejecución de COMMOT [[22]], dado que se han anotado los focos malignos y normales a partir de DeepMalignant, lo que nos permitió analizar los pares ligando-receptor entre los diferentes tipos de células (Métodos: Anotación de tipos celulares y análisis de comunicación espacial en DCIS2). Descubrimos que el C3 y el MIF, derivados de los fibroblastos, dirigían preferentemente la señalización hacia las células epiteliales normales en lugar de las células epiteliales tumorales en el microambiente de DCIS, a través de los ejes C3–C3AR1 y MIF–CD74/CD44, respectivamente (Figura 5B-C), lo que refleja un patrón más amplio en el que las células epiteliales tumorales de DCIS parecen desconectarse de los circuitos parcrinos homeostáticos de los fibroblastos. Para el eje C3–C3AR1, proponemos que la señalización preferencial hacia las células epiteliales normales está impulsada por la pérdida de la expresión de C3AR1 en las células epiteliales tumorales, un fenómeno que se ha atribuido previamente al silenciamiento epigenético a través de la metilación del promotor en múltiples tipos de cáncer, mientras que las células epiteliales normales conservan una expresión intacta de C3AR1 y siguen siendo los principales receptores de la señal [[23]].

Para el eje MIF–CD74/CD44, la transducción de señal eficaz requiere la formación de un complejo cis entre CD74 y CD44 como un requisito absoluto para la activación posterior de ERK1/2 [[24], [25]]; especulamos que en DCIS2 ER-positivo/PR-negativo, CD74 se redujo en el compartimento de células epiteliales tumorales, lo que hizo que el complejo receptor fuera no funcional y redirigió el MIF de los fibroblastos hacia el epitelio normal adyacente, donde se mantuvo la expresión de CD74 [[26], [27]].

En conjunto, estos hallazgos sugieren que las células epiteliales tumorales de DCIS podrían retirarse de la señalización homeostática derivada de los fibroblastos a través de la pérdida convergente de receptores, lo que apunta a la desconexión del estroma como una característica potencialmente temprana y coordinada de la evasión inmune en el cáncer de mama preinvasivo.

El análisis de ablación destacó las contribuciones de la señal de número de copias, la atención y la selección de genes

Para cuantificar la contribución de los componentes individuales de DeepMalignant, realizamos un análisis de ablación en el que se eliminaron o modificaron los elementos clave del marco de trabajo uno a la vez, incluyendo 1) reemplazar el peso del borde como un número constante para todos los bordes y, por lo tanto, eliminar la ponderación basada en el número de copias; 2) utilizar un autoencoder solo de expresión entrenado con el mismo conjunto de características de ARN y, por lo tanto, eliminar la agregación de vecinos basada en gráficos y la ponderación de CNA; 3) eliminar las características de genes más informativas (Métodos: Selección de genes altamente correlacionados). La comparación del modelo completo y cada uno de estos tres ajustes se muestra en la Tabla 1.

El modelo completo logró de manera consistente el mejor rendimiento tanto en PDACA como en PDACB, con puntuaciones F1 de 0,945 en ambos conjuntos de datos. El recall alcanzó los 0,934 y 0,912, mientras que la precisión alcanzó los 0,956 y 0,980 para PDACA y PDACB, respectivamente.

La eliminación de la ponderación del gráfico basada en el número de copias resultó en una reducción sustancial del rendimiento, con puntuaciones F1 que disminuyeron en un 14% y un 17% en PDACA y PDACB, respectivamente. Tanto la precisión como el recall disminuyeron, lo que indica que la información del número de copias contribuye ampliamente a la discriminación entre células malignas y no malignas.

La mayor degradación del rendimiento se observó cuando se eliminó el mecanismo de atención. En este entorno, la puntuación F1 disminuyó en un 78% y un 65% en relación con el modelo completo en PDACA y PDACB, respectivamente. En ambas muestras, esta degradación se acompañó de una marcada pérdida de precisión, lo que indica una sobreestimación sustancial de las células malignas cuando se eliminó la agregación de vecinos basada en gráficos. Estos resultados sugieren que, en el conjunto de datos de cáncer de páncreas de Moncada, las características de ARN por sí solas fueron insuficientes para separar de manera robusta las células malignas de las no malignas, mientras que el marco de atención del gráfico proporcionó información contextual esencial que mejoró la separación de clases en el espacio latente. Este patrón fue consistente con la menor precisión observada en los enfoques solo de ARN, como scMalignantFinder, PreCanCell y Cancer-Finder en ambas muestras. En términos más generales, estos resultados indicaron que, en los conjuntos de datos con un ruido biológico y técnico sustancial, la integración adaptativa de la información derivada de los vecinos fue fundamental para lograr predicciones estables y precisas.

Finalmente, la exclusión de las características de genes más informativas redujo la puntuación F1 en un 36% en PDACA y un 16% en PDACB, lo que demuestra que estos genes proporcionaron señales importantes para identificar las células malignas. Este resultado también proporcionó un apoyo funcional para el análisis de atribución, lo que indica que los genes identificados a través del análisis de correlación gen-incrustación no solo estaban asociados con la representación aprendida, sino que también hicieron una contribución importante a su utilidad predictiva.

En conjunto, estos resultados de ablación demostraron que múltiples componentes contribuyeron al fuerte rendimiento de DeepMalignant. La ponderación de los bordes informada por el número de copias mejoró la calidad de la representación del gráfico subyacente, la agregación basada en la atención mejoró el aprendizaje de la representación y la inclusión de características de genes altamente informativas fortaleció las señales discriminatorias en el espacio latente. La pronunciada degradación del rendimiento observada al eliminar el mecanismo de atención indicó aún más que la agregación consciente del gráfico fue particularmente importante en conjuntos de datos desafiantes como el de Moncada et al., donde la señal biológica era más débil y los datos eran más ruidosos.

El análisis de atribución identificó los conjuntos de genes más relevantes desde el punto de vista biológico para las muestras de cáncer de mama

En cada muestra de Gao et al., seleccionamos además los genes principales que estaban altamente correlacionados con las incrustaciones GAT (Métodos: Selección de genes altamente correlacionados) e identificamos los genes que aparecieron en las listas principales de al menos cinco dimensiones de incrustación, formando un subconjunto de genes recurrentemente importantes. Luego, realizamos una anotación funcional y un análisis de enriquecimiento de vías utilizando la Base de datos para la anotación, visualización e integración de descubrimientos (DAVID) [[28]] (Conjunto de datos S2) para investigar más a fondo si estos genes eran indicativos del tipo de cáncer representado por cada muestra. Los resultados respaldaron la relevancia biológica de los genes recurrentemente importantes para el cáncer de mama, y las firmas más distintas se observaron en DCIS1. La anotación funcional de los genes seleccionados de DCIS1 reveló dos programas estrechamente acoplados. El primero fue un programa de transcripción sensible a las hormonas, evidenciado por el enriquecimiento de la vía de señalización de los estrógenos (HSP90AA1, TFF1, FKBP4, ESR1), la respuesta a los estrógenos (HSP90AA1, CCND1, ESR1), la unión del receptor de estrógeno nuclear (XBP1, ESR1) y la resistencia endocrina (CCND1, CDK4, ESR1). El segundo fue un programa de ciclo celular proliferativo, evidenciado por el enriquecimiento de la vía del ciclo celular (CCND1, CDK4, RAD21, YWHAZ, MAD2L1), la división celular (CCND1, CDK4, RAD21, BIRC5, MAD2L1), la transición G1/S del ciclo celular mitótico (CCND1, CDK4) y el punto de control del ensamblaje del huso (BIRC5, MAD2L1). Ambos programas convergieron en los términos de cáncer de mama y vías en cáncer (CCND1, CDK4, ESR1, HSP90AA1, BIRC5), lo que confirmó que los genes seleccionados de DCIS1 capturan un programa canónico de cáncer de mama impulsado por hormonas que une la señalización endocrina con la entrada acelerada en el ciclo celular. TNBC1 estuvo dominado por genes relacionados con la respuesta al estrés y las chaperonas, como HSP90AB1, HSPA1A/HSPA1B y FKBP4. TNBC2 incluyó genes como CDKN2A, LGALS1, HDAC2 y CTSD, lo que es consistente con procesos oncogénicos y reguladores más amplios. TNBC3 mostró un enriquecimiento de los programas de ciclo celular y estrés oxidativo, con genes representativos que incluyen CDKN2A, MYBL2, NQO1, HMGA1 y YWHAZ. En general, estos resultados sugirieron que los genes altamente correlacionados con la incrustación capturan vías biológicamente significativas relevantes para el cáncer de mama, y el enriquecimiento más claro específico del cáncer de mama se observó en DCIS1 y los programas malignos más amplios se representaron en las muestras de TNBC.

El análisis de perturbación reveló la contribución de la CNA y el programa de transcripción a la separación tumoral-normal en múltiples tipos de cáncer

Para cuantificar las contribuciones relativas de las CNA y los programas de transcripción a la separación tumoral-normal final en múltiples tipos de cáncer, realizamos un análisis de atribución basado en la perturbación. En este análisis, tratamos la asignación tumoral-normal final obtenida del modelo completo como el resultado de referencia y, luego, perturbamos un componente a la vez mientras manteníamos todos los demás ajustes del modelo sin cambios.

Específicamente, mantuvimos todo en nuestro modelo igual, excepto que eliminamos alternativamente los siguientes componentes: 1) CNA, genes relacionados con 2) el ciclo celular, 3) el daño al ADN, 4) la reparación del ADN, 5) la invasión, 6) la evasión de los supresores del crecimiento, 7) la habilitación de la inmortalidad replicativa, 8) la inestabilidad del genoma y la mutación, 9) la resistencia a la muerte celular y 10) el enriquecimiento normal (Métodos: Análisis de contribución basado en la perturbación). A cada componente se le asignó una puntuación S que cuantificó la contribución de este componente. Un valor más grande de S indicó una mayor contribución del componente. La Figura 6A-D mostró las puntuaciones de perturbación en cuatro conjuntos de datos que abarcan el cáncer de mama, ovario y colon.

Entre los cuatro conjuntos de datos, el conjunto de datos de cáncer de mama de Qian et al. tuvo las puntuaciones de perturbación más contrastantes entre los diez componentes. En más detalle, la CNA, el enriquecimiento normal y el ciclo celular tuvieron una puntuación de perturbación mucho mayor que el resto de los componentes. Esto era de esperar y reflejaba la composición del conjunto de datos, considerando que el conjunto de datos de Qian et al. era un atlas pan-cáncer del microambiente tumoral (TME) centrado en la heterogeneidad de las células del estroma. Específicamente, la CNA distinguió las raras células epiteliales malignas de las poblaciones del estroma dominantes. Las firmas de enriquecimiento normal capturaron la similitud de transcripción de la mayoría del estroma con el tejido normal. Los genes del ciclo celular representaron la característica de transcripción más discriminatoria de la minoría de células epiteliales malignas.

Luego, realizamos el análisis del modelo nulo para cuatro muestras de cáncer seleccionadas, las muestras de cáncer de páncreas de Moncada et al., PDACA y PDACB, la muestra de cáncer de mama de Gao et al., DCIS1, y la muestra de cáncer de colon de Lee et al., SMC01 (Figura 6E-H, Métodos: Análisis de contribución basado en la perturbación). PDACA mostró una puntuación de perturbación significativamente mayor para la evasión de los supresores del crecimiento, mientras que DCIS1 mostró una puntuación de perturbación significativamente mayor para la invasión. La puntuación de perturbación elevada para la evasión de los supresores del crecimiento en PDACA fue consistente con la co-inactivación casi universal de CDKN2A/p16, TP53 y SMAD4 en el cáncer de páncreas [[29][31]], lo que convierte a este sello distintivo en uno de los discriminadores de transcripción más fuertes entre las células tumorales y normales del páncreas. Por el contrario, la puntuación de invasión elevada en DCIS1 reflejó la transcripción activa de los programas de remodelación de la MEC y relacionados con la invasión en las células epiteliales de DCIS a medida que se preparan para la ruptura del estroma [[32], [33]], lo que hace que la invasión sea altamente específica de la población maligna a pesar de que DCIS es una lesión preinvasiva.

Conclusión

La discriminación precisa de las células malignas y normales es un requisito previo para un análisis confiable de los transcriptomas de células cancerosas individuales, pero sigue siendo difícil en los diferentes tipos de tumores, plataformas experimentales y calidades de los datos. Aquí, presentamos DeepMalignant, un marco de aprendizaje de representación de gráficos multimodales no supervisado que integra las firmas de células malignas derivadas del ARN con las relaciones célula-célula informadas por la CNA para identificar las células malignas a partir de los datos de secuenciación de ARN de una sola célula. Al combinar las características de transcripción con la atención del gráfico guiada por la CNA, DeepMalignant captura tanto los estados dinámicos de las células malignas como la estructura genómica más estable que comparten las células tumorales.

En un total de 26 muestras que abarcan cáncer de mama, colorrectal, páncreas y ovario, generadas en las plataformas 10x Genomics, inDrop y Drop-seq, DeepMalignant logró de forma consistente un buen equilibrio entre precisión y exhaustividad, y demostró una mayor estabilidad entre las muestras en comparación con los métodos existentes basados en ARN y en alteraciones del número de copias (CNA). Su ventaja fue especialmente evidente en entornos desafiantes, incluido el cáncer de páncreas y los conjuntos de datos con cambios de plataforma, donde los métodos basados únicamente en la expresión tendían a sobreestimar la malignidad y los métodos basados únicamente en CNA mostraban una inestabilidad sustancial. Los análisis de ablación demostraron además que tanto la ponderación de los bordes derivada de CNA como la agregación de vecindad basada en gráficos son esenciales para el rendimiento, lo que respalda el principio de diseño central de la integración multimodal de gráficos.

La separación limitada entre las células tumorales y normales observada en el conjunto de datos de cáncer de páncreas inDrop probablemente se deba a una combinación de limitaciones técnicas específicas de la plataforma y las características biológicas intrínsecas de los tumores pancreáticos. En comparación con las plataformas de mayor sensibilidad, como 10x Chromium y Drop-seq, inDrop normalmente presenta una menor eficiencia de captura de transcritos, una menor detección de genes por célula y tasas de abandono más elevadas, lo que en conjunto disminuye la relación señal-ruido y dificulta las sutiles diferencias transcripcionales. Esta limitación es particularmente importante en el cáncer de páncreas, donde las células ductales malignas a menudo se parecen mucho a sus contrapartes normales a nivel de expresión génica, y donde el microambiente tumoral, que comprende abundantes células estromales e inmunitarias, puede diluir aún más las señales específicas del tumor. Además, la alta heterogeneidad de los tumores pancreáticos y la presencia de bajas fracciones de células malignas en algunas muestras exacerban el desafío de distinguir las células tumorales de las normales utilizando solo datos de expresión. No obstante, DeepMalignant distinguió de forma robusta y precisa las células malignas y no malignas tanto en PDACA como en PDACB, gracias a su diseño que integra tanto las firmas de células malignas derivadas del ARN como las relaciones célula-célula informadas por CNA.

Más allá de la precisión de la clasificación, DeepMalignant aprendió representaciones biológicamente significativas. Los análisis de atribución mostraron que el espacio latente se asoció con programas transcripcionales relacionados con el cáncer establecidos, mientras que la aplicación a datos de transcriptómica espacial coincidentes recuperó regiones tumorales espacialmente coherentes que se alinearon estrechamente con la anotación histopatológica. Además, la separación precisa de los puntos malignos y no malignos en los datos de transcriptómica espacial también permitió el análisis de la comunicación célula-célula, contrastando la señalización de fibroblastos a epitelio entre las células epiteliales normales y malignas en una muestra de CDIS.

En conjunto, estos resultados establecen a DeepMalignant como un marco robusto para la identificación de células malignas en diversos conjuntos de datos de transcriptómica unicelular y espacial. En un sentido más amplio, destacan el valor de combinar señales transcripcionales e inferidas genómicas dentro del aprendizaje de representación basado en gráficos para mejorar la anotación de tumores y respaldar estudios posteriores de la heterogeneidad tumoral, las comunicaciones célula-célula y la organización microambiental.

Métodos

Extracción de características

Dado un conjunto de datos de ARN de secuenciación de una sola célula que contiene células, genes y segmentos genómicos para la medición del número de copias, construimos un gráfico célula-célula que integra la información de expresión génica y la alteración del número de copias (CNA).

Características de los nodos de ARN

Sea denota la matriz de recuento de UMI en bruto. Realizamos la normalización del tamaño de la biblioteca seguida de la transformación logarítmica:

Luego, restringimos el espacio de características a un conjunto seleccionado de genes de firma de cáncer derivados del marco scMalignantFinder [[4]] (la lista de genes se encuentra en el Conjunto de datos S3). Estas firmas capturan los programas de expresión génica característicos de las células malignas y se han validado en múltiples conjuntos de datos de cáncer. La matriz de características de nodo resultante es

Cada característica génica se estandariza en todas las células utilizando la normalización de la puntuación z:

donde y denotan la media y la desviación estándar del gen en todas las células.

Construcción de bordes basada en CNA

Sea denota la matriz de CNA después de filtrar los segmentos genómicos con baja varianza:

en la que es una variable ajustable cuyo valor predeterminado es 0,02 para eliminar los segmentos genómicos cuyo número de copias no varía entre las células. Construimos un gráfico de vecinos más cercanos (kNN) en el espacio de CNA utilizando la similitud del coseno:

donde es un exponente de afilado. La matriz de adyacencia ponderada resultante se denota como .

Modelado matemático y red de atención de gráficos

El marco general se ilustra en la Figura 1. Las características derivadas del ARN definen los atributos de los nodos (Figura 1A), mientras que la similitud de CNA define los bordes ponderados (Figura 1B).

Codificador de atención de gráficos

Empleamos un codificador de atención de gráficos de dos capas (Figura 1C). La primera capa realiza el paso de mensajes basado en la atención:

donde las características de los nodos transformadas son

Para cada par de nodos conectados , se calculan las puntuaciones de atención como

El peso del borde derivado de CNA modula directamente la puntuación de atención:

La normalización softmax por filas produce coeficientes de atención:

Los nodos se actualizan mediante la agregación:

La segunda capa del codificador aplica una transformación lineal del gráfico sin atención adicional:

produciendo la incrustación latente .

Decodificador con atadura de pesos

El decodificador refleja la estructura del codificador:

donde los pesos del decodificador están atados a los pesos del codificador de modo que

El decodificador reutiliza la estructura de atención de la primera capa del codificador.

Función de pérdida

El modelo se entrena utilizando una pérdida de reconstrucción combinada con una pérdida contrastiva basada en gráficos:

La pérdida de reconstrucción se define como

Para evitar el colapso de la incrustación y hacer cumplir la coherencia entre las células vecinas de CNA, incorporamos una pérdida contrastiva InfoNCE:

donde denota un vecino positivo muestreado de los K vecinos más cercanos (KNN) determinados por la similitud del coseno de CNA celular, y denota un conjunto de células negativas muestreadas aleatoriamente. Aquí, es un parámetro de temperatura que controla el escalado de la similitud.

Selección del modelo

Durante el entrenamiento, las incrustaciones se agrupan periódicamente utilizando el algoritmo de Leiden (Figura 1D), y se selecciona el estado del modelo que produce la puntuación de silueta más alta para la clasificación maligna-normal posterior.

Llamada de clústeres malignos no supervisada utilizando la carga de CNA

Para determinar si cada clúster del algoritmo de Leiden pertenece al componente tumoral o normal, investigamos los perfiles de CNA de todas las células dentro de cada clúster. En más detalle, sea denota la matriz de CNA cuyo orden de células corresponde al orden de células agrupadas por el algoritmo de Leiden. Centramos los valores de CNA por segmento genómico restando la mediana del segmento en todas las células. Para cada célula , calculamos una puntuación de carga de CNA

Para estabilizar la distribución, aplicamos una transformación logarítmica:

Para cada clúster latente , calculamos una puntuación de carga a nivel de clúster

donde denota el conjunto de células en el clúster .

Modelamos la distribución de las puntuaciones a nivel de clúster utilizando una mezcla gaussiana de dos componentes:

donde son los pesos de la mezcla y denota la densidad gaussiana. Los parámetros se estiman mediante la implementación GaussianMixture en scikit-learn.

El componente con la media más grande se designa como el componente tumoral. En otras palabras, supongamos que , entonces , y , en el que y representan la media, la desviación estándar y el peso de la mezcla para el componente tumoral, y y representan la media, la desviación estándar y el peso de la mezcla para el componente normal. Para cada clúster , la probabilidad posterior de que sus células pertenezcan al componente tumoral es

El clúster se clasifica como tumoral si

Métricas de referencia

Evaluamos el rendimiento de la identificación de células tumorales utilizando precisión, exhaustividad y puntuación F1, con las etiquetas tumor-normal de referencia tratadas como la verdad fundamental. Para cada muestra, las células predichas como malignas se consideraron predicciones positivas. Los verdaderos positivos (VP) denotan las células malignas predichas correctamente como malignas, los falsos positivos (FP) denotan las células normales predichas incorrectamente como malignas, los falsos negativos (FN) denotan las células malignas predichas incorrectamente como normales y los verdaderos negativos (VN) denotan las células normales predichas correctamente como normales.

La exhaustividad mide la fracción de células malignas verdaderas recuperadas por un método y se definió como

La precisión mide la fracción de células malignas predichas que eran verdaderamente malignas y se definió como

La puntuación F1 resume el equilibrio entre la precisión y la exhaustividad y se calculó como

Las métricas se calcularon por separado para cada muestra.

Selección de parámetros del modelo

Consulte el Apéndice SI, Diseño de la investigación y opciones de hiperparámetros.

Selección de genes altamente correlacionados

Para examinar si las células malignas y no malignas podrían separarse utilizando solo las características transcriptómicas más informativas, seleccionamos los genes que estaban fuertemente asociados con la incrustación latente de DeepMalignant. Para cada muestra, utilizamos la matriz de características de ARN del DeepMalignant entrenado y la matriz de incrustación latente correspondiente. Para cada gen y cada dimensión de incrustación latente, calculamos la correlación de Pearson entre los valores de expresión génica y los valores de incrustación latente en todas las células. Esto produjo una matriz de correlación gen-por-dimensión. Para cada dimensión de incrustación, los genes se clasificaron por el valor absoluto de su coeficiente de correlación de Pearson, y se seleccionaron los 20 genes principales. El conjunto de genes altamente correlacionados final se definió como la unión de los genes de mayor rango en todas las dimensiones latentes. El mapa de calor para el conjunto de datos de Moncada et al. se muestra en (Figura S3 del Apéndice SI).

Análisis de contribución basado en perturbaciones

Consideramos dos clases de perturbaciones. Supongamos que la asignación tumoral-normal obtenida del modelo completo es , que servirá como referencia. Primero, para evaluar la contribución de la información de CNA, reemplazamos los pesos de los bordes derivados de CNA con pesos constantes y recalculamos la asignación tumoral-normal final, lo que produce . La puntuación de contribución de CNA se definió como

donde denota la medida V entre las asignaciones tumorales-normales perturbadas y originales. Un valor más grande de S(CNA) (es decir, un valor más pequeño de la medida V) indica que eliminar la estructura del gráfico informada por CNA causa un cambio mayor en la separación tumoral-normal final, lo que implica una contribución más fuerte de las relaciones célula-célula derivadas de CNA a la salida del modelo.

En segundo lugar, para evaluar las contribuciones transcripcionales a nivel de vía, perturbamos una vía predefinida a la vez. Utilizamos los grupos de firma relacionados con el cáncer ya incorporados en nuestro diseño de características: Ciclo celular, Daño al ADN, Reparación del ADN, Invasión, Evitar los supresores del crecimiento, Habilitar la inmortalidad replicativa, Inestabilidad genómica y mutación, Resistir la muerte celular y Enriquecido en normal. Para una vía , eliminamos todos los genes de esa vía del conjunto de características de ARN, volvimos a ejecutar el modelo y obtuvimos la asignación tumoral-normal perturbada . Luego, definimos la puntuación de contribución de la vía como

Por lo tanto, un valor más grande de indica que eliminar la vía causa un cambio mayor en la separación tumoral-normal final y, por lo tanto, sugiere una contribución más fuerte de esa vía a la predicción.

Para evaluar aún más si los efectos de la perturbación de la vía observados eran más fuertes de lo esperado por casualidad, construimos un modelo nulo de tamaño coincidente para muestras representativas. Para cada vía que contiene genes, eliminamos repetidamente el mismo número de genes elegidos uniformemente al azar del conjunto de características original, volvimos a ejecutar el modelo completo y recalculamos la asignación tumoral-normal final. Para la -ésima perturbación aleatoria, la puntuación nula se definió como

SPANISH TRANSLATION:
En un total de 26 muestras que abarcan cáncer de mama, colorrectal, páncreas y ovario, generadas en las plataformas 10x Genomics, inDrop y Drop-seq, DeepMalignant logró de forma consistente un buen equilibrio entre precisión y exhaustividad, y demostró una mayor estabilidad entre las muestras en comparación con los métodos existentes basados en ARN y en alteraciones del número de copias (CNA). Su ventaja fue especialmente evidente en entornos desafiantes, incluido el cáncer de páncreas y los conjuntos de datos con cambios de plataforma, donde los métodos basados únicamente en la expresión tendían a sobreestimar la malignidad y los métodos basados únicamente en CNA mostraban una inestabilidad sustancial. Los análisis de ablación demostraron además que tanto la ponderación de los bordes derivada de CNA como la agregación de vecindad basada en gráficos son esenciales para el rendimiento, lo que respalda el principio de diseño central de la integración multimodal de gráficos.

La separación limitada entre las células tumorales y normales observada en el conjunto de datos de cáncer de páncreas inDrop probablemente se deba a una combinación de limitaciones técnicas específicas de la plataforma y las características biológicas intrínsecas de los tumores pancreáticos. En comparación con las plataformas de mayor sensibilidad, como 10x Chromium y Drop-seq, inDrop normalmente presenta una menor eficiencia de captura de transcritos, una menor detección de genes por célula y tasas de abandono más elevadas, lo que en conjunto disminuye la relación señal-ruido y dificulta las sutiles diferencias transcripcionales. Esta limitación es particularmente importante en el cáncer de páncreas, donde las células ductales malignas a menudo se parecen mucho a sus contrapartes normales a nivel de expresión génica, y donde el microambiente tumoral, que comprende abundantes células estromales e inmunitarias, puede diluir aún más las señales específicas del tumor. Además, la alta heterogeneidad de los tumores pancreáticos y la presencia de bajas fracciones de células malignas en algunas muestras exacerban el desafío de distinguir las células tumorales de las normales utilizando solo datos de expresión. No obstante, DeepMalignant distinguió de forma robusta y precisa las células malignas y no malignas tanto en PDACA como en PDACB, gracias a su diseño que integra tanto las firmas de células malignas derivadas del ARN como las relaciones célula-célula informadas por CNA.

Más allá de la precisión de la clasificación, DeepMalignant aprendió representaciones biológicamente significativas. Los análisis de atribución mostraron que el espacio latente se asoció con programas transcripcionales relacionados con el cáncer establecidos, mientras que la aplicación a datos de transcriptómica espacial coincidentes recuperó regiones tumorales espacialmente coherentes que se alinearon estrechamente con la anotación histopatológica. Además, la separación precisa de los puntos malignos y no malignos en los datos de transcriptómica espacial también permitió el análisis de la comunicación célula-célula, contrastando la señalización de fibroblastos a epitelio entre las células epiteliales normales y malignas en una muestra de CDIS.

En conjunto, estos resultados establecen a DeepMalignant como un marco robusto para la identificación de células malignas en diversos conjuntos de datos de transcriptómica unicelular y espacial. En un sentido más amplio, destacan el valor de combinar señales transcripcionales e inferidas genómicas dentro del aprendizaje de representación basado en gráficos para mejorar la anotación de tumores y respaldar estudios posteriores de la heterogeneidad tumoral, las comunicaciones célula-célula y la organización microambiental.

Métodos

Extracción de características

Dado un conjunto de datos de ARN de secuenciación de una sola célula que contiene células, genes y segmentos genómicos para la medición del número de copias, construimos un gráfico célula-célula que integra la información de expresión génica y la alteración del número de copias (CNA).

Características de los nodos de ARN

Sea denota la matriz de recuento de UMI en bruto. Realizamos la normalización del tamaño de la biblioteca seguida de la transformación logarítmica:

Luego, restringimos el espacio de características a un conjunto seleccionado de genes de firma de cáncer derivados del marco scMalignantFinder [[4]] (la lista de genes se encuentra en el Conjunto de datos S3). Estas firmas capturan los programas de expresión génica característicos de las células malignas y se han validado en múltiples conjuntos de datos de cáncer. La matriz de características de nodo resultante es

Cada característica génica se estandariza en todas las células utilizando la normalización de la puntuación z:

donde y denotan la media y la desviación estándar del gen en todas las células.

Construcción de bordes basada en CNA

Sea denota la matriz de CNA después de filtrar los segmentos genómicos con baja varianza:

en la que es una variable ajustable cuyo valor predeterminado es 0,02 para eliminar los segmentos genómicos cuyo número de copias no varía entre las células. Construimos un gráfico de vecinos más cercanos (kNN) en el espacio de CNA utilizando la similitud del coseno:

donde es un exponente de afilado. La matriz de adyacencia ponderada resultante se denota como .

Modelado matemático y red de atención de gráficos

El marco general se ilustra en la Figura 1. Las características derivadas del ARN definen los atributos de los nodos (Figura 1A), mientras que la similitud de CNA define los bordes ponderados (Figura 1B).

Codificador de atención de gráficos

Empleamos un codificador de atención de gráficos de dos capas (Figura 1C). La primera capa realiza el paso de mensajes basado en la atención:

donde las características de los nodos transformadas son

Para cada par de nodos conectados , se calculan las puntuaciones de atención como

El peso del borde derivado de CNA modula directamente la puntuación de atención:

La normalización softmax por filas produce coeficientes de atención:

Los nodos se actualizan mediante la agregación:

La segunda capa del codificador aplica una transformación lineal del gráfico sin atención adicional:

produciendo la incrustación latente .

Decodificador con atadura de pesos

El decodificador refleja la estructura del codificador:

donde los pesos del decodificador están atados a los pesos del codificador de modo que

El decodificador reutiliza la estructura de atención de la primera capa del codificador.

Función de pérdida

El modelo se entrena utilizando una pérdida de reconstrucción combinada con una pérdida contrastiva basada en gráficos:

La pérdida de reconstrucción se define como

Para evitar el colapso de la incrustación y hacer cumplir la coherencia entre las células vecinas de CNA, incorporamos una pérdida contrastiva InfoNCE:

donde denota un vecino positivo muestreado de los K vecinos más cercanos (KNN) determinados por la similitud del coseno de CNA celular, y denota un conjunto de células negativas muestreadas aleatoriamente. Aquí, es un parámetro de temperatura que controla el escalado de la similitud.

Selección del modelo

Durante el entrenamiento, las incrustaciones se agrupan periódicamente utilizando el algoritmo de Leiden (Figura 1D), y se selecciona el estado del modelo que produce la puntuación de silueta más alta para la clasificación maligna-normal posterior.

Llamada de clústeres malignos no supervisada utilizando la carga de CNA

Para determinar si cada clúster del algoritmo de Leiden pertenece al componente tumoral o normal, investigamos los perfiles de CNA de todas las células dentro de cada clúster. En más detalle, sea denota la matriz de CNA cuyo orden de células corresponde al orden de células agrupadas por el algoritmo de Leiden. Centramos los valores de CNA por segmento genómico restando la mediana del segmento en todas las células. Para cada célula , calculamos una puntuación de carga de CNA

Para estabilizar la distribución, aplicamos una transformación logarítmica:

Para cada clúster latente , calculamos una puntuación de carga a nivel de clúster

donde denota el conjunto de células en el clúster .

Modelamos la distribución de las puntuaciones a nivel de clúster utilizando una mezcla gaussiana de dos componentes:

donde son los pesos de la mezcla y denota la densidad gaussiana. Los parámetros se estiman mediante la implementación GaussianMixture en scikit-learn.

El componente con la media más grande se designa como el componente tumoral. En otras palabras, supongamos que , entonces , y , en el que y representan la media, la desviación estándar y el peso de la mezcla para el componente tumoral, y y representan la media, la desviación estándar y el peso de la mezcla para el componente normal. Para cada clúster , la probabilidad posterior de que sus células pertenezcan al componente tum

donde denota la asignación final de tumor a tejido normal después de la -ésima eliminación aleatoria de tamaño coincidente. Esto produjo una distribución nula de puntuaciones de perturbación para cada vía. Luego, comparamos la puntuación de perturbación específica de la vía observada con su distribución nula correspondiente, utilizando la media nula y la desviación estándar nula, lo que da como resultado una puntuación z y un valor p empírico. Este análisis controla el tamaño de la vía y nos permite evaluar si la eliminación coordinada de genes dentro de una vía biológica tiene un efecto más fuerte que la eliminación aleatoria del mismo número de genes.

Anotación de tipo celular y análisis de comunicación espacial en DCIS2

Para DCIS2, se utilizaron datos de secuenciación de ARN de una sola célula y datos de transcriptómica espacial Visium coincidentes para anotar el compartimento de tejido normal y respaldar el análisis posterior de comunicación célula-célula. La matriz de recuento de secuenciación de ARN de una sola célula (scRNA-seq) de DCIS2 se procesó en Seurat [[34]] para el control de calidad, la normalización, la reducción de dimensionalidad y la agrupación, y se asignaron identidades amplias de tipo celular utilizando SingleR [[35]]. Estas anotaciones definieron las principales poblaciones de referencia, incluidas las poblaciones epitelial, de células T, de células B, mieloides, fibroblastos, endoteliales y de células NK. Luego, se aplicó RCTD (versión=2.2.1) a los datos de Visium utilizando los perfiles de scRNA-seq anotados como referencia, y a los puntos normales predichos por DeepMalignant se les asignaron composiciones de tipo celular a partir de los pesos inferidos por RCTD. Para la visualización a nivel de punto y la anotación posterior, el tipo celular dominante se definió como la clase de referencia con el peso RCTD más alto. Los puntos epiteliales se estratificaron aún más en grupos epiteliales malignos y normales utilizando las predicciones de malignidad-normalidad de DeepMalignant.

Análisis de comunicación célula-célula

El análisis de comunicación célula-célula se realizó en el conjunto de datos de transcriptómica espacial DCIS2 utilizando COMMOT [[22]] (versión=0.0.3). Los datos brutos de 10x Visium para la muestra DCIS2, alineados con el genoma de referencia humano (hg38) con Space Ranger, se cargaron con Scanpy [[36]]. Se eliminaron los puntos fuera del tejido (in_tissue = 1), se descartaron los genes detectados en menos de 3 puntos y se filtraron los puntos con menos de 100 recuentos totales. Luego, se unieron las etiquetas de tipo celular a los puntos restantes por código de barras, y se excluyeron los puntos que no tenían una anotación, lo que dio como resultado un conjunto de puntos anotados que se utilizaron como agrupación de tipo celular para todos los análisis posteriores a nivel de grupo.

Los recuentos de expresión se normalizaron a un total de 104 recuentos por punto y se transformaron logarítmicamente (log(1+x)), conservando la matriz no normalizada. Las interacciones ligando-receptor (LR) se obtuvieron de la base de datos CellChat humana [[37]] a través de la interfaz integrada de COMMOT, y la base de datos se restringió a pares LR cuyos genes de ligando y receptor se expresaban en al menos el 5% de los puntos.

La señalización a nivel de punto se calculó con la función spatial_communication de COMMOT utilizando la base de datos CellChat filtrada y un umbral máximo de distancia de interacción espacial de 500 (en las unidades de las coordenadas espaciales de Visium), con complejos heteroméricos considerados (heteromeric=True) y la señalización agregada a nivel de vía (pathway sum=True).

Extracción de características

Dado un conjunto de datos de secuenciación de ARN de una sola célula que contiene células, genes y bins genómicos para la medición del número de copias, construimos un gráfico célula-célula que integra la información de expresión génica y la alteración del número de copias (CNA).

Características del nodo de ARN

Sea denota la matriz de recuento UMI bruta. Realizamos la normalización del tamaño de la biblioteca seguida de la transformación logarítmica:

Luego, restringimos el espacio de características a un conjunto seleccionado de genes de firma de cáncer derivados del marco scMalignantFinder [[4]] (la lista de genes se encuentra en el Conjunto de datos S3). Estas firmas capturan los programas de expresión génica característicos de las células malignas y se han validado en múltiples conjuntos de datos de cáncer. La matriz de características de nodo resultante es

Cada característica génica se estandariza en todas las células utilizando la normalización de la puntuación z:

donde y denotan la media y la desviación estándar del gen en todas las células.

Construcción de bordes basada en CNA

Sea denota la matriz CNA después de filtrar los bins genómicos con baja varianza:

en la que es una variable ajustable cuyo valor predeterminado es 0,02 para eliminar los bins genómicos cuyo número de copias no varía entre las células. Construimos un gráfico de vecinos más cercanos (-NN) en el espacio CNA utilizando la similitud del coseno:

donde es un exponente de afilado. La matriz de adyacencia ponderada resultante se denota como .

Modelado matemático y red de atención de gráficos

El marco general se ilustra en la Figura 1. Las características derivadas del ARN definen los atributos del nodo (Figura 1A), mientras que la similitud de CNA define los bordes ponderados (Figura 1B).

Codificador de atención de gráficos

Empleamos un codificador de atención de gráficos de dos capas (Figura 1C). La primera capa realiza el paso de mensajes basado en la atención:

donde las características del nodo transformadas son

Para cada par de nodos conectados , se calculan las puntuaciones de atención como

El peso del borde derivado de CNA modula directamente la puntuación de atención:

La normalización softmax por filas produce coeficientes de atención:

Luego, las incrustaciones de nodo se actualizan mediante la agregación:

La segunda capa del codificador aplica una transformación lineal del gráfico sin atención adicional:

produciendo la incrustación latente .

Decodificador con unión de pesos

El decodificador refleja la estructura del codificador:

donde los pesos del decodificador están unidos a los pesos del codificador de modo que

El decodificador reutiliza la estructura de atención de la primera capa del codificador.

Función de pérdida

El modelo se entrena utilizando una pérdida de reconstrucción combinada con una pérdida contrastiva basada en gráficos:

La pérdida de reconstrucción se define como

Para evitar el colapso de la incrustación y hacer cumplir la coherencia entre las células vecinas de CNA, incorporamos una pérdida contrastiva InfoNCE:

donde denota un vecino positivo muestreado de los K vecinos más cercanos (KNN) determinados por la similitud del coseno de CNA celular, y denota un conjunto de células negativas muestreadas aleatoriamente. Aquí, es un parámetro de temperatura que controla la escala de similitud.

Selección de modelo

Durante el entrenamiento, las incrustaciones se agrupan periódicamente utilizando el algoritmo Leiden (Figura 1D), y se selecciona el estado del modelo que produce la puntuación de silueta más alta para la clasificación maligna-normal posterior.

Llamada de grupos malignos no supervisada utilizando la carga de CNA

Para determinar si cada grupo del algoritmo Leiden pertenece al componente tumoral o normal, investigamos los perfiles de CNA de todas las células dentro de cada grupo. En más detalle, sea denota la matriz CNA cuyo orden de células corresponde al orden de células agrupadas por el algoritmo Leiden. Centramos los valores de CNA por segmento genómico restando la mediana del segmento en todas las células. Para cada célula , calculamos una puntuación de carga de CNA

Para estabilizar la distribución, aplicamos una transformación logarítmica:

Para cada grupo latente , calculamos una puntuación de carga a nivel de grupo

donde denota el conjunto de células en el grupo .

Modelamos la distribución de las puntuaciones a nivel de grupo utilizando una mezcla gaussiana de dos componentes:

donde son los pesos de la mezcla y denota la densidad gaussiana. Los parámetros se estiman mediante la implementación GaussianMixture en scikit-learn.

El componente con la media más grande se designa como el componente tumoral. En otras palabras, supongamos que , entonces , y , en el que y representan la media, la desviación estándar y el peso de la mezcla para el componente tumoral, y y representan la media, la desviación estándar y el peso de la mezcla para el componente normal. Para cada grupo , la probabilidad posterior de que sus células pertenezcan al componente tumoral es

El grupo se clasifica como tumoral si

Métricas de referencia

Evaluamos el rendimiento de la identificación de células tumorales utilizando la precisión, la exhaustividad y la puntuación F1, con las etiquetas de referencia de tumor-normal tratadas como la verdad fundamental. Para cada muestra, las células predichas como malignas se consideraron predicciones positivas. Los verdaderos positivos (VP) denotan las células malignas predichas correctamente como malignas, los falsos positivos (FP) denotan las células normales predichas incorrectamente como malignas, los falsos negativos (FN) denotan las células malignas predichas incorrectamente como normales y los verdaderos negativos (VN) denotan las células normales predichas correctamente como normales.

La exhaustividad mide la fracción de células malignas verdaderas recuperadas por un método y se definió como

La precisión mide la fracción de células malignas predichas que eran verdaderamente malignas y se definió como

La puntuación F1 resume el equilibrio entre la precisión y la exhaustividad y se calculó como

Las métricas se calcularon por separado para cada muestra.

Selección de parámetros del modelo

Consulte el Apéndice SI, Diseño de la investigación y opciones de hiperparámetros.

Selección de genes altamente correlacionados

Para examinar si las células malignas y normales podrían separarse utilizando solo las características transcriptómicas más informativas, seleccionamos los genes que estaban fuertemente asociados con la incrustación latente de DeepMalignant. Para cada muestra, utilizamos la matriz de características de ARN del modelo DeepMalignant entrenado y la matriz de incrustación latente correspondiente. Para cada gen y cada dimensión de incrustación latente, calculamos la correlación de Pearson entre los valores de expresión génica y los valores de incrustación latente en todas las células. Esto produjo una matriz de correlación gen-por-dimensión. Para cada dimensión de incrustación, los genes se clasificaron por el valor absoluto de su coeficiente de correlación de Pearson, y se seleccionaron los 20 genes principales. El conjunto final de genes altamente correlacionados se definió como la unión de los genes de mayor rango en todas las dimensiones latentes. El mapa de calor para el conjunto de datos de Moncada et al. se muestra en (Figura S3 del Apéndice SI).

Análisis de contribución basado en la perturbación

Consideramos dos clases de perturbaciones. Supongamos que la asignación de tumor a normal obtenida del modelo completo es , que servirá como referencia. Primero, para evaluar la contribución de la información de CNA, reemplazamos los pesos de borde derivados de CNA con pesos constantes y recalculamos la asignación final de tumor a normal, lo que da como resultado . La puntuación de contribución de CNA se definió como

donde denota la medida V entre las asignaciones finales de tumor a normal perturbadas y originales. Un valor más grande de S(CNA) (es decir, un valor más pequeño de la medida V) indica que eliminar la estructura del gráfico informada por CNA causa un cambio mayor en la separación final de tumor a normal, lo que implica una contribución más fuerte de las relaciones célula-célula derivadas de CNA a la salida del modelo.

En segundo lugar, para evaluar las contribuciones transcripcionales a nivel de vía, perturbamos una vía predefinida a la vez. Utilizamos los grupos de firma relacionados con el cáncer ya incorporados en nuestro diseño de características: Ciclo celular, Daño al ADN, Reparación del ADN, Invasión, Evitar los supresores del crecimiento, Habilitar la inmortalidad replicativa, Inestabilidad genómica y mutación, Resistir la muerte celular y Enriquecido en tejidos normales. Para una vía , eliminamos todos los genes de esa vía del conjunto de características de ARN, volvimos a ejecutar el modelo y obtuvimos la asignación final de tumor a normal perturbada . Luego, definimos la puntuación de contribución de la vía como

Por lo tanto, un valor más grande de indica que eliminar la vía causa un cambio mayor en la separación final de tumor a normal y, por lo tanto, sugiere una contribución más fuerte de esa vía a la predicción.

Para evaluar aún más si los efectos de perturbación de la vía observados eran más fuertes de lo esperado por casualidad, construimos un modelo nulo de tamaño coincidente para muestras representativas. Para cada vía que contiene genes, eliminamos repetidamente el mismo número de genes elegidos uniformemente al azar del conjunto de características original, volvimos a ejecutar el modelo completo y recalculamos la asignación final de tumor a normal. Para la -ésima perturbación aleatoria, la puntuación nula se definió como

donde denota la asignación final de tumor y tejido normal después de la eliminación aleatoria de tamaño coincidente en la iteración -ésima. Esto produjo una distribución nula de las puntuaciones de perturbación para cada vía. A continuación, comparamos la puntuación de perturbación específica de la vía observada con su distribución nula correspondiente, utilizando la media nula y la desviación estándar nula, lo que da como resultado una puntuación z y un valor p empírico. Este análisis controla el tamaño de la vía y nos permite evaluar si la eliminación coordinada de genes dentro de una vía biológica tiene un efecto más fuerte que la eliminación aleatoria del mismo número de genes.

Anotación de tipo celular y análisis de comunicación espacial en DCIS2

Para DCIS2, se utilizaron datos de secuenciación de ARN de una sola célula y transcriptómica espacial Visium para anotar el compartimento de tejido normal y respaldar el análisis posterior de la comunicación célula-célula. La matriz de recuento de secuenciación de ARN de una sola célula (scRNA-seq) de DCIS2 se procesó en Seurat [[34]] para el control de calidad, la normalización, la reducción de la dimensionalidad y la agrupación, y se asignaron identidades amplias de tipo celular utilizando SingleR [[35]]. Estas anotaciones definieron las principales poblaciones de referencia, incluidas las poblaciones epiteliales, de células T, de células B, mieloides, fibroblastos, endoteliales y de células NK. A continuación, se aplicó RCTD (versión=2.2.1) a los datos de Visium utilizando los perfiles de scRNA-seq anotados como referencia, y a los puntos normales predichos por DeepMalignant se les asignaron composiciones de tipo celular a partir de los pesos inferidos por RCTD. Para la visualización a nivel de punto y la anotación posterior, el tipo celular dominante se definió como la clase de referencia con el peso RCTD más alto. Los puntos epiteliales se estratificaron aún más en grupos epiteliales malignos y normales utilizando las predicciones maligno-normal de DeepMalignant.

Análisis de comunicación célula-célula

El análisis de comunicación célula-célula se realizó en el conjunto de datos de transcriptómica espacial DCIS2 utilizando COMMOT [[22]] (versión=0.0.3). Los datos brutos de 10x Visium para la muestra DCIS2, alineados con el genoma de referencia humano (hg38) con Space Ranger, se cargaron con Scanpy [[36]]. Se eliminaron los puntos fuera del tejido (in_tissue = 1), se descartaron los genes detectados en menos de 3 puntos y se filtraron los puntos con menos de 100 recuentos totales. A continuación, se unieron las etiquetas de tipo celular a los puntos restantes por código de barras, y se excluyeron los puntos que no tenían una anotación, lo que dio como resultado un conjunto de puntos anotados que se utilizaron como agrupación de tipo celular para todos los análisis posteriores a nivel de grupo.

Los recuentos de expresión se normalizaron a un total de 104 recuentos por punto y se transformaron logarítmicamente (log(1+x)), conservando la matriz no normalizada. Las interacciones ligando-receptor (LR) se obtuvieron de la base de datos human CellChat [[37]] a través de la interfaz integrada de COMMOT, y la base de datos se restringió a los pares LR cuyos genes de ligando y receptor se expresaban en al menos el 5% de los puntos.

La señalización a nivel de punto se calculó con la función spatial_communication de COMMOT utilizando la base de datos CellChat filtrada y un umbral máximo de distancia de interacción espacial de 500 (en las unidades de las coordenadas espaciales de Visium), con complejos heteroméricos considerados (heteromeric=True) y la señalización agregada a nivel de vía (pathway sum=True).

Se abre en una nueva pestaña en la publicación original

Compartir y Discutir

Comentarios

¡Aún no hay comentarios. Sé el primero en comentar!

Enviar a mi oncólogo

Artículo: Multi-modality Graph Representation Learning for Malignant Cell Identification from scRNA-seq using DeepMalignant

Autores: Bhattarrai, P.; Yuan, W.; Chi, H.; Zhou, X. M.; Mallory, X.
Publicado: 2026-07-03

Enlace: https://crcwarriors.org/article-detail.php?id=2511

¡Regístrate para usar esta función!

Crea una cuenta gratuita para enviar artículos científicos directamente a tu oncólogo y acceder a muchas más funcionalidades personalizadas.

Regístrate gratis