Volver a Noticias Científicas
Investigación Científica

Detalles del Artículo

Inferencia y validación en diversos tipos de cáncer de mutaciones hipermórficas, hipomórficas y neomórficas.

¿Qué significa esto para los pacientes?

AI

Inicia sesión o regístrate para generar explicaciones con IA

Aunque se han caracterizado los efectos funcionales de muchas mutaciones cancerosas recurrentes, el Proyecto del Genoma del Cáncer contiene más de 10 millones de eventos no recurrentes con función desconocida. Se propone que la actividad específica del contexto de los factores de transcripción, evaluada a través de la expresión de sus genes diana transcripcionales, sirva como un ensayo de reportero sensible y preciso para evaluar los papeles funcionales de las mutaciones oncogénicas. El análisis de la actividad de los factores de transcripción en muestras con mutaciones de significado desconocido, en comparación con mutaciones establecidas de ganancia de función (hipermórficas) o pérdida de función (hipomórficas) en el mismo gen, permitió la caracterización funcional de 583.089 eventos mutacionales individuales en el Proyecto del Genoma del Cáncer. Este enfoque facilitó la identificación de mutaciones neomórficas (ganancia de una nueva función) o mutaciones que imitan fenotípicamente las mutaciones en otros genes (mimetismo mutacional).

La validación mediante ensayos de expresión de mutaciones exógenas confirmó la mayoría de las mutaciones predichas de pérdida de función, ganancia de función, neomórficas y neutras (sin efecto funcional predicho) en PIK3CA y FGFR2.

Estos hallazgos pueden proporcionar información para la toma de decisiones sobre terapias dirigidas para pacientes con mutaciones de significado desconocido en oncogenes establecidos.

PubMed Central ~16,913 palabras · 85 min de lectura

La tumorigénesis se caracteriza por la acumulación progresiva de mutaciones en oncogenes y genes supresores de tumores (en adelante, oncogenes), lo que conduce a la transformación celular[1]. Sin embargo, la mayoría de las muestras en grandes repositorios aún carecen de una base genética para la tumorigénesis, debido a la naturaleza específica de sus mutaciones o a múltiples eventos de transformación débil, a menudo denominados efecto de campo, en los que múltiples mutaciones no recurrentes pueden cooperar para inducir desregulación y transformación[2]. Por lo tanto, diferenciar las mutaciones neutras (es decir, de acompañamiento) de aquellas con efectos funcionalmente relevantes, aunque modestos, sigue siendo un desafío importante, por ejemplo, para determinar si los pacientes que presentan mutaciones de significado desconocido pueden beneficiarse o verse perjudicados por un inhibidor dirigido.

Las mutaciones génicas pueden aumentar (hipermórfica o de ganancia de función (GOF)), disminuir (hipomórfica o de pérdida de función (LOF)), desregular (neomórfica (NEO) o de ganancia de nueva función[3]) o afectar neutralmente (isomórfica (NEU)) la actividad fisiológica de una proteína, contribuyendo potencialmente a la patogénesis. Estos efectos pueden surgir de múltiples mecanismos, incluida la modulación de la afinidad enzima-sustrato, que afectan la localización subcelular o la inducción de nuevas interacciones. Por ejemplo, en contraste con la molécula de tipo salvaje, la mutación neomórfica SMAD4G386D induce una interacción aberrante con GSK3B, lo que afecta la vía Wnt/β-catenina regulada por GSK3B[4]. Adoptamos la terminología establecida de "variantes de significado funcional establecido" (VEFS) y "variantes de significado funcional desconocido" (VUFS)[5] para denotar variantes con efectos funcionales caracterizados y no caracterizados, respectivamente.

El Proyecto del Genoma del Cáncer (TCGA)[6] comprende más de 10 millones de VUFS en oncogenes putativos, lo que representa mutaciones potencialmente tratables[7]. Los pacientes con cáncer recién diagnosticados pueden presentar docenas de VUFS adicionales, cuya evaluación funcional sería fundamental para determinar si pueden beneficiarse, no responder o incluso verse perjudicados[8],[9] por las terapias dirigidas. Para abordar este desafío, aprovechamos el repertorio de VEFS relevantes para el cáncer para generar un clasificador altamente preciso para un universo de VUFS mucho más amplio. Esto incluye mutaciones que pueden haberse caracterizado en un contexto tumoral, pero no en otros, donde pueden presentar una función sustancialmente diferente[10], así como co-mutaciones que pueden afectar la función aberrante de una VEFS oncogénica[10] y mutaciones que imitan a las VEFS en diferentes oncogenes (mimetismo mutacional)[11].

Aunque existen ensayos altamente eficaces para la caracterización funcional de las mutaciones[10],[12], ampliarlos para cubrir todo el repertorio de VUFS, por ejemplo, mediante la mutagénesis de saturación[13], es laborioso y costoso. Además, la caracterización en tiempo real de las VUFS detectadas en pacientes recién diagnosticados es un desafío. De hecho, dado que la función de la mutación está influenciada por el contexto tumoral, los nuevos eventos deben analizarse en contextos tumorales coincidentes[14]. Finalmente, la detección de eventos débiles o neomórficos que cooperan para inducir la tumorigénesis no es trivial.

La mayoría de las mutaciones transformadoras ocurren en las vías de transducción de señales o en los reguladores transcripcionales[15], siendo estos últimos, incluidos los factores de transcripción y los cofactores (en adelante, "FT"), los efectores finales canónicos de las mutaciones en las vías de señalización[16]. Proponemos que las mutaciones inducen firmas de actividad de FT reproducibles y altamente específicas que se pueden aprender de las VEFS y utilizar para la clasificación de VUFS. Para detectar estas firmas, utilizamos el algoritmo VIPER, ampliamente validado[17], que evalúa la actividad de un FT utilizando sus genes diana (regulón) como un ensayo de genes reporter multiplexados. Si bien las firmas de actividad de FT basadas en VIPER no están necesariamente asociadas con la oncogénesis, las utilizadas en este estudio se derivan de VEFS oncogénicas informadas en TCGA. Por lo tanto, excepto por los eventos neomórficos, la clasificación de VUFS estará relacionada principalmente con el potencial oncogénico.

Con este fin, desarrollamos PHNToM (identificación basada en la actividad de proteínas de efectores hipomórficos, hipomórficos, neomórficos como mutaciones oncogénicas relevantes para la terapia). Este marco genera firmas de actividad de FT inducidas por VEFS de GOF y/o LOF y las utiliza para clasificar las VUFS en el mismo gen como NEU, GOF, LOF o NEO, así como para evaluar su capacidad para imitar el efecto de las VEFS en otros oncogenes (mimetismo mutacional).

Seleccionamos las mutaciones PIK3CA y TP53 en la cohorte de cáncer de mama (BRCA) del TCGA como ejemplos ilustrativos. Ambos son genes bien estudiados con una amplia caracterización funcional, pero albergan muchas mutaciones no caracterizadas. Como se informa en cBioPortal[18],[19], la cohorte de BRCA comprende 1084 muestras, de las cuales 333 y 352 albergan mutaciones PIK3CA y TP53, respectivamente; sin embargo, solo 124 y 154 de estos eventos se informan como VEFS.

Luego, analizamos el repertorio completo de oncogenes para los cuales estaban disponibles cinco o más muestras que albergaban VEFS, lo que respalda la generación de una firma de actividad de FT sólida, en al menos una de las 25 cohortes más grandes del TCGA, para un total de 583.089 eventos. Entre estos, 317.367, 166.079, 97.325 y 2.318 se predijo que representarían eventos GOF, LOF, NEU y NEO, respectivamente, lo que amplía el repertorio de mutaciones potencialmente oncogénicas. Las VUFS restantes se encontraron en cohortes demasiado pequeñas para el análisis o en oncogenes con VEFS insuficientes para la generación de firmas. También caracterizamos los eventos de mimetismo mutacional candidatos dentro de estas cohortes y utilizamos las firmas de actividad de FT inducidas por VEFS para obtener nuevos conocimientos sobre sus efectores posteriores. Para validar la precisión de nuestras predicciones, expresamos ectópicamente un subconjunto de transgénes mutados, incluidos PIK3CA, FGFR2 y FGFR3, en células de tipo salvaje y evaluamos la desregulación global de la actividad de las proteínas que inducen mediante el análisis de sus perfiles de ARN-seq y los ensayos de proliferación independientes de mitógenos, lo que confirma la precisión y la sensibilidad del método.

Resultados

PHNToM caracteriza los eventos de VUFS en oncogenes establecidos en función de las firmas de actividad evaluadas por VIPER para aproximadamente 3700 FT (FT y co-FT definidos en Gene Ontology)[20]. VIPER mide la actividad de un FT[21][23] en función de la expresión diferencial de sus genes diana específicos del tejido, según lo indicado por el algoritmo ARACNe (algoritmo para la reconstrucción de redes celulares precisas)[24][26]. Las firmas de actividad de FT inducidas por VEFS se aprenden primero y luego se utilizan para caracterizar las VUFS en el mismo oncogen. Se proporciona un flujo de trabajo conceptual en la Fig. 1 (Fig. 1 complementaria). Dado un gen de interés (P) y un tipo de tumor específico, generamos una firma de actividad asociada con su estado mutado comparando todas las muestras que albergan una VEFS (PMut) con un subconjunto óptimo de controles de tipo salvaje (PWT). Tanto las muestras PMut como PWT se seleccionan para lograr resultados óptimos. Los detalles se proporcionan en los Métodos y en la Nota complementaria, que también incluye una tabla de acrónimos.

ARACNe requiere ≥100 perfiles de expresión génica (GEP) para una inferencia precisa de los genes diana transcripcionales, lo que limita el análisis a 25 cohortes del TCGA (Tabla 1 complementaria). VIPER puede transformar los GEP en perfiles de "actividad de FT" precisos[17] (Fig. 1a), que se comparan favorablemente con las mediciones basadas en anticuerpos, incluso a partir de datos de una sola célula[17],[23],[27].

Selección de controles de tipo salvaje

Para generar controles negativos que representen la actividad del oncogén de tipo salvaje específica de la cohorte, primero seleccionamos todas las muestras PWT. Sin embargo, los oncogenes se desregulan con frecuencia por mutaciones en los reguladores ascendentes o por señales parácrinas/endocrinas aberrantes. Por lo tanto, las muestras PWT aún pueden presentar una actividad aberrante, un factor de confusión significativo. Por ejemplo, si bien las muestras PIK3CAMut en el cáncer de mama inducen una mayor actividad de PIK3CA evaluada por VIPER, varias muestras PIK3CA de tipo salvaje tienen una mayor actividad promedio que el tejido epitelial normal de la mama en Genotype-Tissue Expression (GTEx)[28] (Fig. 1b), lo que representa un conjunto de control sesgado. Para abordar este problema, eliminamos las muestras PWT con una actividad estadísticamente significativamente diferente de la observada en la cohorte GTEx correspondiente (P < 0,05, mediante la prueba t de Student), lo que da como resultado un conjunto de control refinado (PWT0).

Otro factor de confusión es la estratificación no aleatoria de las mutaciones en subtipos tumorales transcripcionalmente distintos. Por ejemplo, las muestras PIK3CAMut están significativamente enriquecidas en el cáncer de mama luminal en comparación con el cáncer de mama triple negativo. Por lo tanto, la comparación de las muestras PIK3CAMut versus PIK3CAWT0 también identificaría los FT con actividad diferencial del subtipo. Para evitar la definición arbitraria de subtipos en varias cohortes, generamos un conjunto de control negativo óptimo (PWT) como los k-vecinos más cercanos de cada muestra que alberga VEFS en PWT0, en función del análisis de enriquecimiento de la actividad de las proteínas (PAEA; algoritmo OncoMatch[22]), con k = 5 para una evaluación adecuada de las estadísticas de VIPER, como se describió anteriormente[17] (Métodos y Nota complementaria).

Generación de la firma de consenso

Para cada oncogén y cohorte, cada muestra que alberga VEFS (PMut) se comparó con su conjunto de control negativo óptimo (PWT) para generar una firma de FT diferencialmente activa, clasificada por la puntuación de enriquecimiento normalizada (NES) de VIPER (firma VEFS). Los valores NES positivos y negativos denotan un aumento y una disminución de la actividad de FT en la muestra mutada, respectivamente. Los valores NES se integraron luego en todas las muestras que albergan VEFS, independientemente de su locus genómico, utilizando el método de Stouffer para producir una firma de consenso. Para integrar las firmas de mutaciones GOF y LOF en una sola firma, se invirtió el signo de los valores NES de los eventos LOF.

Para caracterizar una VUFS específica, generamos una firma de consenso comparando una o más muestras que albergan esa VUFS, definidas por el mismo locus genómico y las mismas sustituciones de aminoácidos, con sus conjuntos PWT correspondientes. Las VUFS se clasificaron posteriormente comparando sus firmas de consenso con las de las VEFS correspondientes mediante el análisis de enriquecimiento de conjuntos de proteínas. Cuando estuvieron disponibles varias muestras que albergaban la misma VUFS, el efecto funcional se nominó mediante análisis de mayoría.

Significado funcional

PHNToM clasifica las mutaciones como GOF, LOF, NEO o NEU utilizando PAEA, una extensión sencilla de GSEA[29], donde la expresión génica diferencial se reemplaza por la actividad de proteína diferencial. Los resultados se basan en la integración de dos métricas NES producidas por PAEA, que incluyen NES GOF/LOF directa (DGN) y NES GOF/LOF inversa (IGN; Nota complementaria).

DGN

Para un oncogén específico, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 más activados y los 25 más inactivados, en la firma de consenso de VEFS en las proteínas diferencialmente activas en una firma de consenso de VUFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si los FT más desregulados por los eventos GOF o LOF establecidos también se ven afectados de manera similar por una VUFS.

IGN

Para un oncogén específico, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 superiores e inferiores, en una firma de consenso de VUFS entre las proteínas diferencialmente activas en la firma de consenso de VEFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si una VUFS puede desregular proteínas que no se ven afectadas por las VEFS.

El uso de los 25 FT más y menos diferencialmente activos está justificado por un estudio reciente sobre la canalización de patrones mutacionales en TCGA[2]. Sin embargo, demostramos además que las predicciones no se ven afectadas cuando se utilizan de 10 a 200 FT, lo que respalda la solidez del análisis[30].

Se espera que los VUFS que fenocopien los VEFS en el mismo oncogén produzcan valores de DGN e IGN similares, positivos o negativos para eventos de GOF y LOF, respectivamente. Si la diferencia es estadísticamente significativa (es decir, P (|DGN–IGN|) < 0,05), entonces los factores de transcripción (FT) desregulados por los VUFS deben incluir algunos que no estén desregulados por los VEFS (o viceversa), lo que indica actividad neomórfica. Por lo tanto, son posibles las siguientes opciones: el VUFS es NEU si el DGN, el IGN y |DGN–IGN| no son estadísticamente significativos. El VUFS induce GOF si tanto el DGN como el IGN son positivos y estadísticamente significativos (P < 0,05, corregido por Benjamini–Hochberg). La significación estadística general (PGOF) se evalúa mediante la integración de Stouffer. El VUFS induce LOF si tanto el DGN como el IGN son negativos y estadísticamente significativos. La significación estadística (PLOF) se evalúa nuevamente mediante la integración de Stouffer. El VUFS es un evento NEO si la diferencia entre el DGN y el IGN es estadísticamente significativa, independientemente de sus estadísticas individuales (Nota suplementaria). Por lo tanto, un VUFS puede clasificarse como NEO/GOF, NEO/LOF o simplemente NEO. La significación estadística NEO (PNEO) utiliza un modelo nulo conservador basado en la densidad de probabilidad de las puntuaciones SNEO en todos los VEFS, asumiendo que los eventos NEO son raros.

Por lo tanto, cada VUFS está asociado con dos valores P independientes, que representan su actividad GOF/LOF y NEO, respectivamente. Consulte la Nota suplementaria para obtener ejemplos ilustrativos y más detalles sobre la evaluación de DGN, IGN y |DGN–IGN|.

Análisis de prueba de concepto

Inicialmente, nos centramos en PIK3CA y TP53 como estudios de caso relevantes para eventos de GOF y LOF. Estos oncogenes se encuentran entre los más frecuentemente mutados en el cáncer, lo que proporciona un gran repertorio de eventos VEFS y VUFS en múltiples cohortes de cáncer (Nota suplementaria). Se generaron firmas de consenso para cada cohorte que comprendía ≥5 VEFS. Cabe destacar que no se han notificado VEFS de PIK3CA LOF o TP53 GOF [18], [19], [31], [32]. Las cuatro clasificaciones diferentes para las mutaciones de PIK3CA en BRCA se ilustran en la Fig. 2a–d (consulte la Nota suplementaria para obtener una discusión más detallada). La Fig. 2e ilustra las muestras de BRCA que albergan mutaciones de PIK3CA, incluidos tanto VEFS como VUFS, con eventos clasificados desde el más GOF hasta el más LOF y filas que representan la actividad de los 50 FT de la Firma de Consenso evaluada por VIPER. Como se describió anteriormente [33], las predicciones de VEFS se obtuvieron utilizando una validación cruzada de cinco pliegues, lo que garantiza que las muestras clasificadas se excluyeron del conjunto de entrenamiento. Para evaluar las mejoras que se obtienen del conjunto de control negativo óptimo (PWT) en comparación con el conjunto no refinado, generamos el mismo mapa de calor de PIK3CA de BRCA utilizando todas las muestras de tipo salvaje de PIK3CA como controles negativos (Fig. 2f), lo que resultó en un rendimiento de clasificación y un sesgo de subtipo tumoral significativamente menores. Para visualizar estos resultados, utilizamos un diagrama de dispersión bidimensional que representa tanto la actividad GOF/LOF como la actividad NEO de los VEFS y VUFS que se predijo que eran funcionalmente relevantes. Cabe destacar que algunos VUFS de PIK3CA (Fig. 1a–c ampliada) y TP53 (Fig. 1d–f ampliada) se predijeron como eventos LOF y GOF, respectivamente, aunque ninguno se había notificado previamente [18], [19], [31], [32] (consulte la Tabla suplementaria 1 para obtener una lista exhaustiva de las predicciones en todas las cohortes de TCGA).

Además, si bien la mayoría de los GOF de PIK3CA se clasificaron entre los que tenían la mayor significación estadística, muchos VUFS presentaron tamaños de efecto comparables o incluso mayores, lo que se confirmó posteriormente mediante ensayos experimentales. Cabe destacar que 17 de 28 eventos (61%) asociados con la mayor actividad GOF predicha por PHNToM fueron VUFS en lugar de VEFS. Incluso en comparación con los tres eventos VEFS con la puntuación más alta (es decir, PIK3CAP366R, PIK3CAP539R y PIK3CAP104L), los VUFS como PIK3CAN345K, PIK3CAE726K y PIK3CAR349* presentaron una actividad PIK3CA y puntuaciones PHNToM aún mayores (Fig. 3a).

Tanto para PIK3CA como para TP53, la Firma de Consenso de VEFS se conservó notablemente en todos los eventos GOF y se invirtió prácticamente por completo en los eventos LOF, lo que respalda su naturaleza como un indicador eficaz de la desregulación de los FT inducida por la mutación (Fig. 4c), así como su relevancia biológica basada en el enriquecimiento de Gene Ontology y Reactome (Fig. 4d y e, respectivamente). Consulte la Fig. 3b para obtener un diagrama de dispersión que represente todos los VUFS de PIK3CA estadísticamente significativos en BRCA.

Posteriormente, se amplió el análisis a todas las cohortes de TCGA que comprendían ≥100 muestras (n = 25; Tabla suplementaria 1). Entre estas, se presentan mapas de calor para las tres cohortes (carcinoma endometrial del cuerpo uterino (UCEC), adenocarcinoma de colon (COAD) y carcinoma de células transicionales de la vejiga (BLCA)) con la mayor fracción de muestras mutadas (49%, 29% y 21%, respectivamente; Fig. 1a–c ampliada). De manera similar a BRCA, se predijo que UCEC, que también es un tumor sensible a las hormonas, incluiría tanto VUFS GOF como LOF, mientras que se predijo que las otras dos cohortes albergarían solo eventos GOF. Para TP53, se muestran mapas de calor para las cuatro cohortes (BRCA, COAD, BLCA y ESCA) con la mayor fracción de muestras TP53Mut (52%, 51%, 42% y 34%, respectivamente; Fig. 1d–g ampliada y consulte la Nota suplementaria para obtener resultados más detallados).

La conservación de los FT efectores candidatos entre diferentes VEFS y VUFS dentro del mismo gen plantea la pregunta de si se observan patrones similares entre diferentes tipos de tumores. Para PIK3CA, por ejemplo, el análisis de similitud de la Firma de Consenso mediante la correlación de Spearman identificó dos grupos con una actividad de FT efectores altamente conservada dentro del grupo y ortogonal entre los grupos (Fig. 3c). El primer grupo consistió casi exclusivamente en tumores epiteliales, mientras que el segundo incluyó adenocarcinoma de próstata, cistoadenocarcinoma seroso ovárico, glioma de bajo grado, melanoma cutáneo y carcinoma hepatocelular. El carcinoma esofágico (ESCA) fue un valor atípico, con una firma de FT efectores única. Se observó una estratificación similar para TP53, aunque con carcinoma de células papilares renales, sarcoma, glioblastoma multiforme y adenocarcinoma de recto, formando un tercer grupo (Fig. 1h ampliada). En conjunto, estos datos sugieren que PIK3CA y TP53 pueden regular diferentes FT/co-FT efectores en tumores con diferentes linajes.

Análisis del dominio estructural

Realizamos dos análisis para evaluar si la ubicación espacial, determinada por los dominios estructurales de las proteínas, estaba asociada con los efectos funcionales predichos de las mutaciones. Primero, seleccionamos mutaciones GOF específicas del dominio/interdominio de PIK3CA y comparamos su Firma de Consenso promedio con la de todas las mutaciones GOF. En segundo lugar, posicionamos los eventos GOF establecidos y predichos en la estructura 3D de la proteína, según lo informado en la Protein Data Bank (PDB) [34], porque la agrupación espacial de las mutaciones funcionalmente relevantes no se puede caracterizar eficazmente en la secuencia del gen [3] (Fig. 4a). Si bien las mutaciones ocurren en los cuatro dominios de PIK3CA (p85B, Ka, C2 y P14) y con menos frecuencia en las regiones interdominio [35] (Fig. 4b y Tabla suplementaria 1), la mayoría de los VEFS ocurren en P14 (64 muestras) y C2 (42 muestras). En consonancia con esto, los VEFS en estos dominios tuvieron la mejor y la segunda mejor coincidencia con la Firma de Consenso global (Fig. 4c), con el dominio P14 presentando la coincidencia estadísticamente más significativa. De manera similar, las Firmas de Consenso para los VUFS en estos dominios también fueron las más enriquecidas [36] (Fig. 1b). Por el contrario, la mayoría de los VEFS neomórficos [9] (por ejemplo, en PIK3CAE545, PIK3CAE542, PIK3CAH1047 y PIK3CAQ546K) y los VUFS ocurrieron fuera de los dominios P14 y C2.

Análisis pan-cáncer

Luego, ampliamos el análisis a 3736 oncogenes putativos (Tabla suplementaria 1), con ≥5 muestras que albergan VEFS en FASMIC, en una o más de las 25 cohortes (Tabla suplementaria 1). Los resultados se proporcionan en la Tabla suplementaria 1 (https://phntom-mut.com/). La clasificación de VUFS para las cuatro cohortes con la mayor fracción de muestras PIK3CAMut, que incluyen UCEC, COAD, BLCA y ESCA, se muestra en la Fig. 2a–e ampliada.

Validación retrospectiva de las predicciones de PHNToM

Realizamos una validación retrospectiva de los eventos predichos por PHNToM basados en mutaciones validadas experimentalmente en FASMIC (n = 2411 eventos en todas las cohortes de cáncer; consulte Métodos para la asignación funcional de eventos idénticos con diferentes clasificaciones en múltiples muestras). El análisis de las predicciones de eventos GOF, LOF, NEO y NEU produjo 945 (P = 6,6 × 10−214), 613 (P = 5,4 × 10−270), 22 (P = 1,8 × 10−37) y 622 (P = 0, es decir, por debajo de la precisión de la máquina) verdaderos positivos y 121, 51, 9 y 28 falsos positivos, respectivamente. Los valores P se evaluaron mediante un modelo binomial, utilizando la frecuencia esperada de estos eventos en FASMIC (Tabla suplementaria 2). Al comparar los eventos funcionales (GOF, LOF, NEO, como positivos) con los eventos NEU (como negativos), el análisis produjo 1580 verdaderos positivos, 181 falsos positivos, 622 verdaderos negativos y 28 falsos negativos (P = 0, basado en la prueba de χ2).

Solo se informa un puñado de mutaciones neomórficas en FASMIC. Sin embargo, una revisión de la literatura reveló que varias de las principales predicciones NEO (no en FASMIC) se habían notificado previamente [9], incluidas varias variantes en el aminoácido PIK3CAE545, PIK3CAE542, PIK3CAH1047, PIK3CAQ546K y PIK3CAG1049R. En particular, el análisis de espectrometría de masas demostró que PIK3CAE545K induce una interacción inesperada con IRS1, independientemente de p85 (ref. [37]). Consulte la Tabla suplementaria 2 para obtener una lista completa de las predicciones NEO en todas las cohortes de TCGA.

Apoyando la naturaleza específica del contexto de nuestras predicciones, observamos que, si bien mutaciones específicas pueden inducir una actividad proteica aberrante dentro de una cohorte determinada, este efecto puede no generalizarse a otras cohortes. Por ejemplo, PHNToM predijo PIK3CAV71I como un evento GOF en el carcinoma de células escamosas de cabeza y cuello (DGN = 6,34, P = 2,78 × 10−10; IGN = 6,29, P = 3,36 × 10−10 y |DGN–IGN| = 0,05, P = 2,9 × 10−1; Nota suplementaria y Tabla suplementaria 1), pero no en BRCA. En consonancia con esto, FASMIC [3] informa que esta mutación es un GOF en las células de carcinoma de células escamosas de cabeza y cuello, pero no en las células MCF10A [38].

Validación experimental

Para validar de forma prospectiva las predicciones de PHNToM, seleccionamos las 38 mutaciones de PIK3CA específicas de cáncer de mama con la puntuación más alta, incluidos 8 GOF, 5 LOF, 3 NEU y 18 VUFS, así como 3 GOF y 1 NEO VEFS como controles positivos. Con fines de validación, las mutaciones se clasificaron en función de su significación estadística, excluyendo aquellas que no se podían transducir eficazmente (Tablas suplementarias 1 y 3). Se generaron firmas de expresión génica diferencial después de la expresión ectópica mediada por lentivirus del cDNA mutante de PIK3CA en las células MCF10A, en comparación con el cDNA simulado como control negativo. Se generaron perfiles de RNA-seq en placas de 96 pocillos mediante la amplificación de bibliotecas agrupadas para la expresión del transcriptoma (PLATE-Seq) [39] (Nota suplementaria). La actividad funcional se evaluó en función de la recapitulación significativa de la Firma de Consenso específica de BRCA (P < 0,05, corregido por Benjamini–Hochberg). El análisis confirmó las predicciones para 8 de 8 GOF (100%), 5 de 5 LOF (100%), 14 de 18 NEO (~78%) y 3 de 3 variantes NEU (100%; P < 4,75 × 10−36, utilizando un modelo binomial basado en la frecuencia de los eventos GOF, LOF, NEO y NEU en FASMIC (Métodos y Tabla suplementaria 3). También se confirmaron experimentalmente los controles positivos (Fig. 3d). Si bien 4 de las 18 predicciones NEO no se validaron como eventos neomórficos, 2 se infirieron correctamente como eventos GOF, ya que su DGN fue significativamente positivo, lo que es consistente con su estado funcional en FASMIC. Estos incluyen PIK3CAH1047L (PDGN = 2,7 × 10−12, PIGN = 3,7 × 10−12) y PIK3CAH1047R (PDGN = 1,2 × 10−12, PIGN = 2,7 × 10−12; Tabla suplementaria 3). Los valores P para todos los VUFS probados se proporcionan (Tabla suplementaria 3), así como los diagramas PAEA para eventos representativos (Fig. 5a–c), incluidos los eventos LOF de PIK3CA que no se habían notificado previamente.

A continuación, clonamos nueve mutaciones no sinónimas en el dominio quinasa de FGFR2 y FGFR3, predichas como eventos de ganancia de función (GOF), y ambos controles de tipo salvaje (Tabla suplementaria 4), y pusimos a prueba su capacidad para promover la proliferación independiente de factores de crecimiento en células MCF10A en tres réplicas biológicas y cuatro réplicas técnicas por réplica biológica, utilizando un ensayo CellTiterGlo (Fig. 5d y Tabla suplementaria 4). Cinco de seis VUFS de FGFR2 fueron validadas (FGFR2N549K, FGFR2N549D, FGFR2N549H, FGFR2S587C y FGFR2K659E), mientras que FGFR2V634A no logró aumentar la proliferación (Fig. 2f de los datos ampliados, Tabla suplementaria 4 y Nota suplementaria). Sin embargo, ninguna de las tres VUFS de FGFR3 GOF (FGFR3V505I, FGFR3D646N y FGFR3R669Q)[40] fue validada (Tabla suplementaria 4), posiblemente porque este ensayo conservador puede no revelar eventos GOF más débiles o específicos del contexto, como los de proteínas oncogénicas más débiles como FGFR3_.

Mimetismo mutacional y evaluación de la epistasis

Las mutaciones en un gen dado (GA) pueden fenocopiar mutaciones en un gen diferente (GB) o exhibir efectos epistáticos sobre su capacidad transformadora. PHNToM puede detectar potencialmente estos efectos mediante el análisis de la Firma de Consenso de GB en las muestras. El primer efecto es consistente con el concepto de pseudomutantes[41] o mimetismo mutacional[41]. Estos eventos pueden revelar genes que actúan en la misma vía, así como mecanismos de canalización y comunicación cruzada más complejos. Una forma posible de discriminar las interacciones epistáticas es evaluar la significación estadística de la probabilidad condicional.

Por ejemplo, las muestras que presentan una Firma de Consenso de pérdida de función (LOF) de PIK3CA están significativamente enriquecidas en mutaciones LOF de TP53, así como en mutaciones GOF de CDH1 y MAP3K1 (Fig. 6a, b). Si bien las mutaciones LOF de TP53 pueden mimetizar las mutaciones LOF de PIK3CA, esto es poco probable porque TP53 reprime la expresión de PIK3CA, lo que induciría el efecto opuesto. Una explicación alternativa es que la presencia de mutaciones de TP53 elimina la necesidad (es decir, amortigua) de una mayor actividad de la vía PI3K para la transformación. Esto sugiere una interacción epistática, lo que está respaldado por tres hallazgos. Primero, la señalización PI3KAKTmTOR está marginalmente inactiva en las muestras que albergan mutaciones LOF de TP53 (P = 0,06; Fig. 3a de los datos ampliados). En segundo lugar, las muestras TP53Mut en DepMap tienen valores de IC50 significativamente más altos para los inhibidores de PIK3CA en comparación con las líneas celulares TP53WT (P ≤ 0,01, mediante la prueba de Mann-Whitney-Wilcoxon; Fig. 3b de los datos ampliados). En tercer lugar, las muestras TP53Mut están negativamente enriquecidas en PIK3CAMut (P = 10−5, mediante la prueba χ2). Como tal, este resultado probablemente identificó una interacción TP53PIK3CA epistática/amortiguadora. Cabe destacar que la interacción TP53LOF→PIK3CALOF también es significativa en ocho cohortes adicionales (COAD, glioblastoma multiforme, carcinoma de células papilares renales, glioma de bajo grado, carcinoma de células escamosas de pulmón, adenocarcinoma de pulmón, cistoadenocarcinoma seroso ovárico y adenocarcinoma de próstata; Fig. 4 de los datos ampliados).

Realizamos un análisis sistemático de mimetismo/epistasis en las 25 cohortes (Fig. 4 de los datos ampliados y Tabla suplementaria 5), incluido BRCA (Fig. 6c), mostrando solo las interacciones respaldadas por ≥4 muestras que albergan VUFS. Los resultados también se muestran como mapas de calor de interacción funcional (consulte la Fig. 5a de los datos ampliados para un ejemplo de mimetismo específico de UCEC, que identifica EGFRA743T, KRASQ61H y KDRS1347L como mímicos altamente significativos de ARID1AMut). Varias interacciones predichas relacionadas con BRCA están respaldadas por la literatura previa, como los eventos GOF de ERBB2, que se ha demostrado que mimetizan los eventos GOF en PIK3CG, un gen en su vía descendente directa[42]. En esencia, los eventos GOF en PIK3CG no se predijeron como mímicos GOF de ERBB2, lo que es consistente con el hecho de que PIK3CG está aguas abajo de ERBB2. De manera similar, se identificaron las mutaciones de ALK como mímicos de PDGFRB, ya que regulan vías descendentes relacionadas. Esto está respaldado por la evidencia de que MET induce resistencia al inhibidor de ALK en los tumores ALKMut[43].

Selección de controles de tipo salvaje

Para generar controles negativos que representen la actividad oncogénica de tipo salvaje específica de la cohorte, primero seleccionamos todas las muestras PWT. Sin embargo, las oncoproteínas se desregulan con frecuencia mediante mutaciones en los reguladores ascendentes o mediante señales paracrinas/endocrinas aberrantes. Por lo tanto, las muestras PWT aún pueden presentar una actividad aberrante, un factor de confusión significativo. Por ejemplo, si bien las muestras PIK3CAMut en el cáncer de mama inducen una mayor actividad de PIK3CA evaluada por VIPER, varias muestras PIK3CA de tipo salvaje tienen una mayor actividad promedio que el tejido epitelial normal de la mama en Genotype-Tissue Expression (GTEx)[28] (Fig. 1b), lo que representa un conjunto de control sesgado. Para abordar este problema, eliminamos las muestras PWT con una actividad estadísticamente significativamente diferente de la observada en la cohorte GTEx correspondiente (P < 0,05, mediante la prueba t de Student), lo que resultó en un conjunto de control refinado (PWT0).

Otro factor de confusión es la estratificación no aleatoria de las mutaciones en los distintos subtipos tumorales. Por ejemplo, las muestras PIK3CAMut están significativamente enriquecidas en el cáncer de mama luminal en comparación con el cáncer de mama triple negativo. Por lo tanto, la comparación de las muestras PIK3CAMut versus PIK3CAWT0 también identificaría los factores de transcripción con una actividad diferencial del subtipo. Para evitar la definición arbitraria de subtipos en varias cohortes, generamos un conjunto de control negativo óptimo (PWT) como los k-vecinos más cercanos de cada muestra que alberga VUFS en PWT0, según el análisis de enriquecimiento de la actividad de las proteínas (PAEA; algoritmo OncoMatch[22]), con k = 5 para una evaluación adecuada de las estadísticas VIPER, como se describió anteriormente[17] (Métodos y Nota suplementaria).

Generación de la Firma de Consenso

Para cada oncoproteína y cohorte, cada muestra que alberga VUFS (PMut) se comparó con su conjunto de control negativo óptimo (PWT) para generar una firma de factores de transcripción diferencialmente activa, clasificada por la puntuación de enriquecimiento normalizada de VIPER (NES; firma VUFS). Los valores NES positivos y negativos denotan un aumento y una disminución de la actividad del factor de transcripción en la muestra mutada, respectivamente. Los valores NES se integraron luego en todas las muestras que albergan VUFS, independientemente de su locus genómico, utilizando el método de Stouffer para producir una Firma de Consenso. Para integrar las firmas de las mutaciones GOF y LOF en una sola firma, se invirtió el signo de los valores NES de los eventos LOF.

Para caracterizar una VUFS específica, generamos una Firma de Consenso comparando una o más muestras que albergan esa VUFS, definidas por el mismo locus genómico y las mismas sustituciones de aminoácidos, con sus conjuntos PWT correspondientes. Las VUFS se clasificaron posteriormente comparando sus Firmas de Consenso con las de las VUFS correspondientes mediante el análisis de enriquecimiento de conjuntos de proteínas. Cuando se dispuso de varias muestras que albergaban la misma VUFS, el efecto funcional se determinó mediante análisis de mayoría.

Significación funcional

PHNToM clasifica las mutaciones como GOF, LOF, NEO o NEU utilizando PAEA, una extensión sencilla de GSEA[29], donde la expresión génica diferencial se reemplaza por la actividad proteica diferencial. Los resultados se basan en la integración de dos métricas NES producidas por PAEA, que incluyen NES GOF/LOF directa (DGN) y NES GOF/LOF inversa (IGN; Nota suplementaria).

DGN

Para una oncoproteína específica, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 más activados y los 25 más inactivados, en la Firma de Consenso de VUFS en las proteínas diferencialmente activas en una Firma de Consenso de VUFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si los factores de transcripción más desregulados por los eventos GOF o LOF establecidos se ven afectados de manera similar por una VUFS.

IGN

Para una oncoproteína específica, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 superiores e inferiores, en una Firma de Consenso de VUFS entre las proteínas diferencialmente activas en la Firma de Consenso de VUFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si una VUFS puede desregular proteínas que no se ven afectadas por la VUFS.

El uso de los 25 factores de transcripción más y menos diferencialmente activos se justifica mediante un estudio reciente sobre la canalización de los patrones mutacionales en TCGA[2]. Sin embargo, demostramos además que las predicciones no se ven afectadas cuando se utilizan de 10 a 200 factores de transcripción, lo que respalda la solidez del análisis[30].

Se espera que las VUFS que fenocopien las VUFS en el mismo oncogén produzcan valores DGN e IGN similares: positivos o negativos para los eventos GOF y LOF, respectivamente. Si la diferencia es estadísticamente significativa (es decir, P (|DGN–IGN|) < 0,05), entonces los factores de transcripción desregulados por la VUFS deben incluir algunos que no estén desregulados por la VUFS (o viceversa), lo que indica una actividad neomórfica. Por lo tanto, son posibles las siguientes opciones: la VUFS es NEU si DGN, IGN y |DGN–IGN| no son estadísticamente significativos. La VUFS induce GOF si tanto DGN como IGN son positivos y estadísticamente significativos (P < 0,05, corregido por Benjamini-Hochberg). La significación estadística general (PGOF) se evalúa mediante la integración de Stouffer. La VUFS induce LOF si tanto DGN como IGN son negativos y estadísticamente significativos. La significación estadística (PLOF) se evalúa nuevamente mediante la integración de Stouffer. La VUFS es un evento NEO si la diferencia entre DGN e IGN, , es estadísticamente significativa, independientemente de sus estadísticas individuales (Nota suplementaria). Por lo tanto, una VUFS se puede clasificar como NEO/GOF, NEO/LOF o simplemente NEO. La significación estadística NEO (PNEO) utiliza un modelo nulo conservador basado en la densidad de probabilidad de las puntuaciones SNEO en todas las VUFS, asumiendo que los eventos NEO son raros.

Por lo tanto, cada VUFS está asociada con dos valores P independientes, que representan su actividad GOF/LOF y NEO, respectivamente. Consulte la Nota suplementaria para obtener ejemplos ilustrativos y más detalles sobre la evaluación de DGN, IGN y |DGN–IGN|.

DGN

Para una oncoproteína específica, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 más activados y los 25 más inactivados, en la Firma de Consenso de VUFS en las proteínas diferencialmente activas en una Firma de Consenso de VUFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si los factores de transcripción más desregulados por los eventos GOF o LOF establecidos se ven afectados de manera similar por una VUFS.

IGN

Para una oncoproteína específica, esta NES representa el enriquecimiento de las proteínas más diferencialmente activas, es decir, los 25 superiores e inferiores, en una Firma de Consenso de VUFS entre las proteínas diferencialmente activas en la Firma de Consenso de VUFS (Fig. 1c). Esto proporciona una métrica cuantitativa para evaluar si una VUFS puede desregular proteínas que no se ven afectadas por la VUFS.

El uso de los 25 factores de transcripción más y menos diferencialmente activos se justifica mediante un estudio reciente sobre la canalización de los patrones mutacionales en TCGA[2]. Sin embargo, demostramos además que las predicciones no se ven afectadas cuando se utilizan de 10 a 200 factores de transcripción, lo que respalda la solidez del análisis[30].

Los VUFS que fenocopian los VEFS en el mismo oncogén deberían generar valores de DGN e IGN similares, positivos o negativos para eventos de ganancia de función (GOF) y pérdida de función (LOF), respectivamente. Si la diferencia es estadísticamente significativa (es decir, P (|DGN–IGN|) < 0,05), entonces los factores de transcripción (FT) desregulados por los VUFS deben incluir algunos que no estén desregulados por los VEFS (o viceversa), lo que indica actividad neomórfica. Por lo tanto, son posibles las siguientes opciones: el VUFS es NEU si el DGN, el IGN y |DGN–IGN| no son estadísticamente significativos. El VUFS induce GOF si tanto el DGN como el IGN son positivos y estadísticamente significativos (P < 0,05, corregido por Benjamini-Hochberg). La significación estadística general (PGOF) se evalúa mediante la integración de Stouffer. El VUFS induce LOF si tanto el DGN como el IGN son negativos y estadísticamente significativos. La significación estadística (PLOF) se evalúa nuevamente mediante la integración de Stouffer. El VUFS es un evento NEO si la diferencia entre el DGN y el IGN es estadísticamente significativa, independientemente de sus estadísticas individuales (Nota suplementaria). Por lo tanto, un VUFS puede clasificarse como NEO/GOF, NEO/LOF o simplemente NEO. La significación estadística NEO (PNEO) utiliza un modelo nulo conservador basado en la densidad de probabilidad de las puntuaciones SNEO en todos los VEFS, asumiendo que los eventos NEO son raros.

Por lo tanto, cada VUFS está asociado con dos valores P independientes, que representan su actividad GOF/LOF y NEO, respectivamente. Consulte la Nota suplementaria para obtener ejemplos ilustrativos y más detalles sobre la evaluación de DGN, IGN y |DGN–IGN|.

Análisis de prueba de concepto

Inicialmente, nos centramos en PIK3CA y TP53 como estudios de caso relevantes para eventos GOF y LOF. Estos oncogenes se encuentran entre los más frecuentemente mutados en el cáncer, lo que proporciona un gran repertorio de eventos VEFS y VUFS en múltiples cohortes de cáncer (Nota suplementaria). Se generaron firmas de consenso para cada cohorte que comprendía ≥5 VEFS. Cabe destacar que no se han notificado VEFS de PIK3CA LOF o TP53 GOF [18], [19], [31], [32]. Las cuatro clasificaciones diferentes para las mutaciones de PIK3CA en BRCA se ilustran en la Fig. 2a-d (consulte la Nota suplementaria para obtener una discusión más detallada). La Fig. 2e ilustra las muestras de BRCA que albergan mutaciones de PIK3CA, incluidos tanto VEFS como VUFS, con eventos clasificados desde el más GOF hasta el más LOF y filas que representan la actividad de los 50 FT de la Firma de Consenso evaluada por VIPER. Como se describió anteriormente [33], las predicciones de VEFS se obtuvieron utilizando una validación cruzada de cinco pliegues, lo que garantiza que las muestras clasificadas se excluyeron del conjunto de entrenamiento. Para evaluar las mejoras que se obtienen del conjunto de control negativo óptimo (PWT) en comparación con el conjunto no refinado, generamos el mismo mapa de calor de PIK3CA de BRCA utilizando todas las muestras de tipo salvaje de PIK3CA como controles negativos (Fig. 2f), lo que resultó en un rendimiento de clasificación y un sesgo de subtipo tumoral significativamente menores. Para visualizar estos resultados, utilizamos un diagrama de dispersión 2D que representa tanto la actividad GOF/LOF como la actividad NEO de los VEFS y VUFS que se predijo que eran funcionalmente relevantes. Cabe destacar que algunos VUFS de PIK3CA (Fig. 1a-c del Anexo) y TP53 (Fig. 1d-f del Anexo) se predijeron como eventos LOF y GOF, respectivamente, aunque ninguno se había notificado previamente [18], [19], [31], [32] (consulte la Tabla suplementaria 1 para obtener una lista exhaustiva de las predicciones en todas las cohortes de TCGA).

Además, si bien la mayoría de los GOF de PIK3CA se clasificaron entre los que tenían la mayor significación estadística, muchos VUFS presentaron tamaños de efecto comparables o incluso mayores, lo que se confirmó posteriormente mediante ensayos experimentales. Cabe destacar que 17 de 28 eventos (61%) asociados con la mayor actividad GOF predicha por PHNToM fueron VUFS en lugar de VEFS. Incluso en comparación con los tres eventos VEFS con la puntuación más alta (es decir, PIK3CAP366R, PIK3CAP539R y PIK3CAP104L), los VUFS como PIK3CAN345K, PIK3CAE726K y PIK3CAR349* presentaron una actividad PIK3CA y puntuaciones PHNToM aún mayores (Fig. 3a).

Tanto para PIK3CA como para TP53, la Firma de Consenso de VEFS se conservó notablemente en todos los eventos GOF y se invirtió prácticamente por completo en los eventos LOF, lo que respalda su naturaleza como un indicador eficaz de la desregulación de los FT inducida por la mutación (Fig. 4c), así como su relevancia biológica basada en el enriquecimiento de Gene Ontology y Reactome (Fig. 4d y 4e, respectivamente). Consulte la Fig. 3b para obtener un diagrama de dispersión que represente todos los VUFS de PIK3CA estadísticamente significativos en BRCA.

Posteriormente, se amplió el análisis a todas las cohortes de TCGA que comprendían ≥100 muestras (n = 25; Tabla suplementaria 1). Entre estas, se presentan mapas de calor para las tres cohortes (carcinoma endometrial del cuerpo uterino (UCEC), adenocarcinoma de colon (COAD) y carcinoma de células transicionales de la vejiga (BLCA)) con la mayor fracción de muestras mutadas (49%, 29% y 21%, respectivamente; Fig. 1a-c del Anexo). De manera similar a BRCA, se predijo que UCEC, que también es un tumor sensible a las hormonas, incluiría tanto VUFS GOF como LOF, mientras que se predijo que las otras dos cohortes albergarían solo eventos GOF. Para TP53, se muestran mapas de calor para las cuatro cohortes (BRCA, COAD, BLCA y ESCA) con la mayor fracción de muestras TP53Mut (52%, 51%, 42% y 34%, respectivamente; Fig. 1d-g del Anexo y consulte la Nota suplementaria para obtener resultados más detallados).

La conservación de los FT efectores candidatos entre diferentes VEFS y VUFS dentro del mismo gen plantea la pregunta de si se observan patrones similares entre diferentes tipos de tumores. Para PIK3CA, por ejemplo, el análisis de similitud de la Firma de Consenso mediante la correlación de Spearman identificó dos grupos con una actividad de FT efectores altamente conservada dentro del grupo y ortogonal entre los grupos (Fig. 3c). El primer grupo consistió casi exclusivamente en tumores epiteliales, mientras que el segundo incluyó adenocarcinoma de próstata, cistoadenocarcinoma seroso ovárico, glioma de bajo grado, melanoma cutáneo y carcinoma hepatocelular. El carcinoma esofágico (ESCA) fue un valor atípico, con una firma de FT efectores única. Se observó una estratificación similar para TP53, aunque con carcinoma de células papilares renales, sarcoma, glioblastoma multiforme y adenocarcinoma de recto, formando un tercer grupo (Fig. 1h del Anexo). En conjunto, estos datos sugieren que PIK3CA y TP53 pueden regular diferentes FT/co-FT efectores en tumores con diferentes linajes.

Análisis del dominio estructural

Realizamos dos análisis para evaluar si la ubicación espacial, determinada por los dominios estructurales de las proteínas, estaba asociada con los efectos funcionales predichos de las mutaciones. Primero, seleccionamos mutaciones GOF de PIK3CA específicas del dominio/interdominio y comparamos su Firma de Consenso promedio con la de todas las mutaciones GOF. En segundo lugar, posicionamos los eventos GOF establecidos y predichos en la estructura 3D de la proteína, según lo informado en la Protein Data Bank (PDB) [34], porque la agrupación espacial de las mutaciones funcionalmente relevantes no se puede caracterizar eficazmente en la secuencia del gen [3] (Fig. 4a). Si bien las mutaciones ocurren en los cuatro dominios de PIK3CA (p85B, Ka, C2 y P14) y con menos frecuencia en las regiones interdominio [35] (Fig. 4b y Tabla suplementaria 1), la mayoría de los VEFS ocurren en P14 (64 muestras) y C2 (42 muestras). En consonancia con esto, los VEFS en estos dominios tuvieron la mejor y la segunda mejor coincidencia con la Firma de Consenso global (Fig. 4c), con el dominio P14 presentando la coincidencia estadísticamente más significativa. De manera similar, las Firmas de Consenso para los VUFS en estos dominios también fueron las más enriquecidas [36] (Fig. 1b). Por el contrario, la mayoría de los VEFS neomórficos [9] (por ejemplo, en PIK3CAE545, PIK3CAE542, PIK3CAH1047 y PIK3CAQ546K) y los VUFS ocurrieron fuera de los dominios P14 y C2.

Análisis del dominio estructural

Realizamos dos análisis para evaluar si la ubicación espacial, determinada por los dominios estructurales de las proteínas, estaba asociada con los efectos funcionales predichos de las mutaciones. Primero, seleccionamos mutaciones GOF de PIK3CA específicas del dominio/interdominio y comparamos su Firma de Consenso promedio con la de todas las mutaciones GOF. En segundo lugar, posicionamos los eventos GOF establecidos y predichos en la estructura 3D de la proteína, según lo informado en la Protein Data Bank (PDB) [34], porque la agrupación espacial de las mutaciones funcionalmente relevantes no se puede caracterizar eficazmente en la secuencia del gen [3] (Fig. 4a). Si bien las mutaciones ocurren en los cuatro dominios de PIK3CA (p85B, Ka, C2 y P14) y con menos frecuencia en las regiones interdominio [35] (Fig. 4b y Tabla suplementaria 1), la mayoría de los VEFS ocurren en P14 (64 muestras) y C2 (42 muestras). En consonancia con esto, los VEFS en estos dominios tuvieron la mejor y la segunda mejor coincidencia con la Firma de Consenso global (Fig. 4c), con el dominio P14 presentando la coincidencia estadísticamente más significativa. De manera similar, las Firmas de Consenso para los VUFS en estos dominios también fueron las más enriquecidas [36] (Fig. 1b). Por el contrario, la mayoría de los VEFS neomórficos [9] (por ejemplo, en PIK3CAE545, PIK3CAE542, PIK3CAH1047 y PIK3CAQ546K) y los VUFS ocurrieron fuera de los dominios P14 y C2.

Análisis pancanceroso

Luego, ampliamos el análisis a 3736 oncogenes putativos (Tabla suplementaria 1), con ≥5 muestras que albergan VEFS en FASMIC, en una o más de las 25 cohortes (Tabla suplementaria 1). Los resultados se proporcionan en la Tabla suplementaria 1 (https://phntom-mut.com/). La clasificación de VUFS para las cuatro cohortes con la mayor fracción de muestras PIK3CAMut, que incluyen UCEC, COAD, BLCA y ESCA, se muestra en la Fig. 2a-e del Anexo.

Validación retrospectiva de las predicciones de PHNToM

Realizamos una validación retrospectiva de los eventos predichos por PHNToM basados en mutaciones validadas experimentalmente en FASMIC (n = 2411 eventos en todas las cohortes de cáncer; consulte Métodos para la asignación funcional de eventos idénticos con diferentes clasificaciones en múltiples muestras). El análisis de las predicciones de eventos GOF, LOF, NEO y NEU produjo 945 (P = 6,6 × 10−214), 613 (P = 5,4 × 10−270), 22 (P = 1,8 × 10−37) y 622 (P = 0, es decir, por debajo de la precisión de la máquina) verdaderos positivos y 121, 51, 9 y 28 falsos positivos, respectivamente. Los valores P se evaluaron mediante un modelo binomial, utilizando la frecuencia esperada de estos eventos en FASMIC (Tabla suplementaria 2). Al comparar los eventos funcionales (GOF, LOF, NEO, como positivos) con los eventos NEU (como negativos), el análisis produjo 1580 verdaderos positivos, 181 falsos positivos, 622 verdaderos negativos y 28 falsos negativos (P = 0, basado en la prueba de χ2).

Solo se informa un puñado de mutaciones neomórficas en FASMIC. Sin embargo, una revisión de la literatura reveló que varias de las principales predicciones NEO (no en FASMIC) se habían notificado previamente [9], incluidas varias variantes en el aminoácido PIK3CAE545, PIK3CAE542, PIK3CAH1047, PIK3CAQ546K y PIK3CAG1049R. En particular, el análisis por espectrometría de masas demostró que PIK3CAE545K induce una interacción inesperada con IRS1, independientemente de p85 (ref. [37]). Consulte la Tabla suplementaria 2 para obtener una lista completa de las predicciones NEO en todas las cohortes de TCGA.

Apoyando la naturaleza específica del contexto de nuestras predicciones, observamos que, si bien mutaciones específicas pueden inducir actividad proteica aberrante dentro de una cohorte determinada, este efecto puede no generalizarse a otras cohortes. Por ejemplo, PHNToM predijo PIK3CAV71I como un evento GOF en carcinoma de células escamosas de cabeza y cuello (DGN = 6,34, P = 2,78 × 10−10; IGN = 6,29, P = 3,36 × 10−10 y |DGN–IGN| = 0,05, P = 2,9 × 10−1; Nota suplementaria y Tabla suplementaria 1), pero no en BRCA. En consonancia con esto, FASMIC [3] informa que esta mutación es GOF en las células de carcinoma de células escamosas de cabeza y cuello, pero no en las células MCF10A [38].

Validación experimental

Para validar de forma prospectiva las predicciones de PHNToM, seleccionamos las 38 mutaciones de PIK3CA específicas del cáncer de mama con la mayor puntuación, incluidas 8 GOF, 5 LOF, 3 NEU y 18 NEO VUFS, así como 3 GOF y 1 NEO VEFS como controles positivos. Con fines de validación, las mutaciones se clasificaron en función de su significación estadística, excluyendo aquellas que no se podían transducir eficazmente (Tablas suplementarias 1 y 3). Se generaron firmas de expresión génica diferencial mediante la expresión ectópica mediada por lentivirus de cDNA mutante de PIK3CA en células MCF10A, en comparación con cDNA simulado como control negativo. Los perfiles de RNA-seq se generaron en placas de 96 pocillos mediante la amplificación agrupada de la biblioteca para la expresión del transcriptoma (PLATE-Seq)[39] (Nota suplementaria). A continuación, se evaluó la actividad funcional en función de la recapitulación significativa de la firma de consenso específica de BRCA (P < 0,05, corregido por Benjamini-Hochberg). El análisis confirmó las predicciones para 8 de 8 GOF (100 %), 5 de 5 LOF (100 %), 14 de 18 NEO (~78 %) y 3 de 3 variantes NEU (100 %; P < 4,75 × 10−36, utilizando un modelo binomial basado en la frecuencia de eventos GOF, LOF, NEO y NEU en FASMIC (Métodos y Tabla suplementaria 3). También se confirmaron experimentalmente los controles positivos (Fig. 3d). Aunque 4 de las 18 predicciones NEO no se validaron como eventos neomórficos, 2 se infirieron correctamente como eventos GOF, ya que su DGN fue significativamente positivo, lo que es consistente con su estado funcional en FASMIC. Estos incluyen PIK3CAH1047L (PDGN = 2,7 × 10−12, PIGN = 3,7 × 10−12) y PIK3CAH1047R (PDGN = 1,2 × 10−12, PIGN = 2,7 × 10−12; Tabla suplementaria 3). Se proporcionan los valores de P para todas las VUFS probadas (Tabla suplementaria 3), así como los gráficos PAEA para eventos representativos (Fig. 5a–c), incluidos eventos LOF de PIK3CA no informados previamente.

A continuación, clonamos nueve mutaciones no sinónimas en el dominio de la quinasa de FGFR2 y FGFR3 que se predijeron como eventos GOF, así como ambos controles de tipo salvaje (Tabla suplementaria 4) y probamos su capacidad para promover la proliferación independiente de los factores de crecimiento en células MCF10A en tres réplicas biológicas y cuatro réplicas técnicas por réplica biológica, utilizando un ensayo CellTiterGlo (Fig. 5d y Tabla suplementaria 4). Se validaron cinco de las seis VUFS de FGFR2 (FGFR2N549K, FGFR2N549D, FGFR2N549H, FGFR2S587C y FGFR2K659E), mientras que FGFR2V634A no aumentó la proliferación (Fig. 2f de los datos ampliados, Tabla suplementaria 4 y Nota suplementaria). Sin embargo, ninguna de las tres VUFS GOF de FGFR3 (FGFR3V505I, FGFR3D646N y FGFR3R669Q)[40] se validó (Tabla suplementaria 4), posiblemente porque este ensayo conservador puede no revelar eventos GOF más débiles o específicos del contexto, como los de proteínas oncogénicas más débiles como FGFR3.

Evaluación del mimetismo mutacional y la epistasis

Las mutaciones en un gen determinado (GA) pueden fenocopiar mutaciones en un gen diferente (GB) o exhibir efectos epistáticos sobre su capacidad transformadora. PHNToM puede detectar potencialmente estos efectos analizando la firma de consenso de GB en las muestras. El primer efecto es consistente con el concepto de pseudomutantes[41] o mimetismo mutacional[41]. Estos eventos pueden revelar genes que actúan en la misma vía, así como mecanismos de canalización y entrecruzamiento más complejos. Una forma posible de discriminar las interacciones epistáticas es evaluar la significación estadística de la probabilidad condicional.

Por ejemplo, las muestras que presentan una firma de consenso LOF de PIK3CA están significativamente enriquecidas en mutaciones LOF de TP53, así como en mutaciones GOF de CDH1 y MAP3K1 (Fig. 6a, b). Si bien las mutaciones LOF de TP53 pueden imitar las mutaciones LOF de PIK3CA, esto es poco probable porque TP53 reprime la expresión de PIK3CA, lo que induciría el efecto opuesto. Una explicación alternativa es que la presencia de mutaciones de TP53 elimina la necesidad (es decir, amortigua) de una mayor actividad de la vía PI3K para la transformación. Esto sugiere una interacción epistática, lo que está respaldado por tres hallazgos. Primero, la señalización PI3KAKTmTOR está ligeramente inactiva en las muestras que albergan mutaciones LOF de TP53 (P = 0,06; Fig. 3a de los datos ampliados). En segundo lugar, las muestras TP53Mut en DepMap tienen un IC50 significativamente mayor para los inhibidores de PIK3CA en comparación con las líneas celulares TP53WT (P ≤ 0,01, mediante la prueba de Mann-Whitney-Wilcoxon; Fig. 3b de los datos ampliados). En tercer lugar, las muestras TP53Mut están negativamente enriquecidas en PIK3CAMut (P = 10−5, mediante la prueba de χ2). Como tal, este resultado probablemente identificó una interacción TP53PIK3CA epistática/amortiguadora. Cabe destacar que la interacción TP53LOF→PIK3CALOF también es significativa en ocho cohortes adicionales (COAD, glioblastoma multiforme, carcinoma de células papilares renales, glioma de bajo grado, carcinoma de células escamosas de pulmón, adenocarcinoma de pulmón, adenocarcinoma seroso de ovario y adenocarcinoma de próstata; Fig. 4 de los datos ampliados).

Realizamos un análisis sistemático de mimetismo/epistasis en las 25 cohortes (Fig. 4 de los datos ampliados y Tabla suplementaria 5), incluido BRCA (Fig. 6c), mostrando solo las interacciones respaldadas por ≥4 muestras que albergan VEFS. Los resultados también se muestran como mapas de interacción funcional (consulte la Fig. 5a–c de los datos ampliados para un ejemplo de mimetismo específico de UCEC, que identifica EGFRA743T, KRASQ61H y KDRS1347L como mímicos altamente significativos de ARID1AMut). Varias interacciones predichas relacionadas con BRCA están respaldadas por la literatura previa, como los eventos GOF de ERBB2, que se ha demostrado que imitan los eventos GOF en PIK3CG, un gen en su vía descendente directa[42]. En esencia, los eventos GOF en PIK3CG no se predijeron como mímicos GOF de ERBB2, lo que es consistente con el hecho de que PIK3CG está aguas abajo de ERBB2. De manera similar, se identificaron las mutaciones de ALK como mímicos de PDGFRB, ya que regulan vías descendentes relacionadas. Esto está respaldado por la evidencia de que MET induce resistencia al inhibidor de ALK en los tumores ALKMut[43].

Validación retrospectiva de las predicciones de PHNToM

Realizamos una validación retrospectiva de los eventos predichos por PHNToM en función de las mutaciones validadas experimentalmente en FASMIC (n = 2411 eventos en todas las cohortes de cáncer; consulte Métodos para la asignación funcional de eventos idénticos con diferentes clasificaciones en múltiples muestras). El análisis de las predicciones de eventos GOF, LOF, NEO y NEU produjo 945 (P = 6,6 × 10−214), 613 (P = 5,4 × 10−270), 22 (P = 1,8 × 10−37) y 622 (P = 0, es decir, por debajo de la precisión de la máquina) predicciones verdaderas positivas y 121, 51, 9 y 28 predicciones falsas positivas, respectivamente. Los valores de P se evaluaron mediante un modelo binomial, utilizando la frecuencia esperada de estos eventos en FASMIC (Tabla suplementaria 2). Al comparar los eventos funcionales (GOF, LOF, NEO, como positivos) con los eventos NEU (como negativos), el análisis produjo 1580 verdaderas positivas, 181 falsas positivas, 622 verdaderas negativas y 28 falsas negativas (P = 0, basado en la prueba de χ2).

Solo se informa un puñado de mutaciones neomórficas en FASMIC. Sin embargo, una revisión de la literatura reveló que varias de las principales predicciones NEO (no en FASMIC) se han informado previamente[9], incluidas varias variantes en los aminoácidos PIK3CAE545, PIK3CAE542, PIK3CAH1047, PIK3CAQ546K y PIK3CAG1049R. En particular, el análisis de espectrometría de masas demostró que PIK3CAE545K induce una interacción inesperada con IRS1, independiente de p85 (ref. [37]). Consulte la Tabla suplementaria 2 para obtener una lista completa de las predicciones NEO en todas las cohortes de TCGA.

Apoyando la naturaleza específica del contexto de nuestras predicciones, observamos que, si bien las mutaciones específicas pueden inducir una actividad proteica aberrante dentro de una cohorte determinada, este efecto puede no generalizarse a otras cohortes. Por ejemplo, PHNToM predijo PIK3CAV71I como un evento GOF en el carcinoma de células escamosas de cabeza y cuello (DGN = 6,34, P = 2,78 × 10−10; IGN = 6,29, P = 3,36 × 10−10 y |DGN–IGN| = 0,05, P = 2,9 × 10−1; Nota suplementaria y Tabla suplementaria 1), pero no en BRCA. En consonancia con esto, FASMIC[3] informa que esta mutación es un GOF en las células de carcinoma de células escamosas de cabeza y cuello, pero no en las células MCF10A[38].

Validación experimental

Para validar de forma prospectiva las predicciones de PHNToM, seleccionamos las 38 mutaciones de PIK3CA específicas del cáncer de mama con la mayor puntuación, incluidas 8 GOF, 5 LOF, 3 NEU y 18 NEO VUFS, así como 3 GOF y 1 NEO VEFS como controles positivos. Con fines de validación, las mutaciones se clasificaron en función de su significación estadística, excluyendo aquellas que no se podían transducir eficazmente (Tablas suplementarias 1 y 3). Se generaron firmas de expresión génica diferencial mediante la expresión ectópica mediada por lentivirus de cDNA mutante de PIK3CA en células MCF10A, en comparación con cDNA simulado como control negativo. Los perfiles de RNA-seq se generaron en placas de 96 pocillos mediante la amplificación agrupada de la biblioteca para la expresión del transcriptoma (PLATE-Seq)[39] (Nota suplementaria). A continuación, se evaluó la actividad funcional en función de la recapitulación significativa de la firma de consenso específica de BRCA (P < 0,05, corregido por Benjamini-Hochberg). El análisis confirmó las predicciones para 8 de 8 GOF (100 %), 5 de 5 LOF (100 %), 14 de 18 NEO (~78 %) y 3 de 3 variantes NEU (100 %; P < 4,75 × 10−36, utilizando un modelo binomial basado en la frecuencia de eventos GOF, LOF, NEO y NEU en FASMIC (Métodos y Tabla suplementaria 3). También se confirmaron experimentalmente los controles positivos (Fig. 3d). Aunque 4 de las 18 predicciones NEO no se validaron como eventos neomórficos, 2 se infirieron correctamente como eventos GOF, ya que su DGN fue significativamente positivo, lo que es consistente con su estado funcional en FASMIC. Estos incluyen PIK3CAH1047L (PDGN = 2,7 × 10−12, PIGN = 3,7 × 10−12) y PIK3CAH1047R (PDGN = 1,2 × 10−12, PIGN = 2,7 × 10−12; Tabla suplementaria 3). Se proporcionan los valores de P para todas las VUFS probadas (Tabla suplementaria 3), así como los gráficos PAEA para eventos representativos (Fig. 5a–c), incluidos eventos LOF de PIK3CA no informados previamente.

A continuación, clonamos nueve mutaciones no sinónimas en el dominio de la quinasa de FGFR2 y FGFR3 que se predijeron como eventos GOF, así como ambos controles de tipo salvaje (Tabla suplementaria 4) y probamos su capacidad para promover la proliferación independiente de los factores de crecimiento en células MCF10A en tres réplicas biológicas y cuatro réplicas técnicas por réplica biológica, utilizando un ensayo CellTiterGlo (Fig. 5d y Tabla suplementaria 4). Se validaron cinco de las seis VUFS de FGFR2 (FGFR2N549K, FGFR2N549D, FGFR2N549H, FGFR2S587C y FGFR2K659E), mientras que FGFR2V634A no aumentó la proliferación (Fig. 2f de los datos ampliados, Tabla suplementaria 4 y Nota suplementaria). Sin embargo, ninguna de las tres VUFS GOF de FGFR3 (FGFR3V505I, FGFR3D646N y FGFR3R669Q)[40] se validó (Tabla suplementaria 4), posiblemente porque este ensayo conservador puede no revelar eventos GOF más débiles o específicos del contexto, como los de proteínas oncogénicas más débiles como FGFR3.

Mimetismo mutacional y evaluación de la epistasis

Las mutaciones en un gen determinado (GA) pueden fenocopiar mutaciones en un gen diferente (GB) o exhibir efectos epistáticos sobre su capacidad transformadora. PHNToM puede detectar potencialmente estos efectos analizando la firma de consenso de GB en las muestras. El primer efecto es consistente con el concepto de pseudomutantes[41] o mimetismo mutacional[41]. Estos eventos pueden revelar genes que actúan en la misma vía, así como mecanismos de canalización y entrecruzamiento más complejos. Una forma posible de discriminar las interacciones epistáticas es evaluar la significación estadística de la probabilidad condicional.

Por ejemplo, las muestras que presentan una firma de consenso de pérdida de función (LOF) de PIK3CA están significativamente enriquecidas en mutaciones de pérdida de función (LOF) de TP53, así como en mutaciones de ganancia de función (GOF) de CDH1 y MAP3K1 (Fig. 6a, b). Si bien las mutaciones de pérdida de función (LOF) de TP53 podrían imitar las mutaciones de pérdida de función (LOF) de PIK3CA, esto es poco probable porque TP53 reprime la expresión de PIK3CA, lo que induciría el efecto opuesto. Una explicación alternativa es que la presencia de mutaciones de TP53 elimina la necesidad (es decir, actúa como un amortiguador) de una mayor actividad de la vía PI3K para la transformación. Esto sugiere una interacción epistasis, lo que está respaldado por tres hallazgos. Primero, la señalización PI3KAKTmTOR está marginalmente inactiva en las muestras que albergan mutaciones de pérdida de función (LOF) de TP53 (P = 0,06; Fig. 3a del Anexo de datos). Segundo, las muestras TP53Mut en DepMap tienen un IC50 significativamente más alto para los inhibidores de PIK3CA en comparación con las líneas celulares TP53WT (P ≤ 0,01, mediante la prueba de Mann-Whitney-Wilcoxon; Fig. 3b del Anexo de datos). Tercero, las muestras TP53Mut están negativamente enriquecidas en PIK3CAMut (P = 10−5, mediante la prueba χ2). Como tal, este resultado probablemente identificó una interacción epistasis/amortiguadora TP53PIK3CA. Cabe destacar que la interacción TP53LOF→PIK3CALOF también es significativa en ocho cohortes adicionales (COAD, glioblastoma multiforme, carcinoma de células papilares renales, glioma de bajo grado, carcinoma de células escamosas de pulmón, adenocarcinoma de pulmón, cistoadenocarcinoma seroso ovárico y adenocarcinoma de próstata; Fig. 4 del Anexo de datos).

Realizamos un análisis sistemático de mimetismo/epistasis en las 25 cohortes (Fig. 4 del Anexo de datos y Tabla 5 del Material Suplementario), incluido BRCA (Fig. 6c), mostrando solo las interacciones respaldadas por ≥4 muestras que albergan VEFS. Los resultados también se muestran como mapas de calor de interacción funcional (consulte la Fig. 5a del Anexo de datos para un ejemplo de mimetismo específico de UCEC, que identifica EGFRA743T, KRASQ61H y KDRS1347L como mímicos altamente significativos de ARID1AMut). Varias interacciones predichas relacionadas con BRCA están respaldadas por la literatura previa, como los eventos de ganancia de función (GOF) de ERBB2, que se ha demostrado que imitan los eventos de ganancia de función (GOF) en PIK3CG, un gen en su vía descendente directa[42]. Fundamentalmente, los eventos de ganancia de función (GOF) en PIK3CG no se predijeron como mímicos de ganancia de función (GOF) de ERBB2, lo que es consistente con el hecho de que PIK3CG está aguas abajo de ERBB2. De manera similar, se identificaron las mutaciones de ALK como mímicos de PDGFRB, ya que regulan vías descendentes relacionadas. Esto está respaldado por la evidencia de que MET induce resistencia al inhibidor de ALK en tumores ALKMut[43].

Discusión

Introducimos las firmas de actividad de los factores de transcripción (TF) como predictores efectivos y específicos del contexto tumoral de la función de mutación de los oncogenes, extendiendo así los métodos computacionales previos y complementando los ensayos experimentales costosos y que requieren mucha mano de obra. La metodología introduce los siguientes cinco elementos de innovación: (1) aprovecha la actividad de los TF evaluada por VIPER como un ensayo de reportero, beneficiándose así de la reproducibilidad del algoritmo[2]; (2) su validación se basa en ensayos prospectivos en lugar de retrospectivos[12], [33], [44]; (3) predice eficazmente las funciones neomórficas y de mimetismo/epistasis, que no se abordan con los métodos computacionales previos; (4) identifica mutaciones específicas del contexto con diferentes funciones en diferentes tumores; y (5) identifica los TF cuya actividad está desregulada por las mutaciones como efectores de los oncogenes.

Si bien se ha caracterizado que muchas mutaciones recurrentes son de ganancia de función (GOF) o pérdida de función (LOF), el estudio complementa los informes anteriores[3] al mostrar una naturaleza mucho más generalizada de las mutaciones oncogénicas neomórficas, incluidas múltiples neomorfos validados en PIK3CA. Además, varias mutaciones neomórficas identificadas por el análisis también tenían una actividad débil, aunque estadísticamente significativa, de ganancia de función (GOF) o pérdida de función (LOF). Esto subraya la importancia de clasificar correctamente las mutaciones en términos de su relevancia para la respuesta a los fármacos dirigidos. Para los inhibidores de PI3K y la vía PI3K en tumores con mutación de PIK3CA, por ejemplo, esto se sugirió previamente basándose en un estudio de un péptido mutante estabilizado con hidrocarburos que interrumpió la interacción neomórfica entre IRS1 y la forma mutante PIK3CAE545K[37]. Cabe destacar que este péptido inhibió la fosforilación de AKT y el crecimiento tumoral en xenoinjertos con el neomorfo PIK3CAE545K, pero no en aquellos con otras mutaciones de PIK3CA. Estos hallazgos sugieren posibles enfoques terapéuticos que aprovechen los agentes dirigidos capaces de interferir con la actividad neomórfica de una proteína, sin afectar su función de tipo salvaje, lo que probablemente dé como resultado un índice terapéutico más amplio. Además, la caracterización sistemática de las proteínas efectoras dependientes de la mutación, incluidas las neomorfos, puede ayudar a identificar nuevos objetivos farmacológicos. Finalmente, demostramos una caracterización precisa de las mutaciones pasajeras (es decir, NEU) que no alteran la actividad de la proteína. Esto también puede ayudar a limitar el uso de fármacos dirigidos en pacientes que no se beneficiarían de ellos, evitando retrasos en la administración de un tratamiento más eficaz o una toxicidad innecesaria.

Muchos tumores surgen de un "efecto de campo"[2], donde múltiples eventos débiles pueden sumarse a la transformación. Si bien se ha identificado que la mayoría de los eventos VEFS se deben a sus fuertes contribuciones fenotípicas, las mutaciones más débiles que inducen la desregulación molecular a nivel de los efectores descendentes, y por lo tanto detectables por PHNToM, pueden inducir fuertes efectos transformadores cuando coexisten. Por lo tanto, el método puede proporcionar información adicional sobre los tumores que carecen de eventos primarios impulsores establecidos.

Nuestro estudio también ilustra cómo las mutaciones a menudo tienen efectos específicos del contexto, incluso dentro de distintos subtipos del mismo tipo de tumor. De hecho, PHNToM produjo diferentes clasificaciones para la misma mutación en múltiples cohortes, probablemente debido a la expresión dependiente del contexto de los socios de unión cognados y otros efectores descendentes críticos. Por ejemplo, se predijo que PIK3CAR108H y PIK3CAE110del eran neomórficos en UCEC pero hipermórficos en BRCA por PHNToM.

Finalmente, si bien se habían informado previamente algunas interacciones anecdóticas de mimetismo y epistasis, las firmas de actividad de los TF podrían aprovecharse eficazmente para generar un mapa completo de tales eventos en todo el cáncer. Esto puede proporcionar una base para las mutaciones de ganancia de función/pérdida de función que se amortiguan mediante eventos coexistentes, lo que lleva al fracaso de la terapia dirigida, como los tumores PIK3CAMut/TP53Mut que no responden a los inhibidores de PI3K, así como para la capacidad de diferentes mutaciones para proporcionar efectos tumorigénicos similares, lo que podría respaldar el uso de inhibidores que se dirigen a la proteína de tipo salvaje.

Una limitación del enfoque es que la detección de eventos neomórficos depende actualmente de su capacidad para presentar al menos alguna actividad de ganancia de función (GOF) o pérdida de función (LOF). Sin embargo, la metodología podría generalizarse para detectar eventos que desregulan los TF clave, no relacionados con la ganancia o pérdida de función fisiológica de la proteína. Otra advertencia es que las predicciones pueden verse afectadas por otras mutaciones que coexisten con los VEFS utilizados para la generación de la firma de consenso o con un VUFS en una muestra que se va a analizar. Lo primero se mitiga mediante el uso de ≥5 muestras para generar una firma de consenso, a menos que la mayoría de ellas alberguen el mismo evento de co-mutación. Además, esto puede abordarse eliminando los VEFS que albergan co-mutaciones funcionalmente relacionadas o aumentando el tamaño de la muestra. Lo último puede abordarse teniendo en cuenta el posible mimetismo por comutaciones. Finalmente, como ocurre con la mayoría de los métodos computacionales, la precisión de la validación puede ser específica del gen y los falsos positivos aumentarán para las predicciones de menor significación. Estas limitaciones se investigarán en estudios futuros.

PHNToM es altamente generalizable e implementado de forma modular, de modo que los algoritmos individuales, por ejemplo, ARACNe o VIPER, pueden ser reemplazados por otros similares[44]. Sin embargo, tal como se implementa, ya proporciona un enfoque valioso y altamente complementario para la caracterización funcional precisa de la mutación de los oncogenes, con un potencial de traslación obvio. De hecho, los VUFS en los pacientes con cáncer recién diagnosticados pueden caracterizarse funcionalmente mediante el análisis del perfil de ARN-seq, posiblemente incluso a nivel de una sola célula. Finalmente, si bien este estudio se centra en los VEFS oncogénicos, se puede generalizar fácilmente a otros VEFS no relacionados con el cáncer, incluidos los no patógenos.

Métodos

Selección y normalización de muestras TCGA

Los perfiles de ARN-seq que comprenden lecturas emparejadas de extremo a extremo sin procesar de 25 cohortes TCGA se descargaron del Portal de datos genómicos (GDC) (https://portal.gdc.cancer.gov/; v15.0, versión del 20 de febrero de 2019)[38]. Los perfiles equivalentes para las muestras GTEx se descargaron de la base de datos de genotipos y fenotipos (dbGaP, https://dbgap.ncbi.nlm.nih.gov/aa/wga.cgi?page=login)[45] y el Portal GTEx (https://gtexportal.org/home/, Análisis GTEx V7, número de acceso dbGaP, phs000424.v7.p2)[36]. El alineador STAR (v2.6.1e, lanzado el 25 de julio de 2019)[46] se utilizó para mapear las lecturas individuales al genoma de referencia humano UCSC[47] hg38 (versión 13, GRCh38.p13, 28 de febrero de 2019) y al transcriptoma de referencia GENCODE (v29, GRCh38.p12, 21 de diciembre de 2017), seguido de un análisis de featureCounts (versión 2.0.0, 4 de septiembre de 2019)[48] para generar recuentos de lecturas.

Para corregir los efectos de lote, se crearon matrices de genes-muestras independientes para cada cohorte de tumores TCGA y cada par de tejidos normales GTEx coincidentes. ComBat (v3.27.0)[21] se utilizó para corregir los sesgos técnicos entre TCGA y GTEx. Los recuentos de genes de ARN-seq sin procesar se transformaron en lecturas por kb de transcrito por millón de lecturas mapeadas (RPKM) utilizando la longitud promedio del transcrito para cada gen, seguido de una transformación logarítmica de base 2. El ensamblaje de este estándar de mutación de oro se realizó mediante la minería de datos basada en la literatura de las bases de datos OncoKB[31] y COSMIC[32], que también incorporan información de FASMIC[3] y ProtFus[49].### Generación de la red ARACNe

Las firmas de expresión génica se normalizaron aplicando dos transformaciones no paramétricas para el análisis de ARACNe. ARACNe requiere una expresión génica junto con una lista predefinida de TF/co-TF como entrada e implica tres pasos principales, a saber, (1) estimación del umbral de información mutua (MI), que identifica un umbral de significación de los valores de MI de las expresiones génicas proporcionadas; (2) reconstrucción de la red de bootstrapping, en la que se reconstruyen las redes de MI para expresiones génicas muestreadas aleatoriamente, calculando la MI para cada par TF/objetivo después de transformar el rango de las expresiones génicas, eliminando las conexiones no estadísticamente significativas utilizando el umbral de MI y eliminando las interacciones indirectas aplicando un filtro de tolerancia de desigualdad de procesamiento de datos; y (3) construcción de una red de consenso, estimando la significación estadística del número de veces que se detecta un borde específico en todas las ejecuciones de bootstrapping, basándose en una distribución de Poisson. Esto se hace porque la estimación de MI no se ve afectada por una transformación monótona de los datos de entrada. Específicamente, se realizó una transformación de rango entre 0 y 1, primero en una base de columna (muestras de tumor) y luego nuevamente en una base de fila (genes). Los datos resultantes se analizaron utilizando ARACNe-adaptive partitioning (AP)[25], [50] para generar regulones específicos del tejido para cada proteína TF y co-TF.### Análisis VIPER

El algoritmo VIPER se ha utilizado y validado ampliamente como una metodología precisa para medir la actividad de una proteína en función del enriquecimiento de sus objetivos transcripcionales activados y reprimidos específicos del tejido (regulón) en los genes sobreexpresados y subexpresados[17], es decir, como un ensayo de reportero génico altamente multiplexado. VIPER se utilizó para transformar las expresiones génicas en perfiles de actividad de proteínas para todas las proteínas TF y co-TF, en una base de muestra por muestra. Específicamente, para cada muestra (tumor o normal), se obtuvo una firma de expresión diferencial mediante una prueba t de Student que comparaba la expresión génica en esa muestra con la expresión promedio de todas las muestras en la cohorte GTEx correspondiente del tejido. Luego, estas firmas se analizaron utilizando el algoritmo VIPER (v1.24.0)[17] con los regulones ARACNE-AP específicos del tejido.### Análisis OncoMatch

Para identificar los vecinos de tipo salvaje más cercanos de una muestra que alberga una VUFS (PMut), aplicamos el algoritmo OncoMatch[22]. Específicamente, calculamos el enriquecimiento de las 50 proteínas más diferencialmente activas (las 25 superiores y las 25 inferiores, según lo evaluado por VIPER) en PMut en comparación con el conjunto de proteínas diferencialmente activas en cada muestra de tipo salvaje, utilizando el análisis PSEA. El valor P correspondiente se corrigió posteriormente mediante la corrección de Bonferroni para la prueba de múltiples hipótesis. Se seleccionó un número fijo de proteínas diferencialmente activas para evitar sesgos debido al tamaño del conjunto al evaluar el NES, como se discutió anteriormente[2], donde se demostró que un promedio de 50 reguladores maestros (MR) es suficiente para explicar el efecto de las alteraciones genéticas funcionalmente relevantes en más de 20 cohortes de TCGA.

Selección de mutaciones

Los archivos de anotación de mutaciones para TCGA se descargaron del repositorio Firehose (gdac.broadinstitute.org/, versión del 28 de enero de 2016; http://firebrowse.org/). Se descargaron datos de mutación adicionales de cBioPortal (versiones del 15 de marzo de 2019 y del 28 de enero de 2021)[18],[19] y GDC (v15.0, versión del 20 de febrero de 2019)[51]. Las alteraciones del número de copias somáticas se evaluaron en función de los análisis GISTIC2.0 (v7) publicados[52].

Generación del modelo nulo PWT0

Para identificar un conjunto de muestras (PWT0) que representen la actividad imparcial de la proteína de tipo salvaje (PWT), generamos una densidad de probabilidad a partir de las muestras de GTEx que representan la actividad evaluada por VIPER de P en el homólogo de tejido normal más estrechamente relacionado y luego seleccionamos las muestras tumorales con la actividad proteica evaluada por VIPER que no es estadísticamente significativamente diferente de la de la cohorte normal (P > 0,5).

Modelo de mezcla gaussiana multimodal

Para cada proteína en consideración, la canalización realiza un análisis multimodal de las muestras de tipo salvaje, mutadas y GTEx (ya sea de tejidos coincidentes si están disponibles o promediadas en todo el repositorio de GTEx). Luego, se seleccionan los controles normales como muestras de tipo salvaje que son indistinguibles de las muestras de GTEx (es decir, P > 0,05, según la prueba t de Student).

Análisis de mezcla gaussiana multimodal

Estos análisis se basan en modelos probabilísticos que representan muestras distribuidas normalmente dentro de un espacio de muestra más grande, parametrizados por dos tipos de valores: los pesos de los componentes de la mezcla y las medias de los componentes, así como las varianzas/covarianzas[53]. Para un modelo de mezcla gaussiana con C componentes, el componente c-ésimo tiene una media μc y una varianza σc en el caso univariado y una media k y una matriz de covarianza de Σk en el caso multivariado. Los pesos de los componentes de la mezcla se definen como ϕk para el componente Ck, con la restricción de que de modo que la distribución de probabilidad total se normalice a 1. Si los pesos de los componentes no se estiman a partir de los datos, se pueden considerar como una distribución a priori sobre los componentes, de modo que P(χ generado por el componente Ck) = ϕ_k. Cuando los pesos se aprenden en su lugar, representan estimaciones a posteriori de las probabilidades de los componentes condicionadas a los datos observados.

El análisis de los k vecinos más cercanos

Para eliminar los efectos de confusión derivados de la representación diferencial de mutaciones específicas en subconjuntos de pacientes con cáncer con diferentes perfiles de expresión, aplicamos un enfoque de los k vecinos más cercanos[54] con k = 5. Específicamente, para cada muestra Si que alberga una mutación de interés, las muestras de control negativo se seleccionaron como sus k vecinos más cercanos del subconjunto de muestras PWT0. El número de muestras (k = 5) se determinó empíricamente para (1) proporcionar estadísticas razonables sobre la expresión diferencial y (2) aumentar la probabilidad de que las muestras de control negativo se seleccionen del mismo subgrupo de población con antecedentes genéticos.

Firma de consenso GOF/LOF

Para construir la firma de consenso basada en VEFS que representan mutaciones hipermórficas (GOF) o hipomórficas (LOF) establecidas, PHNToM utiliza los subconjuntos de muestras definidos en cBioPortal (versiones del 15 de marzo de 2019 y del 28 de enero de 2021)[18],[19], OncoKB (v1.24, 12 de diciembre de 2019; v3.0, 14 de enero de 2021)[31], FASMIC (v1.8, 1 de noviembre de 2021)[3] o la literatura. Específicamente, se generaron vectores que representan la actividad diferencial de cada TF en cada muestra que alberga un VEFS que representa un evento GOF establecido, en comparación con sus controles negativos PWT, mediante el análisis VIPER. Para las muestras que albergan VEFS que representan eventos LOF, se utilizó el mismo procedimiento con un signo invertido para la actividad proteica, de modo que la proteína más diferencialmente activa se convirtiera en la proteína más diferencialmente inactiva. Finalmente, todos los vectores GOF y LOF se integraron mediante Stouffer[55] para generar un único vector de proteínas TF/co-TF clasificadas según la significación estadística de su actividad diferencial integrada, lo que representa la firma de consenso.

Modelo nulo para estimar la significación estadística de los ensayos de validación de PIK3CA

La significación estadística se evaluó utilizando el análisis χ2 para los eventos GOF, LOF, NEO y NEU utilizando un modelo nulo en el que la probabilidad esperada de validación se calculó en función de la relación entre el número de eventos GOF, LOF, NEO y NEU validados y el número total de mutaciones de PIK3CA validadas en la cohorte.

Asignación funcional de consenso

Cuando el mismo evento de mutación (es decir, el mismo locus y los mismos cambios en los ácidos nucleicos) aparece en múltiples secuencias con diferentes clasificaciones, se utiliza el siguiente enfoque: si una clasificación surge como el consenso (es decir, un mayor número de clasificaciones entre las cuatro clases), entonces el evento se asigna a esa clase (regla de la mayoría). Si se produce un empate entre las clases con el mayor número de eventos, se aplican las siguientes reglas: si la clasificación alternativa en el empate es no funcional (NEU), entonces los eventos se resuelven de la siguiente manera: los empates GOF/NEU y LOF/NEU se resuelven como GOF y LOF, respectivamente, mientras que los empates GOF/LOF se clasifican como no definidos (N/A). Si la clasificación alternativa en el empate es funcional (es decir, GOF, LOF o NEO), entonces se considera que el evento no está definido (N/A). Dado que los eventos NEO también pueden ser GOF o LOF, si NEO es el evento mayoritario, entonces se aplican las mismas reglas que en 1 y 2 anteriores para determinar su asignación secundaria como NEO/GOF o NEO/LOF. Las combinaciones NEO/NEU se clasifican como NEO puro. Las asignaciones NEO con un empate GOF/LOF también se clasifican como NEO puro.

Estadísticas y reproducibilidad

Todos los análisis estadísticos se realizaron en R (v3.6–v4.2). A menos que se especifique lo contrario, las pruebas fueron bicolaterales. Se utilizaron las pruebas t de Student para comparar las muestras de GTEx y TCGA de tipo salvaje para la selección de controles negativos (P > 0,05). El enriquecimiento de la vía se evaluó mediante la prueba exacta de Fisher con valores P y puntuaciones z de enriquecimiento calculadas utilizando Enrichr; la corrección de la prueba de hipótesis múltiple se realizó mediante Bonferroni o la tasa de descubrimiento falso de Benjamini-Hochberg, según se indique. Las firmas de consenso se integraron mediante el método de Stouffer y se aplicaron las pruebas χ2 a los ensayos de validación. Los tamaños de muestra se indican en las leyendas de las figuras. Se analizaron muestras tumorales o normales independientes; no se utilizaron réplicas técnicas.

Resumen del informe

Hay información adicional sobre el diseño de la investigación disponible en el Resumen del informe de Nature Portfolio vinculado a este artículo.

Selección y normalización de muestras de TCGA

Los perfiles de ARN-seq que comprenden lecturas emparejadas sin procesar de 25 cohortes de TCGA se descargaron del Portal de datos genómicos (GDC) (https://portal.gdc.cancer.gov/; v15.0, versión del 20 de febrero de 2019)[38]. Los perfiles equivalentes para las muestras de GTEx se descargaron de la base de datos de genotipos y fenotipos (dbGaP, https://dbgap.ncbi.nlm.nih.gov/aa/wga.cgi?page=login)[45] y del Portal de GTEx (https://gtexportal.org/home/, Análisis de GTEx V7, número de acceso dbGaP, phs000424.v7.p2)[36]. El alineador STAR (v2.6.1e, lanzado el 25 de julio de 2019)[46] se utilizó para mapear las lecturas individuales al genoma de referencia humano UCSC[47] hg38 (versión 13, GRCh38.p13, 28 de febrero de 2019) y al transcriptoma de referencia GENCODE (v29, GRCh38.p12, 21 de diciembre de 2017), seguido del análisis de featureCounts (versión 2.0.0, 4 de septiembre de 2019)[48] para generar los recuentos de lecturas.

Para corregir los efectos de lote, se crearon matrices de muestras-genes independientes para cada cohorte tumoral de TCGA y para cada par de tejidos normales de GTEx coincidentes. Se utilizó ComBat (v3.27.0)[21] para corregir los sesgos técnicos entre TCGA y GTEx. Los recuentos de genes sin procesar de ARN-seq se transformaron en lecturas por kb de transcrito por millón de lecturas mapeadas (RPKM) utilizando la longitud media del transcrito para cada gen, seguido de la transformación log2. El ensamblaje de este estándar de mutación dorado se realizó mediante la minería de datos basada en la literatura de las bases de datos OncoKB[31] y COSMIC[32], que también incorporan información de FASMIC[3] y ProtFus[49].

Generación de la red ARACNe

Las firmas de expresión génica se normalizaron aplicando dos transformaciones no paramétricas para el análisis de ARACNe. ARACNe requiere un GEP junto con una lista predefinida de TF/co-TF como entrada e implica tres pasos principales, a saber, (1) la estimación del umbral de información mutua (MI), que identifica un umbral de significación de los valores de MI de los GEP proporcionados; (2) la reconstrucción de la red de bootstrapping, en la que se reconstruyen las redes de MI para los GEP muestreados aleatoriamente, calculando la MI para cada par TF/objetivo después de transformar los rangos de los GEP, eliminando las conexiones no estadísticamente significativas utilizando el umbral de MI y eliminando las interacciones indirectas aplicando un filtro de tolerancia de desigualdad de procesamiento de datos; y (3) la construcción de una red de consenso, estimando la significación estadística del número de veces que se detecta un borde específico en todas las ejecuciones de bootstrapping, basándose en una distribución de Poisson. Esto se debe a que la estimación de MI no se ve afectada por una transformación monótona de los datos de entrada. Específicamente, se realizó una transformación de rango entre 0 y 1, primero en una base de columnas (muestras tumorales) y luego nuevamente en una base de filas (genes). Los datos resultantes se analizaron utilizando ARACNe-adaptive partitioning (AP)[25],[50] para generar regulones específicos de tejido para cada proteína TF y co-TF.

Análisis VIPER

El algoritmo VIPER se ha utilizado y validado ampliamente como una metodología precisa para medir la actividad de una proteína en función del enriquecimiento de sus objetivos transcripcionales activados y reprimidos específicos de tejido (regulón) en los genes sobreexpresados y subexpresados[17], es decir, como un ensayo de genes-receptores altamente multiplexado. Se utilizó VIPER para transformar los GEP en perfiles de actividad proteica para todas las proteínas TF y co-TF, en una base de muestra por muestra. Específicamente, para cada muestra (tumoral o normal), se obtuvo una firma de expresión diferencial mediante la prueba t de Student que comparaba la expresión génica en esa muestra con la expresión media de todas las muestras en la cohorte de GTEx correspondiente de tejido coincidente. Luego, estas firmas se analizaron utilizando el algoritmo VIPER (v1.24.0)[17] con los regulones ARACNE-AP de tejido coincidente.

Análisis OncoMatch

Para identificar los vecinos de tipo salvaje más cercanos de una muestra que alberga una VUFS (PMut), aplicamos el algoritmo OncoMatch[22]. Específicamente, calculamos el enriquecimiento de las 50 proteínas más diferencialmente activas (las 25 superiores y las 25 inferiores, según lo evaluado por VIPER) en PMut en comparación con el conjunto de proteínas diferencialmente activas en cada muestra de tipo salvaje, utilizando el análisis PSEA. El valor P correspondiente se corrigió posteriormente mediante la corrección de Bonferroni para la prueba de múltiples hipótesis. Se seleccionó un número fijo de proteínas diferencialmente activas para evitar sesgos debido al tamaño del conjunto al evaluar el NES, como se discutió anteriormente[2], donde se demostró que un promedio de 50 reguladores maestros (MR) es suficiente para explicar el efecto de las alteraciones genéticas funcionalmente relevantes en más de 20 cohortes de TCGA.

Selección de mutaciones

Se descargaron los archivos de anotación de mutaciones para TCGA del repositorio Firehose (gdac.broadinstitute.org/, versión del 28 de enero de 2016; http://firebrowse.org/). Se descargaron datos de mutación adicionales de cBioPortal (versiones del 15 de marzo de 2019 y del 28 de enero de 2021)[18],[19] y GDC (v15.0, versión del 20 de febrero de 2019)[51]. Se evaluaron las alteraciones del número de copias somáticas basándose en los análisis GISTIC2.0 (v7) publicados[52].

Generación del modelo nulo PWT0

Para identificar un conjunto de muestras (PWT0) que representen la actividad imparcial de la proteína de tipo salvaje (PWT), generamos una densidad de probabilidad a partir de las muestras de GTEx que representen la actividad de P evaluada por VIPER en el tejido normal más estrechamente relacionado y, a continuación, seleccionamos las muestras tumorales con actividad proteica evaluada por VIPER que no sea estadísticamente significativamente diferente de la de la cohorte normal (P > 0,5).

Modelo de mezcla gaussiana multimodal

Para cada proteína que se esté considerando, la canalización realiza un análisis multimodal de las muestras de tipo salvaje, mutadas y GTEx (ya sea con correspondencia de tejido, si está disponible, o promediado en todo el repositorio de GTEx). A continuación, se seleccionan los controles normales como muestras de tipo salvaje que son indistinguibles de las muestras de GTEx (es decir, P > 0,05, según la prueba t de Student).

Análisis de mezcla gaussiana multimodal

Estos análisis se basan en modelos probabilísticos que representan muestras distribuidas normalmente dentro de un espacio de muestra más grande, parametrizados por dos tipos de valores: los pesos de los componentes de la mezcla y las medias de los componentes, así como las varianzas/covarianzas[53]. Para un modelo de mezcla gaussiana con C componentes, el c-ésimo componente tiene una media μc y una varianza σc en el caso univariado y una media k y una matriz de covarianza de Σk en el caso multivariado. Los pesos de los componentes de la mezcla se definen como ϕk para el componente Ck, con la restricción de que de modo que la distribución de probabilidad total se normalice a 1. Si los pesos de los componentes no se estiman a partir de los datos, se pueden considerar como una distribución a priori sobre los componentes, de modo que P(χ generado por el componente Ck) = ϕ_k. Cuando los pesos se aprenden en su lugar, representan estimaciones a posteriori de las probabilidades de los componentes condicionadas a los datos observados.

El análisis de los k vecinos más cercanos

Para eliminar los efectos de confusión derivados de la representación diferencial de mutaciones específicas en subconjuntos de pacientes con cáncer con distinta expresión transcripcional, aplicamos un enfoque de los k vecinos más cercanos[54] con k = 5. Específicamente, para cada muestra Si que contenga una mutación de interés, se seleccionaron las muestras de control negativo como sus k vecinos más cercanos del subconjunto de muestras PWT0. El número de muestras (k = 5) se determinó empíricamente para (1) proporcionar estadísticas razonables sobre la expresión diferencial y (2) aumentar la probabilidad de que las muestras de control negativo se seleccionaran del mismo subgrupo de población con antecedentes genéticos.

Firma de consenso GOF/LOF

Para construir la Firma de Consenso basada en VEFS que representan mutaciones hipermorfas (GOF) o hipomorfas (LOF) establecidas, PHNToM utiliza los subconjuntos de muestras definidos en cBioPortal (versiones del 15 de marzo de 2019 y del 28 de enero de 2021)[18],[19], OncoKB (v1.24, 12 de diciembre de 2019; v3.0, 14 de enero de 2021)[31], FASMIC (v1.8, 1 de noviembre de 2021)[3] o la literatura. Específicamente, se generaron vectores que representan la actividad diferencial de cada TF en cada muestra que contiene un VEFS que representa un evento GOF establecido, en comparación con sus controles negativos PWT, mediante el análisis VIPER. Para las muestras que contienen VEFS que representan eventos LOF, se utilizó el mismo procedimiento con un signo invertido para la actividad proteica, de modo que la proteína más diferencialmente activa se convirtiera en la proteína más diferencialmente inactiva. Finalmente, todos los vectores GOF y LOF se integraron mediante Stouffer[55] para generar un único vector de proteínas TF/co-TF clasificadas según la significación estadística de su actividad diferencial integrada, lo que representa la Firma de Consenso.

Firma de consenso GOF/LOF

Para construir la Firma de Consenso basada en VEFS que representan mutaciones hipermorfas (GOF) o hipomorfas (LOF) establecidas, PHNToM utiliza los subconjuntos de muestras definidos en cBioPortal (versiones del 15 de marzo de 2019 y del 28 de enero de 2021)[18],[19], OncoKB (v1.24, 12 de diciembre de 2019; v3.0, 14 de enero de 2021)[31], FASMIC (v1.8, 1 de noviembre de 2021)[3] o la literatura. Específicamente, se generaron vectores que representan la actividad diferencial de cada TF en cada muestra que contiene un VEFS que representa un evento GOF establecido, en comparación con sus controles negativos PWT, mediante el análisis VIPER. Para las muestras que contienen VEFS que representan eventos LOF, se utilizó el mismo procedimiento con un signo invertido para la actividad proteica, de modo que la proteína más diferencialmente activa se convirtiera en la proteína más diferencialmente inactiva. Finalmente, todos los vectores GOF y LOF se integraron mediante Stouffer[55] para generar un único vector de proteínas TF/co-TF clasificadas según la significación estadística de su actividad diferencial integrada, lo que representa la Firma de Consenso.

Modelo nulo para estimar la significación estadística de los ensayos de validación de PIK3CA

La significación estadística se evaluó utilizando el análisis χ2 para los eventos GOF, LOF, NEO y NEU utilizando un modelo nulo en el que la probabilidad esperada de validación se calculó en función de la relación entre el número de eventos GOF, LOF, NEO y NEU validados y el número total de mutaciones de PIK3CA validadas en la cohorte.

Asignación funcional de consenso

Cuando el mismo evento de mutación (es decir, el mismo locus y los mismos cambios en los ácidos nucleicos) aparece en múltiples secuencias con diferentes clasificaciones, se utiliza el siguiente enfoque: Si una clasificación surge como el consenso (es decir, un mayor número de clasificaciones entre las cuatro clases), entonces el evento se asigna a esa clase (regla de la mayoría). Si se produce un empate entre las clases con el mayor número de eventos, se aplican las siguientes reglas: Si la clasificación alternativa en el empate es no funcional (NEU), entonces los eventos se resuelven de la siguiente manera: los empates GOF/NEU y LOF/NEU se resuelven como GOF y LOF, respectivamente, mientras que los empates GOF/LOF se clasifican como no definidos (N/A). Si la clasificación alternativa en el empate es funcional (es decir, GOF, LOF o NEO), entonces se considera que el evento no está definido (N/A). Dado que los eventos NEO también pueden ser GOF o LOF, si NEO es el evento mayoritario, entonces se aplican las mismas reglas que en 1 y 2 anteriores para determinar su asignación secundaria como NEO/GOF o NEO/LOF. Las combinaciones NEO/NEU se clasifican como NEO puro. Las asignaciones NEO con un empate GOF/LOF también se clasifican como NEO puro.

Asignación funcional de consenso

Cuando el mismo evento de mutación (es decir, el mismo locus y los mismos cambios en los ácidos nucleicos) aparece en múltiples secuencias con diferentes clasificaciones, se utiliza el siguiente enfoque: Si una clasificación surge como el consenso (es decir, un mayor número de clasificaciones entre las cuatro clases), entonces el evento se asigna a esa clase (regla de la mayoría). Si se produce un empate entre las clases con el mayor número de eventos, se aplican las siguientes reglas: Si la clasificación alternativa en el empate es no funcional (NEU), entonces los eventos se resuelven de la siguiente manera: los empates GOF/NEU y LOF/NEU se resuelven como GOF y LOF, respectivamente, mientras que los empates GOF/LOF se clasifican como no definidos (N/A). Si la clasificación alternativa en el empate es funcional (es decir, GOF, LOF o NEO), entonces se considera que el evento no está definido (N/A). Dado que los eventos NEO también pueden ser GOF o LOF, si NEO es el evento mayoritario, entonces se aplican las mismas reglas que en 1 y 2 anteriores para determinar su asignación secundaria como NEO/GOF o NEO/LOF. Las combinaciones NEO/NEU se clasifican como NEO puro. Las asignaciones NEO con un empate GOF/LOF también se clasifican como NEO puro.

Estadísticas y reproducibilidad

Todos los análisis estadísticos se realizaron en R (v3.6–v4.2). A menos que se especifique lo contrario, las pruebas fueron bicaudales. Se utilizaron las pruebas t de Student para comparar las muestras de GTEx y TCGA de tipo salvaje para la selección de controles negativos (P > 0,05). El enriquecimiento de vías se evaluó mediante la prueba exacta de Fisher, con valores P y puntuaciones de enriquecimiento z calculados utilizando Enrichr; se corrigió la prueba de hipótesis múltiple mediante Bonferroni o la tasa de descubrimiento falso de Benjamini-Hochberg, según se indique. Las firmas de consenso se integraron mediante el método de Stouffer y se aplicaron las pruebas χ2 a los ensayos de validación. Los tamaños de muestra se indican en las leyendas de las figuras. Se analizaron muestras tumorales o normales independientes; no se utilizaron réplicas técnicas.

Resumen de la información

Se proporciona información adicional sobre el diseño de la investigación en el Resumen de información de Nature Portfolio vinculado a este artículo.

Contenido en línea

Cualquier método, referencias adicionales, resúmenes de información de Nature Portfolio, datos fuente, datos ampliados, información complementaria, agradecimientos, información sobre la revisión por pares, detalles de las contribuciones de los autores y conflictos de intereses; y declaraciones de disponibilidad de datos y código están disponibles en 10.1038/s41588-025-02482-x.

Se abre en una nueva pestaña en la publicación original

Compartir y Discutir

Comentarios

¡Aún no hay comentarios. Sé el primero en comentar!

Enviar a mi oncólogo

Artículo: Pan-cancer inference and validation of hypermorphic, hypomorphic and neomorphic mutations.

Autores: Tagore S, Tsang S, Tangermann C, Hu LZ, Diederichs S, Mills GB, Califano A.
Publicado: 2026-02-11
PMID: 41673304

Enlace: https://crcwarriors.org/article-detail.php?id=2561 | https://pubmed.ncbi.nlm.nih.gov/41673304/

¡Regístrate para usar esta función!

Crea una cuenta gratuita para enviar artículos científicos directamente a tu oncólogo y acceder a muchas más funcionalidades personalizadas.

Regístrate gratis