2 puntos por GN⁺ 2023-08-26 | 1 comentarios | Compartir por WhatsApp
  • El cromosoma Y, que seguía incompleto hasta el final debido a sus largas estructuras palindrómicas y secuencias repetitivas, se completó como T2T-Y, llenando un gran vacío del genoma de referencia humano
  • El GRCh38-Y existente carecía de más de la mitad del cromosoma Y, y la nueva secuencia, de 62,460,029 pares de bases (bp), añade más de 30 millones de bp
  • La secuencia completa revela con más detalle la estructura amplicónica de las familias génicas TSPY, DAZ, RBMY y 41 genes codificadores de proteínas, en su mayoría de la familia TSPY
  • En la región de heterocromatina Yq12, aparecen de forma alternada bloques de human satellite 1 y 3, lo que permite analizar en todo el cromosoma la distribución de secuencias repetitivas, ADN satélite y motivos de ADN non-B
  • T2T-Y se integra con el ensamblaje del genoma CHM13 y se utiliza como un recurso de secuencia de referencia completa para los 24 cromosomas humanos

El último vacío pendiente del cromosoma Y

  • El cromosoma Y humano era extremadamente difícil de secuenciar y ensamblar debido a sus complejas estructuras repetitivas, incluidas largas estructuras palindrómicas, repeticiones en tándem y duplicaciones segmentarias
  • La secuencia de referencia GRCh38 carecía de más de la mitad del cromosoma Y, que seguía siendo el último cromosoma humano sin completar
  • El consorcio T2T completó T2T-Y, una secuencia completa del cromosoma Y humano derivada del genoma HG002, de 62,460,029 bp
  • T2T-Y corrige varios errores de GRCh38-Y y añade más de 30 millones de bp a la secuencia de referencia

Nuevos genes y estructuras repetitivas revelados

  • T2T-Y muestra la estructura amplicónica completa de las familias génicas TSPY, DAZ, RBMY
  • La nueva secuencia de referencia incluye además 41 genes codificadores de proteínas, en su mayoría de la familia TSPY
  • En la región de heterocromatina Yq12 se confirmó un patrón alternado de bloques de human satellite 1 y 3
  • Al completarse el ensamblaje, fue posible evaluar de forma integral las secuencias repetitivas del cromosoma Y, e identificar arreglos satelitales antes desconocidos
    • El nuevo arreglo satelital estaba principalmente en PAR1
    • También se identificaron repeticiones de subunidad que forman parte de una unidad repetitiva compuesta de TSPY, RBMY o DAZ

Dificultades estructurales reveladas durante el ensamblaje

  • El ensamblaje de los cromosomas X/Y de HG002 se analizó con un assembly string graph basado en lecturas HiFi
    • La estructura entrelazada más compleja se limitó a la región satelital heterocromática del brazo q del cromosoma Y
    • El subgrafo X/Y se conecta en PAR1 y PAR2
  • En PAR1 se observó una discontinuidad del grafo causada por sesgo de secuenciación HiFi
    • De las 11 rupturas observadas, 9 estaban en PAR1 de ambos cromosomas
    • En el cromosoma Y, las 5 de 5 estaban en PAR1
  • En la región palindrómica P1–P3, la estructura repetitiva se resolvió mediante poda manual e integración de lecturas ONT
    • Se destacan 3 estructuras tipo hairpin de repetición invertida en tándem casi completa, que incluyen todo P3 y dos palíndromos de P2
    • Las ambigüedades restantes se resolvieron evaluando el alineamiento de lecturas ONT frente a reconstrucciones candidatas

Validación con Strand-seq y análisis de variantes

  • Al comparar 65 bibliotecas Strand-seq contra GRCh38-Y y T2T-Y, en GRCh38-Y aparecieron varios picos de cobertura en dirección inversa
    • Estos picos sugieren polimorfismos de inversión con respecto a HG002, posiblemente por diferencias de haplogrupo
    • Como esos mismos picos no se observaron en T2T-X ni en T2T-Y, se confirmó la exactitud estructural y de orientación del ensamblaje HG002
  • Se identificó una inversión de 3 kb en una secuencia única entre los brazos palindrómicos P5 como un error de T2T-Y, pero se confirmó que era polimórfica en la población, por lo que no se corrigió en esta versión del ensamblaje
  • En T2T-Y, los cambios de estado de hebra en cada biblioteca Strand-seq se distribuyen aleatoriamente, sin evidencia de ensamblajes erróneos ni colapsos
  • El análisis de Extended Data confirmó que 5 de 15 personas tenían la variante invertida del palíndromo P3 presente en HG002

PAR, Yq12 y motivos de ADN non-B

  • En el subgrafo de PAR1, un green edge gap y una cobertura desigual de nodos indican sesgo de secuenciación HiFi a lo largo de PAR1
  • PAR1 es rica en repeticiones SINE y motivos de ADN non-B, y estas características podrían explicar los gaps de secuenciación
  • En el análisis de la distribución de motivos de ADN non-B en todo T2T-Y, las secuencias satelitales HSat3 de Yq y las cercanas al centrómero son más ricas en repeticiones A-phased, repeticiones directas y STR
  • HSat1B es más rica en repeticiones invertidas y repeticiones espejo
  • También se observó enriquecimiento de secuencias de ADN non-B en la región PAR
  • El arreglo génico TSPY es rico en motivos G4 y Z-DNA
    • Cada copia de TSPY tiene un pico G4 aproximadamente 500 bases aguas arriba de TSPY
    • Si el Quadron score supera 19, se considera una estructura G4 estable

Recurso de secuencia de referencia para los 24 cromosomas humanos

  • Los investigadores combinaron T2T-Y con el ensamblaje existente del genoma CHM13 y mapearon variantes poblacionales disponibles, variantes clínicas y datos de genómica funcional para crear una secuencia de referencia completa de los 24 cromosomas humanos
  • La lista completa de recursos puede descargarse desde marbl/CHM13
    • T2T-CHM13v2.0, ensamblaje T2T-CHM13+Y
    • reference analysis set
    • gene annotation, repeat annotation, epigenetic profiles
    • resultados de variant-calling de 1KGP y SGDP
    • conjuntos de datos de gnomAD, ClinVar, GWAS y dbSNP
  • El ensamblaje también está disponible en NCBI y EBI, y su GenBank accession es GCA_009914755.4
  • La annotation y los recursos relacionados también pueden explorarse en hs1 del UCSC Genome Browser, en T2T-CHM13v2.0 del Ensembl Genome Browser y en el data-hub de NCBI
  • Los posibles problemas del ensamblaje pueden consultarse y seguirse en marbl/CHM13-issues

Datos y código de análisis publicados

  • Los alineamientos short-read y variant calls de 1KGP y SGDP están disponibles en AnVIL workspace
  • Los datos originales del laboratorio de Gerton pueden consultarse en Stowers Original Data Repository
  • Los datos de secuenciación utilizados en el estudio están listados en la Supplementary Table 1
  • El custom code desarrollado para el análisis y la visualización de datos se publicó en GitHub y Zenodo
  • El software utilizado y sus parámetros se detallan en los Supplementary Methods junto con información adicional

1 comentarios

 
GN⁺ 2023-08-26
Opiniones de Hacker News
  • Para quienes no recuerdan la antigua carrera por descifrar el genoma humano, vale agregar que los competidores que iban a la cabeza en ese momento eran Celera Genomics y el Human Genome Project.
    Celera, dirigida por Craig Venter, anunció que había terminado la secuenciación, pero en realidad usó el método shotgun, que toma pequeñas muestras de distintos puntos y ensambla estadísticamente un modelo del genoma; unos 5 años después reconoció que no había descifrado el genoma completo.
    Referencia: https://www.technologyreview.com/2007/09/04/223919/craig-ven...

    • La secuenciación shotgun no era peor que el chromosome walking tradicional que usaba el otro Human Genome Project, y ninguno de los dos produjo una secuencia realmente completa.
      En ese entonces se criticaba la secuenciación shotgun como un “atajo”, pero hoy el chromosome walking desapareció y shotgun se convirtió en el estándar.
      Si algo lo reemplaza, serían las tecnologías de lecturas largas como Oxford Nanopore, aunque todavía requieren ensamblar los datos y no están al nivel de obtener directamente una secuencia de extremo a extremo.
    • El HGP también usaba ensamblaje de contigs basado en scaffolds, así que tampoco produjo una secuencia completa, y ambos grupos anunciaron, como en una tregua, que habían terminado el “primer borrador”.
      Hace 35 años: https://www.nytimes.com/1987/12/13/magazine/the-genome-proje...
      Hace 33 años: https://www.nytimes.com/1990/06/05/science/great-15-year-pro...
      Hace 29 años, la competencia se intensifica: https://www.nytimes.com/1994/02/22/science/scientist-at-work...
      Hace 24 años, la competencia en curso: https://www.nytimes.com/1999/03/23/science/who-ll-sequence-h...
      Hace 23 años, borrador completado: https://archive.nytimes.com/www.nytimes.com/library/national...
      Hace 20 años: https://www.nytimes.com/2003/04/15/science/once-again-scient...
      Hace 2 años: https://archive.nytimes.com/www.nytimes.com/library/national...
      El enfoque shotgun de Celera era complicado porque requería una enorme capacidad de cómputo y algoritmos sofisticados para ensamblar los fragmentos, y el cálculo del ensamblaje final se ejecutó en un AlphaServer GS160 de Compaq porque el algoritmo y los datos exigían 64 GB de memoria compartida.
      En ese entonces, el GS160 era una enorme máquina UNIX y podía agruparse de forma estrecha en clústeres con entrada/salida y sistema de archivos integrados entre varias máquinas.
      El autor principal del ensamblaje shotgun fue Gene Myers, quien antes había creado BLAST y, junto con Udi Manber, había ideado el suffix array.
      El proyecto público también tenía problemas porque muchos equipos se aferraban a enfoques manuales y académicos; después de que Eric Lander lo convirtiera en un proceso industrial, pasó a operar el Broad Institute, un laboratorio privado de investigación de MIT/Harvard en Boston.
      Hoy se generan a diario datos de secuenciación a escala de petabytes, se almacenan en la nube, y el genoma se convirtió en una herramienta base para la investigación humana, aunque su potencial para entender fenotipos complejos todavía no se ha revelado por completo.
    • Recuerdo que el punto central de la controversia de entonces era que Celera necesitaba la información publicada por los NIH/el Human Genome Project internacional para ensamblar su secuencia, pero mantenía sus propios resultados en privado e intentaba asegurar derechos de propiedad intelectual antes de que la información entrara al dominio público.
    • Esta evaluación parece innecesariamente negativa.
      Lo que hizo Celera tenía valor y, al menos según mi impresión, tampoco ocultaban lo que habían hecho.
      Más que un “truco estadístico”, corresponde llamarlo innovación.
  • Me da curiosidad qué significa exactamente decir que el genoma humano fue descifrado por completo, si cada persona tiene una composición genética distinta.
    ¿No varía de una persona a otra la secuencia de bases del DNA/RNA?

    • El Human Genome Project público usó a varias personas, pero la mayor parte de la biblioteca de secuencias provino de un individuo de Buffalo, Nueva York; Celera también usó a varias personas, pero en su mayoría era el genoma de Venter.
      https://www.nytimes.com/2002/04/27/us/scientist-reveals-secr...
      Tengo entendido que los proyectos recientes han usado grupos de individuos más amplios.
      Algunos proyectos mezclan a varios individuos y los descifran juntos, mientras que otros descifran a cada individuo por separado.
      La estructura a gran escala entre humanos es muy similar, y como han surgido métodos sofisticados para modelar las variaciones individuales, no es un gran problema.
      Las estructuras de grafo que representan alternativas dentro de una secuencia de referencia se describen en https://www.biomedcentral.com/collections/graphgenomes, y pueden incluir no solo diferencias de una sola base, sino también variaciones más complejas como grandes deleciones, reordenamientos e inversiones.
    • En realidad, sería más correcto decir “un genoma humano” en vez de “el genoma humano”.
      El genoma de referencia funciona como la Rosetta Stone de la genómica: sirve como base para alinear, entender y comparar las secuencias de DNA/RNA de otros individuos contra la referencia.
      No es perfecto, así que puede haber regiones ausentes en la referencia o regiones de DNA muy variables.
      El objetivo del Human Pangenome Reference Consortium(HPRC) https://humanpangenome.org/ es resolver este problema secuenciando individuos de poblaciones diversas, y también se están desarrollando nuevos modelos computacionales para analizar datos de toda la población.
    • Significa que se obtuvo la secuencia completa de un cromosoma Y específico, y que se lo considera el cromosoma de “referencia”.
      Se aplicó un enfoque similar a otros cromosomas.
    • A mí también siempre me costó entenderlo.
      Si el genoma son megabytes de muchísimos [ATCG]+, me pregunto qué nos dice tener esa secuencia.
      ¿Solo la miran y dicen “ah, ...ATGCTACGACTACGACTAGCG... interesante”?
    • El concepto del que se habla ahora se llama ensamblaje de pangenoma.
      A principios de este año hubo artículos destacados, incluido un paper de Guarracino y Garrison en Nature.
      Un pangenoma suele ser un modelo de grafo complejo que enlaza cientos o más genomas/haplotipos de una especie, y conceptualmente puede extenderse más allá de las especies o a las células dentro de un individuo, por ejemplo a un pangenoma del cáncer.
      En un grafo de pangenoma humano idealizado, cada persona se representa con dos hebras sobre cada autosoma, y con hebras que atraviesan los cromosomas X e Y y el genoma mitocondrial.
  • Entiendo que la razón por la que descifrar genes es difícil es que la mayoría de los métodos primero dividen al azar una secuencia genética larga en fragmentos y luego descifran cada fragmento por separado.
    Para obtener el genoma completo hay que volver a ordenar esos fragmentos en el orden correcto; esto es posible porque hay solapamientos entre fragmentos, pero si hay regiones repetidas, es difícil unirlos correctamente solo con esos solapamientos.
    También existe una técnica nueva llamada Nanopore, en la que el DNA se hace pasar físicamente por un poro pequeño y las propiedades eléctricas cambian según los pares de bases dentro del poro.
    Sin embargo, tiende a producir errores de forma determinística según la secuencia, y como no puedo ver el artículo completo no sé exactamente qué hicieron aquí, aunque he oído que se combinan ambos enfoques.

    • Dependieron principalmente de las lecturas PacBio HiFi, una tecnología que considero una revolución subestimada en la genómica.
      Luego usaron secuenciación Nanopore para conectar los contigs HiFi y cubrir las regiones realmente difíciles del cromosoma.
      Según lo entiendo, toda la secuenciación moderna a gran escala es secuenciación shotgun.
      Se rompe el DNA al azar, se descifra cada fragmento y luego las lecturas, que son los fragmentos individuales, se ensamblan con un ensamblador de genomas.
  • Tengo una “pregunta tonta” que siempre me hice sobre los registros del genoma humano.
    Como todos tenemos DNA distinto, me pregunto si el “genoma humano” es algo así como un DNA promedio, el DNA de alguien tomado como muestra, o un esquema de lo que todos tenemos en común.

    • Aquí se habla de un genoma de referencia.
      Las diferencias entre personas son relativamente pequeñas, del orden de unos pocos millones de bases entre 3 mil millones.
      Históricamente, el genoma de referencia era más bien un promedio/mosaico de varios individuos, y aunque sus desventajas son claras, era suficiente para colocar las lecturas en posiciones mayormente correctas y llamar las variantes, que son las diferencias que hacen único al genoma examinado.
      La referencia T2T end-to-end más reciente se basa por completo en el individuo HG002 de Utah, gracias a la nueva información aportada por las tecnologías de lecturas largas.
    • En este caso es un haplotipo de una sola línea celular.
      Si se necesita un modelo poblacional del genoma, hace falta un pangenoma.
      Hay que buscar “pangenome graph”, “variation graph” y human pangenome project.
  • Esta noticia debería corresponder a diciembre del año pasado, no a ahora.
    El equipo T2T publicó un preprint [1] en diciembre del año pasado y liberó los datos [2] en marzo, pero recién ahora se publicó oficialmente en Nature por el proceso de revisión por pares.
    Los calendarios de publicación pueden ser realmente lentos, y me pregunto qué sentido tiene la publicación formal en estos casos, cuando los científicos interesados ya lo saben y están trabajando con este ensamblaje.
    [1] https://www.biorxiv.org/content/10.1101/2022.12.01.518724v1....
    [2] https://github.com/marbl/CHM13

    • En este contexto, creo que el sentido de un comunicado de prensa es informar la noticia al público general que no es científico del área.
  • ¿Esto se parece más a “hay un driver de teclado que funciona”, o a “identificamos las 104 teclas de la distribución estándar US QWERTY de 104 teclas”?

    • Se parece más a que ahora tenemos los datos en bruto de los archivos CAD usados para fabricar el teclado
      Entendemos algunos comandos CNC, pero todavía no tenemos una buena comprensión del mecanismo de control ni del orden
      Algún día identificaremos las teclas, pero todavía estamos muy lejos de un driver y, más importante aún, de saber qué hace cada tecla
      Eso sí, ya descubrimos que si cambiamos ciertos bits de los datos en bruto, el teclado se rompe de formas interesantes
    • Hasta ahora veníamos usando un QWERTY de 87 teclas, y ahora se siente más como si hubiéramos encontrado también el teclado numérico
  • Esto es un acontecimiento bastante grande
    Significa que ahora los 24 cromosomas completos ya fueron decodificados por completo y, como dice el resumen, el cromosoma Y había sido difícil de decodificar hasta ahora por sus características

    • Pensaba que el Human Genome Project había terminado en 2003, pero al volver a buscarlo vi que en ese momento “completo” significaba 92%
      Luego terminó en 2022, y ahora dicen que volvió a terminar
      Me pregunto si todavía quedan hitos pendientes hacia otro “completado de nuevo”
      ¿De verdad el cromosoma Y se consideraba una excepción hasta ahora?
    • Me pregunto qué factores hacen que el cromosoma Y sea más difícil
    • Me pregunto qué significa aquí “decodificado por completo” de una forma que una persona común pueda entender
  • Como tema tangencial, recomiendo muchísimo Y - The Descent of Man, de Steve Jones, un libro muy interesante y educativo
    Me entusiasma ver que se cartografían y decodifican más cromosomas
    Preguntando desde un nivel de biología de secundaria, me intriga si en genes, expresión génica e interacciones ya llegamos más allá de la correlación, a una comprensión determinista
    Tomando como ejemplo los “ojos azules” [1], sabemos que OCA2 participa en el color de ojos marrón/azul, pero ¿podemos estar seguros de que los otros 20,000 genes no participan en absoluto o no son necesarios?
    Intuyendo como lego, para tener ojos azules parecería que varios genes tienen que estar encendidos, activados o presentes, y que se parece más a una receta que a un simple on/off en una sola posición
    [0] https://www.goodreads.com/work/editions/436071-y-the-descent...
    [1] https://www.nature.com/articles/s41433-021-01749-x

    • El color de ojos tiene matices
      El problema empieza por cómo definir los ojos azules
      No es un único fenotipo, sino varios rangos de ojos azules, y esas diferencias corresponden a variaciones bastante sutiles entre personas
      El artículo enlazado [1] es bastante bueno, pero entenderlo por completo requiere bastante tiempo
    • Según el punto de vista, se puede decir que hacen falta todo tipo de genes para tener ojos azules
      Al fin y al cabo, para tener ojos azules hay que tener ojos, y para comprobar el color también hacen falta varios mecanismos para abrirlos
    • La genética humana es muy compleja y todavía no la entendemos por completo
      Por ejemplo, la epigenética recién tuvo grandes avances hace relativamente poco; en términos generales, estudia cómo cambia el comportamiento celular aunque el ADN en sí no cambie [1]
      Esto obliga a replantear con más detalle la vieja pregunta sobre influencias ambientales e influencias genéticas
      No estoy totalmente seguro de cuántos cromosomas intervienen en determinar el color de ojos, pero hay estimaciones bastante buenas
      Una estimación reciente habla de unos 16, con OCA2 y HERC2 como los de mayor efecto, aunque muchos otros genes también tienen efectos pequeños [2]
      El artículo citado es excelente, pero también trata temas más cercanos a biología introductoria universitaria/AP Biology que a la biología estándar de secundaria, como regulación génica, intrones y exones
      En términos más generales, creo que en genética será difícil llegar pronto a una etapa en la que podamos afirmar algo con 100% de certeza determinista
      La genética y la biología en general han avanzado muchísimo, pero no hay que subestimar alegremente la complejidad del genoma humano
      Claramente hay cosas que todavía no entendemos, y seguirá siendo así por un tiempo
      En la práctica, incluso fenotipos simples como el color de ojos pueden verse afectados por otros genes, pero normalmente con unos pocos genes se puede estimar con bastante precisión
      Por ejemplo, un estudio predijo el color de ojos con alrededor de 75% de precisión usando solo 6 genes [3]
      Lo más interesante es que, a veces, un gen que influye en un fenotipo no almacena directamente la información genética que determina ese rasgo
      Es decir, ese gen no determina el rasgo de forma directa, sino que influye en otros genes, y esos otros genes participan de manera más directa en la expresión del rasgo
      Varios genes se influyen entre sí y a otros genes, y además en los estudios hay que tener en cuenta sesgos ambientales y demográficos; eso muestra lo rápido que se vuelve compleja la genética
      [1] https://www.ncbi.nlm.nih.gov/pmc/articles/PMC2791696/
      [2] https://www.nature.com/articles/jhg2010126
      [3] https://doi.org/10.1016/j.cub.2009.01.027
  • Esta es una noticia emocionante
    Si quieren conocer las aplicaciones de este trabajo, conviene ver esta keynote de ACM SIGPLAN: https://youtu.be/JTU3JYp3JYc?si=jOZz611ATQar3Gec
    Me ayudó a entender el ADN más que todo el curso de biología de la secundaria