Introdução à Genética
14.4 Estrutura do genoma humano
FIGURA 14.12 Os diferentes modos de evidenciar produtos gênicos — cDNA, EST, correspondências similares de BLAST, tendenciosidade de códons e concordância de motifs — são integrados para realizar previsões sobre os genes. Onde se observa que múltiplas classes de evidências estão associadas a uma sequência de DNA genômico em particular, há maior confiança na probabilidade de que uma previsão gênica seja precisa.
14.4 Estrutura do genoma humano
Ao descrever a estrutura geral do genoma humano, primeiramente devemos confrontar sua estrutura repetida. Uma fração considerável do genoma humano, aproximadamente 45%, é repetitiva. Uma grande parte desse DNA repetitivo é composta por cópias de elementos de transposição. De fato, até mesmo no DNA de cópia única restante, uma fração apresenta sequências que sugerem que elas podem ser descendentes de elementos de transposição antigos que agora são imóveis e acumularam mutações aleatórias, causando a sua divergência na sequência em relação aos elementos de transposição ancestrais. Portanto, uma grande parte do genoma humano parece ser composta por “caronas” genéticos.
Apenas uma pequena parte do genoma humano codifica polipeptídios; ou
seja, um pouco menos de 3% dele codifica éxons dos mRNA. Os éxons são tipicamente pequenos (aproximadamente 150 bases), enquanto os íntrons são grandes, muitos se estendendo a mais de 1.000 bases e alguns se estendendo a mais de 100.000 bases. Os transcritos são compostos por uma média de 10 éxons, embora muitos apresentem substancialmente mais. Finalmente, os íntrons podem ser submetidos a splicing do mesmo gene em locais variáveis. Essa variação na localização dos sítios de splicing gera diversidade adicional considerável ao mRNA e à sequência polipeptídica. Com base nos atuais dados de cDNA e EST, no mínimo 60% dos genes humanos codificadores de proteínas provavelmente apresentam duas ou mais variantes de corte. Em média, existem diversas variantes de corte por gene. Portanto, o número de proteínas distintas codificadas pelo genoma humano é muito superior ao número de genes reconhecidos.
Não foi fácil definir o número de genes no genoma humano. No rascunho
inicial do genoma humano, havia uma estimativa de 30.000 a 40.000 genes codificadores de proteínas. Entretanto, a complexa arquitetura desses genes e do genoma pode tornar a anotação difícil. Algumas sequências registradas como genes realmente podem ser éxons de genes maiores. Além disso, existem mais de 19.000 pseudogenes, que são ORF ou ORF parciais que primeiramente podem parecer genes, mas não são funcionais ou são inativos em virtude do modo de sua origem ou de mutações. Os assim denominados pseudogenes processados são sequências de DNA que foram transcritas de modo reverso a partir do RNA e inseridas aleatoriamente no genoma. Aproximadamente 90% dos pseudogenes humanos aparentam ser desse tipo. Aproximadamente 900 pseudogenes parecem genes convencionais que adquiriram uma ou mais mutações que romperam ORF no decorrer da evolução. Na medida em que os desafios na anotação foram superados, o número estimado de genes no genoma humano diminuiu drasticamente. Uma estimativa recente é que existam aproximadamente 21.000 genes codificadores de proteínas.