Introdução à Genética

Anthony J. F. Griffiths · Capítulo 252 de 398

Páginas do PDF

Introdução à Genética

14.2 Obtenção da sequência de um genoma

CONCEITO-CHAVE A caracterização de genomas inteiros é fundamental para a compreensão de

todo o conjunto de informação genética subjacente à siologia e ao desenvolvimento dos

organismos vivos e para a descoberta de novos genes, tais como aqueles que apresentam

papéis em doenças genéticas humanas.

 

14.2 Obtenção da sequência de um genoma

Quando as pessoas encontram novos territórios, uma de suas primeiras atividades é criar um mapa. Essa prática tem sido frequente para exploradores, geógrafos, oceanógrafos e astrônomos, sendo também utilizada pelos geneticistas. Os geneticistas utilizam muitos tipos de mapas para explorar o terreno de um genoma. Exemplos são os mapas de ligação com base nos padrões de herança de alelos gênicos e os mapas citogenéticos com base na localização de características microscopicamente visíveis, tais como pontos de quebra de rearranjos.

O mapa de mais alta resolução é a sequência completa do DNA do

genoma — ou seja, a sequência completa de nucleotídios A, T, C e G de cada dupla-hélice no genoma. Tendo em vista que a obtenção da sequência completa de um genoma é uma realização tão maciça de um tipo não observado anteriormente na biologia, novas estratégias devem ser utilizadas, todas com base na automação.

 

Transformação das leituras de sequências em uma sequência

montada

Você provavelmente viu um ato de mágica no qual o mágico corta uma página de jornal em muitas partes, mistura-as em seu chapéu, diz algumas palavras mágicas e voilà!, reaparece uma página de jornal intacta. Basicamente, é assim que as sequências genômicas são obtidas. A abordagem é (1) quebrar as moléculas de DNA de um genoma em milhares a milhões de pequenos segmentos sobrepostos mais ou menos aleatórios; (2) ler a sequência de cada pequeno segmento; (3) encontrar, de modo computadorizado, a sobreposição entre os pequenos segmentos na qual suas sequências são idênticas; e (4) continuar a realizar a sobreposição de peças cada vez maiores até que todos os pequenos segmentos estejam ligados

(Figura 14.2). Nesse ponto, a sequência de um genoma está montada.

Por que esse processo requer automação? Para compreender o motivo,

consideraremos o genoma humano, que contém aproximadamente 3 × 109 pb de DNA ou 3 bilhões de pares de bases (3 gigapares de bases = 3 Gpb). Suponha que possamos purificar o DNA intacto de cada um dos 24 cromossomos humanos (X, Y e os 22 autossomos), posicionar em separado cada uma dessas 24 amostras de DNA em uma máquina de sequenciamento e ler as suas sequências diretamente a partir de um telômero até o outro. A obtenção de uma sequência completa seria totalmente direta, como a leitura de um livro com 24 capítulos — apesar de ser um livro muito, muito longo, com 3 bilhões de caracteres (aproximadamente o comprimento de 3.000 romances). Infelizmente, não existe tal máquina de sequenciamento.

Em vez disso, o sequenciamento automatizado é a atual tecnologia de

ponta no sequenciamento do DNA. Inicialmente baseado no pioneiro

método de Sanger de terminação de cadeia didesóxi (ver Capítulo 10), o sequenciamento automatizado atualmente emprega uma diversidade de métodos químicos e de detecção óptica. Os métodos atualmente disponíveis variam no comprimento da sequência de DNA obtida, nas bases determinadas por segundo e na precisão bruta. Para os projetos de sequenciamento em grande escala que buscam analisar grandes genomas individuais ou os genomas de muitos indivíduos ou espécies diferentes, a escolha de um método requer o equilíbrio entre a velocidade, o custo e a precisão.

Reações de sequenciamento individuais (denominadas leituras de

sequenciamento) fornecem sequências de letras que, dependendo da técnica de sequenciamento empregada, variam em média desde aproximadamente 100 a 5.000 bases de comprimento. Tais comprimentos são pequenos em comparação ao DNA de um único cromossomo. Por exemplo, uma leitura individual de 300 bases é apenas 0,0001% do mais longo cromossomo humano (aproximadamente 3 × 108 pb de DNA) e apenas aproximadamente 0,00001% do genoma humano inteiro. Portanto, um grande desafio enfrentado pelo projeto genoma é a montagem da sequência — ou seja, a junção de todas as leituras individuais em uma sequência consenso, uma sequência em relação à qual existe consenso (ou concordância) de que essa é uma representação autêntica da sequência para cada uma das moléculas de DNA naquele genoma.

 

FIGURA 14.2 Para obter uma sequência genômica, múltiplas cópias do genoma são cortadas em pequenos pedaços que são sequenciados. As leituras das sequências resultantes são sobrepostas por meio da correspondência de sequências idênticas em fragmentos diferentes, até que seja produzida uma sequência consenso de cada dupla-hélice do DNA no genoma.

 

Vejamos esses números de um modo razoavelmente diferente para

compreender a escala do problema. Assim como qualquer observação experimental, as máquinas de sequenciamento automatizado nem sempre fornecem leituras de sequência perfeitamente precisas. De fato, tecnologias de sequenciamento mais novas e de mais alta produtividade geram uma frequência maior de erros do que os métodos mais antigos; a taxa de erro pode variar de menos de 1% até tanto quanto 10%, dependendo da tecnologia. Portanto, para assegurar a precisão, os projetos genoma convencionalmente obtêm muitas leituras de sequência independentes de cada par de bases em um genoma. A cobertura de muitas vezes assegura que os erros ao acaso nas leituras não forneçam uma reconstrução falsa da sequência consenso.

Considerando uma leitura de sequência média de aproximadamente 100

bases de DNA e um genoma humano de 3 bilhões de pares de bases, são necessários 300 milhões de leituras independentes para proporcionar uma cobertura média de 10 vezes de cada par de bases. Entretanto, nem todas as sequências são representadas igualmente e, assim, o número de leituras necessárias é maior. A quantidade de informação a ser rastreada é enorme. Portanto, o sequenciamento do genoma necessitou de muitos avanços na automação e na tecnologia da informação.

Quais são os objetivos do sequenciamento de um genoma?

Primeiramente, nos esforçamos para produzir uma sequência consenso que seja uma representação verdadeira e precisa do genoma, iniciando com um organismo individual ou uma linhagem-padrão a partir dos quais o DNA tenha sido obtido. Essa sequência atuará então como uma sequência de referência em relação à espécie. Atualmente, sabemos que existem muitas diferenças na sequência de DNA entre diferentes indivíduos de uma espécie e até mesmo entre os genomas de origem materna e paterna em um único indivíduo diploide. Portanto, nenhuma sequência do genoma representa verdadeiramente o genoma de toda a espécie. Não obstante, a sequência do genoma atua como um padrão ou uma referência à qual outras sequências podem ser comparadas, e pode ser analisada para determinar a informação codificada no DNA, tal como o inventário dos RNA e polipeptídios codificados.