Introdução à Genética
Apêndice B: Recursos de bioinformática para genética e genômica
Recursos de bioinformática para genética e
genômica
“Você certamente encontrará algo se procurar, mas nem sempre é exatamente o que você estava procurando.” – O Hobbit, J. R. R. Tolkien
O campo da bioinformática engloba a utilização de ferramentas computadorizadas para refinar complexos conjuntos de dados. Os dados genéticos e genômicos são tão diversos que se tornou um desafio considerável identificar sites com autoridade em relação a um tipo específico de informação. Além disso, o cenário dos softwares acessíveis pela Internet para a análise dessas informações está constantemente em alteração na medida em que ferramentas novas e mais poderosas são desenvolvidas. Este apêndice destina-se a fornecer alguns pontos de início valiosos para a exploração do universo em rápida expansão dos recursos on-line para genética e genômica.
1. Busca por sites sobre genética e genômica Aqui estão listados diversos recursos centrais que contêm grandes listas de sites relevantes:
• O periódico científico denominado Nucleic Acids Research (NAR)
publica uma edição especial todo mês de janeiro listando uma ampla
diversidade de recursos de bases de dados on-line em
http://nar.oupjournals.org/
• A Virtual Library tem subdivisões de organismos-modelo e genética com
ricos arranjos de recursos de Internet em http://ceolas.org/VL/mo/
• O National Human Genome Research Institute (NHGRI) mantém uma
lista de sites de genoma em http://www.nhgri.nih.gov/10000375/
• O Department of Energy (DOE) mantém um site do Human Genome
Project em http://genomicscience.energy.gov/
• O SwissProt mantém a página de links da Amos, em
http://expasy.ch/alinks.html.
2. Bases de dados gerais
Bases de dados de sequências de ácidos nucleicos e proteínas. Por um acordo internacional, três grupos colaboram para hospedar as sequências de DNA e mRNA primárias de todas as espécies: o National Center for Biotechnology Information (NCBI) hospeda o GenBank, o European Bioinformatics Institute (EBI) hospeda a biblioteca de dados do European Molecular Biology Laboratory (EMBL) e o National Institute of Genetics, no Japão, hospeda o DNA DataBase of Japan (DDBJ).
Registros da sequência primária do DNA, denominados acessos, são
apresentados por grupos de pesquisa individuais. Além de proporcionar o acesso a esses registros de sequências de DNA, esses sites fornecem muitos outros conjuntos de dados. Por exemplo, o NCBI também hospeda o RefSeq, uma síntese resumida de informações sobre as sequências de DNA de genomas totalmente sequenciados e dos produtos gênicos codificados por essas sequências.
Muitas outras características importantes podem ser encontradas nos
sites do NCBI, EBI e da DDBJ. As home pages e alguns outros sites importantes são:
• NCBI: http://www.ncbi.nlm.nih.gov/
• NCBI-Genomas: http://www.ncbi.nlm.nih.gov/Genomes/index.html
• NCBI-RefSeq: http://www.ncbi.nlm.nih.gov/refseq
• The UCSC Genome Bioinformatics site: http://genome.ucsc.edu/.
Esse site excepcional contém referência sobre sequências e montagens de rascunhos relativas a uma grande coleção de genomas, além de uma diversidade de ferramentas para explorá-los. O Genome Browser foca nos cromossomos, demonstrando o trabalho de pesquisadores mundiais. O Gene Sorter demonstra expressão, homologia e outras informações sobre os grupos de genes que podem relacionar-se de muitos modos. Blat é uma ferramenta de alinhamento que mapeia rapidamente sequências no genoma. O Table Browser proporciona o acesso às bases de dados subjacentes:
• EBI: http://www.ncbi.nlm.nih.gov/
• DDBJ: http://www.ddbj.nig.ac.jp/.
A dura realidade é que, com tanta informação biológica, o objetivo de tornar esses recursos on-line “transparentes” para o usuário não é totalmente alcançado. Portanto, a exploração desses sites envolverá a familiarização do usuário com o conteúdo de cada um e a exploração de alguns dos modos pelos quais cada site ajuda o usuário a focar nos seus questionamentos, de maneira a obter a(s) resposta(s) correta(s). Como exemplo do poder desses sites, considere pesquisar sobre uma sequência de nucleotídios no NCBI. As bases de dados em geral armazenam as informações em pastas separadas, denominadas “campos”. Ao utilizar questionamentos que limitam a pesquisa para o campo apropriado, pode ser indagada uma questão mais direcionada. Com a utilização da opção “Limits”, uma frase de questionamento pode ser utilizada para identificar ou localizar uma dada espécie, um tipo de sequência (genômica ou de mRNA), um símbolo gênico ou qualquer outra pesquisa de dados. Os mecanismos de consulta normalmente apresentam capacidade de unir múltiplos questionamentos. Por exemplo: recuperar todos os registros de sequências de DNA da espécie Caenorhabditis elegans E que foram publicados após 1o de janeiro de 2000. Utilizando a opção “History”, os resultados de múltiplos questionamentos podem ser reunidos, de modo que apenas aqueles acertos comuns a múltiplos questionamentos serão recuperados. Por meio da adequada utilização das opções de questionamento disponíveis em um site, uma grande parte de falso-positivos pode ser eliminada de modo computadorizado, sem descartar quaisquer dos acertos relevantes.
Tendo em vista que as previsões de sequências proteicas são uma parte
natural da análise das sequências de DNA e mRNA, esses mesmos sites proporcionam o acesso a uma diversidade de bases de dados de proteínas. Uma base de dados de proteínas importante é SwissProt/TrEMBL. As sequências TrEMBL são previstas automaticamente a partir de sequências de DNA e/ou mRNA. As sequências SwissProt contam com curadoria, o que significa que cientistas especialistas revisam os resultados da análise computadorizada e tomam decisões fundamentadas a respeito dos resultados a ser aceitos ou rejeitados. Além dos registros de sequências primárias de proteínas, SwissProt também oferece bases de dados de domínios proteicos e assinaturas de proteínas (cadeias de sequências de aminoácidos que são característicos de proteínas de um tipo em particular).
A home page de SwissProt é http://www.ebi.ac.uk/swissprot/.
Bases de dados de domínios proteicos. Acredita-se que as unidades funcionais existentes nas proteínas sejam regiões de dobramento local denominadas domínios. A previsão de domínios em proteínas recentemente descobertas é um modo de adivinhar a sua função. Surgiram diversas bases de dados de domínios proteicos que preveem os domínios de modos um pouco diferentes. Algumas das bases de dados de domínios individuais são Pfam, PROSITE, PRINTS, SMART, ProDom, TIGRFAMs, BLOCKS e CDD. A InterPro possibilita a consulta a múltiplas bases de dados de domínios proteicos simultaneamente e apresenta os resultados combinados. Os sites em relação a algumas bases de dados de domínios são:
• InterPro: http://www.ebi.ac.uk/interpro/
• Pfam: http://www.sanger.ac.uk/Software/Pfam/index.shtml
• PROSITE: http://www.expasy.ch/prosite
• PRINTS: http://www.bioinf.man.ac.uk/dbbrowser/PRINTS/
• SMART: http://www.smart.embl-heidelberg.de/
• ProDom: http://www.prodom.prabi.fr/
• TIGRFAMs: http://www.tigr.org/TIGRFAMs/
• BLOCKS: http://www.blocks.fhcrc.org/
• CDD: http://www.ncbi.nlm.nih.gov/Structure/cdd/cdd.shtml.
Bases de dados de estruturas proteicas. A representação das estruturas proteicas tridimensionais se tornou um aspecto importante da análise molecular global. Bases de dados de estruturas tridimensionais estão disponíveis a partir dos principais sites de bases de dados de sequências de DNA/proteína e de bases de dados de estruturas proteicas independentes, notavelmente a Protein DataBase (PDB). O NCBI possui um aplicativo denominado Cn3D que auxilia na visualização dos dados da PDB:
• PDB: http://www.rcsb.org/pdb/
• Cn3D: http://www.ncbi.nlm.nih.gov/Structure/CN3D/cn3d.shtml.
3. Bases de dados especializados Bases de dados genéticos de organismos específicos. Com a finalidade de reunir algumas classes de informação genética e genômica, especialmente informações fenotípicas, é necessário o conhecimento especializado de uma espécie em particular. Portanto, surgiram os MOD (bases de dados de organismos-modelo; do inglês, model organism databases) para preencher esse papel em relação aos principais sistemas genéticos. Essas incluem bases de dados de Saccharomyces cerevisiae (SGD), Caenorhabditis elegans (WormBase), Drosophila melanogaster (FlyBase), do peixe-zebra Danio rerio (ZFIN), do camundongo Mus musculus (MGI), do rato Rattus norvegicus (RGD), de Zea mays (MaizeGDB) e Arabidopsis thaliana (TAIR). As home pages desses MOD podem ser encontradas em:
• SGD: http://genome-www.stanford.edu/Saccharomyces/
• WormBase: http://www.wormbase.org/
• FlyBase: http://flybase.org/
• ZFIN: http://zfin.org/
• MGI: http://www.informatics.jax.org/
• RGD: http://rgd.mcw.edu/
• MaizeGDB: http://www.maizegbd.org
• TAIR: http://www.arabidopsis.org/.
Bases de dados de genética e genômica humanas. Em virtude da importância da genética humana na clínica, bem como na pesquisa básica, surgiu um conjunto diverso de bases de dados de genética humana. Esse conjunto inclui uma base de dados de doenças genéticas humanas denominada Online Mendelian Inheritance in Man (OMIM), uma base de dados com breve descrição dos genes humanos denominada GeneCards, uma compilação de todas as mutações conhecidas nos genes humanos denominada Human Gene Mutation Database (HGMD), uma base de dados do mapa de sequências atual do genoma humano denominada Golden Path e alguns links para bases de dados de doenças genéticas humanas:
• OMIM: http://www.omim.org
• GeneCards: http://genecards.org
• HGMD: http://www.hgmd.org
• Golden Path: http://genome.ucsc.edu/
• Online Genetic Support Groups: http://mostgene.org/genetics/genetic-
support-groups-directory/
• Genetic Disease Information:
http://www.geneticalliance.org/diseaseinfo/search.html
• The Encyclopedia of Genome Elements (ENCODE):
http://genome.ucsc.edu/ENCODE
• Cancer Genome Project: http://cancergenome.nih.gov/.
Bases de dados do Projeto Genoma. Os projetos genoma individuais também têm sites, nos quais demonstram os seus resultados, com frequência incluindo informações que não aparecem em qualquer outro site no mundo. Os maiores centros de genoma com financiamento público incluem:
• Whitehead Institute/MIT Center for Genome Research: http://www-
genome.wi.mit.edu/
• Washington University School of Medicine Genome Sequencing
Center: http://genome.wustl.edu/
• Baylor College of Medicine Human Genome Sequencing Center:
http://www.hgsc.bcm.tmc.edu
• Sanger Institute: http://www.sanger.ac.uk/
• DOE Joint Genomics Institute: http://www.jgi.doe.gov/
• International HapMap Project: http://hapmap.ncbi.nlm.nih.gov/.
4. Relações dos genes nas bases de dados e
entre elas
Os produtos gênicos podem relacionar-se por compartilharem uma origem evolutiva comum, uma função comum ou por participarem da mesma via.
BLAST | Identificação de similaridades na sequência. As evidências em relação a uma origem evolutiva comum advêm da identificação de similaridades entre duas ou mais sequências. Uma das ferramentas mais importantes para a identificação de tais similaridades é a BLAST (Basic Local Alignment Search Tool), que foi desenvolvida pelo NCBI. A BLAST é realmente uma série de programas e bases de dados relacionados, na qual as correspondências locais entre trechos longos de sequências podem ser identificadas e classificadas. A consulta a sequências de DNA ou proteínas similares por meio da BLAST é uma das primeiras coisas que um pesquisador faz com um gene recém-sequenciado. Diferentes bases de dados de sequências podem ser acessadas e organizadas pelo tipo de sequência (genoma de referência, atualizações recentes, EST etc.) e uma espécie ou grupo taxonômico em particular pode ser especificado. Uma rotina da BLAST correlaciona uma sequência indagada de nucleotídios traduzida em todos os seis quadros com uma base de dados de sequência de proteínas. Outra correlaciona uma sequência indagada de proteína com a tradução de seis quadros de uma base de dados de sequências de nucleotídios. Outras rotinas da BLAST são customizadas para identificar correspondências de padrões de sequências curtas ou alinhamentos pareados, para triar segmentos de DNA do tamanho do genoma e assim por diante, e podem ser acessadas por meio da mesma página:
• NCBI-BLAST: http://www.ncbi.nlm.nih.gov/BLAST/.
Bases de dados de ontologia de função. Outra abordagem para o desenvolvimento de relações entre os produtos gênicos é por meio da atribuição de papéis funcionais a esses produtos com base na evidência experimental ou previsão. A apresentação de um modo comum para descrever esses papéis, independentemente do sistema experimental é, então, de grande importância. Um grupo de cientistas de diferentes bases de dados está trabalhando para desenvolver um conjunto comum de termos dispostos hierarquicamente – uma ontologia – em relação à função (evento bioquímico), ao processo (evento celular para o qual uma proteína contribui) e à localização subcelular (localização de um produto em uma célula) como um modo de descrever as atividades de um produto gênico. Essa ontologia em particular é denominada Ontologia Gênica (GO) e muitas diferentes bases de dados de produtos gênicos atualmente incorporam os termos da GO. Uma descrição total pode ser encontrada em:
• http://www.geneontology.org/.
Bases de dados de vias. Ainda outro modo de relacionar os produtos uns aos outros é por meio da sua atribuição a etapas nas vias bioquímicas ou celulares. Diagramas de vias podem ser utilizados como modos organizados de apresentar as relações desses produtos entre si. Algumas das tentativas mais avançadas de produzir as referidas bases de dados de vias incluem a Kyoto Encyclopedia of Genes and Genomes (KEGG) e a Signal Transduction Database (TRANSPATH):
• KEGG: http://www.genome.ad.jp/kegg
• TRANSPATH: http://genexplain.com/transpath-1.
OceanofPDF.com