O Poder do Pensamento Matemático
15. A elipse de Galton
GALTON HAVIA MOSTRADO que a regressão à média atuava sempre que o fenômeno em estudo era influenciado pelo jogo das forças do acaso. Mas qual a intensidade dessas forças em comparação com o efeito da hereditariedade?
Para ouvir o que os dados estavam lhe dizendo, Galton teve de colocá-los numa forma gráfica, que lhe revelasse mais que uma coluna de números. Mais tarde ele recordou: “Comecei com uma folha de papel quadriculada, com uma escala horizontal no alto, como referência para as estaturas dos filhos, e outra lateral de cima para baixo, para as estaturas dos pais, e aí punha uma marca a lápis no ponto apropriado da estatura de cada filho em relação à
de seu pai.”1
Esse método de visualizar os dados é o descendente espiritual da geometria analítica de René Descartes, que nos pede que pensemos em pontos no plano como pares de números, uma coordenada x e uma coordenada y, juntando álgebra e geometria num abraço apertado no qual estão agarradas desde então.
Cada par pai-filho tem um par de números a ele associado, ou seja, a altura do pai seguida da altura do filho. Meu pai tem 1,82 metro e eu também – 182 centímetros, cada um –, então, se fizéssemos parte do conjunto de dados de Galton teríamos sido anotados como (182,182). E Galton teria registrado nossa existência fazendo uma marca na sua folha de papel com coordenada x 182 e coordenada y 182. Cada dupla de pai e filho, nos volumosos registros de Galton, requeria uma marca diferente no papel, até que, no fim, a folha contivesse um vasto chuveiro de pontos representando toda a gama da variação de estatura. Galton inventara o tipo
de gráfico que hoje chamamos de gráfico de dispersão.a
Gráficos de dispersão são espetacularmente bons para revelar a relação entre duas variáveis. Basta olhar qualquer revista científica contemporânea, e você verá grande quantidade deles. O fim do século XIX foi uma espécie de idade do ouro da visualização de dados. Em 1869, Charles Minard fez seu famoso gráfico mostrando o encolhimento do Exército de Napoleão em seu trajeto para a Rússia e a subsequente retirada, muitas vezes chamado o maior gráfico de dados já feito. Por sua vez, ele descendia do gráfico coxcomb
(“crista de galo”) de Florence Nightingale,b mostrando em termos visuais que a maioria dos soldados britânicos na Guerra da Crimeia havia sido morta por infecções, e não pelos russos.
O coxcomb e o gráfico de dispersão jogam com nossos potenciais cognitivos. Nosso cérebro é meio ruim para observar colunas de números, mas absolutamente genial para localizar padrões e informações num campo de visão bidimensional.
Em alguns casos, isso é fácil. Por exemplo, suponha que todo filho e seu pai tivessem alturas iguais, como acontece comigo e com meu pai. Isso representa uma situação em que o acaso não desempenha nenhum papel, e a sua estatura é completamente determinada pelo seu patrimônio. Todos os pontos no gráfico de dispersão teriam coordenadas x e y iguais; em outras palavras, eles ficariam sobre a diagonal cuja equação é x = y.
Note que a densidade dos pontos é maior perto do meio e menor perto dos extremos. Há mais homens com 1,73 metro (173 centímetros) que com 1,82 metro ou 1,60 metro.
E no extremo oposto, quando as alturas de pais e filhos são totalmente independentes? Nesse caso, o gráfico de dispersão ficaria mais ou menos assim:
Esse quadro, ao contrário do primeiro, não mostra nenhuma tendência na direção da diagonal. Se você restringir sua atenção aos filhos cujos pais tinham 1,82 metro (182 centímetros), correspondendo à fatia vertical na metade direita do gráfico, os pontos que medem a altura dos filhos ainda estão centrados em 1,73 metro. Dizemos que a expectativa condicional da altura do filho (isto é, a altura que ele terá em média, dado que seu pai tenha 1,82 metro) é a mesma que a expectativa incondicional (a altura média dos filhos computada sem nenhuma restrição quanto ao pai). É esse o aspecto que teria tido a folha de papel de Galton se não houvesse nenhuma diferença hereditária afetando a altura. É a regressão à média na sua forma mais intensa, os filhos de pais altos regridem todo o caminho até a média e acabam não sendo mais altos que os filhos dos baixinhos.
Mas o gráfico de dispersão de Galton não tinha o aspecto de nenhum desses dois casos extremos. Em vez disso, era algo intermediário:
Qual a posição no gráfico do filho médio de um pai com 1,82 metro? Desenhei uma fatia vertical para mostrar quais pontos do gráfico de dispersão correspondem a esses pares pais-filhos.
Você pode ver que os pontos próximos da fatia do “pai de 1,82 metro” estão mais concentrados abaixo da diagonal do que acima dela, de modo que os filhos são em média mais baixos que os pais. De outro lado, os pontos apresentam claramente uma tendência a cair, em sua maioria, acima de 1,73 metro, a altura do homem médio. No conjunto de dados mostrados no gráfico, a altura média desses filhos é um pouco abaixo de 1,80 metro: mais altos que a média, mas não altos como o pai. Você está olhando para um quadro de regressão à média.
Galton logo observou que seus gráficos de dispersão, gerados pela inter-relação entre hereditariedade e acaso, tinham uma estrutura geométrica que podia ser qualquer coisa, menos aleatória. Eles pareciam inscritos, mais ou menos, numa elipse, tendo como centro o ponto onde tanto pai quanto filho possuíam a altura média.
A forma de elipse inclinada dos dados fica bastante clara nos dados brutos na tabela reproduzida do artigo de Galton intitulado “Regression toward mediocrity in hereditary stature”, de 1886. Veja a figura formada pelas entradas diferentes de zero na tabela a seguir. A tabela também deixa claro que eu não contei toda a história acerca do conjunto de dados de Galton. Por exemplo, sua coordenada y não é “altura do pai”, mas “a média da altura do pai
com 1,08 vez a altura da mãe”,c o que Galton chamou de “midparent”, que pode ser traduzido livremente como “média do casal de pais”.
Na verdade Galton fez mais. Com cuidado, ele desenhou curvas no gráfico, ao longo das quais a densidade dos pontos era aproximadamente constante. Curvas desse tipo são chamadas curvas isopléticas, que ligam pontos de igual valor (o prefixo latino iso significa “igual” ou “o mesmo”). Essas curvas são bem familiares para você, ainda que você nem sempre saiba seu nome. Se você pegar um mapa dos Estados Unidos e desenhar uma curva passando por todas as cidades onde hoje a temperatura máxima é exatamente 25 graus, 10 graus ou qualquer outro valor fixado, obterá as familiares curvas de temperatura num mapa climático: são curvas especiais, chamadas curvas isotérmicas ou isotermas. Um mapa climático realmente detalhado pode também incluir curvas isobáricas, ligando pontos de mesma pressão barométrica, ou curvas isonéficas, de igual nebulosidade. Se medirmos a altitude, em vez da temperatura, teremos as curvas de nível, às vezes também chamadas de isoípsas. O mapa a seguir contém curvas isopléticas que mostram a média anual de tempestades de neve pelos
Estados Unidos:2
NOTA: Ao calcular as Medians, as entradas foram tomadas referindo-se ao meio dos quadrados em que estão. A razão de os cabeçalhos variarem 62.2, 63.2, …, em vez de 62.5, 63.5, …, é que as observações estão desigualmente distribuídas entre 62 e 63, 63 e 64, e assim por diante, havendo forte tendência em favor de polegadas inteiras. Após cuidadosa consideração, concluí que os cabeçalhos, conforme adotados, satisfaziam mais as condições. Essa desigualdade não era aparente no caso dos casais de pais.
* Optamos por reproduzir a tabela como a original, mantendo os mesmo valores em polegadas, uma vez que o que importa para o autor é examinar a figura formada pelos dados. O termo “median” provavelmente se refere à “média”, e não à “mediana” como a utilizamos atualmente. (N.R.T.)
A curva isoplética não foi invenção de Galton. O primeiro mapa de isopléticas já
publicado3 foi produzido em 1701 por Edmond Halley, o Astrônomo Real Britânico, que vimos pela última vez quando explicava ao rei como fixar corretamente o preço das
anuidades.d Navegadores já sabiam que o norte magnético e o norte verdadeiro nem sempre coincidem. Compreender exatamente como e onde as discordâncias apareciam era uma questão crucial para as viagens oceânicas terem sucesso. As curvas no mapa de Halley eram isogônicas, mostrando aos marinheiros onde as discrepâncias ente o norte magnético e o norte verdadeiro eram constantes. Os dados baseavam-se em medições feitas por Halley a bordo do Paramore, que cruzou diversas vezes o Atlântico com o próprio Halley ao leme. (Esse sujeito realmente sabia como manter-se ocupado no intervalo entre os cometas.)
Galton encontrou uma regularidade surpreendente: suas isopléticas eram elipses, uma contida dentro da seguinte, todas com o mesmo centro. Era como um mapa de nível de uma montanha perfeitamente elíptica, com o pico no par de alturas observadas com mais frequência na amostra de Galton: a altura média tanto para pais quanto para filhos. A montanha nada mais é que a versão tridimensional do chapéu de gendarme que De Moivre estudara. Em linguagem atual, nós a chamamos de bivariada de distribuição normal.
Quando a altura do filho não tem a menor relação com a altura dos pais, como no segundo gráfico de dispersão examinado, as elipses de Galton são todas círculos, e o gráfico tem um aspecto aproximadamente redondo. Quando a altura do filho é completamente determinada pela hereditariedade, sem nenhum elemento de acaso envolvido, como no primeiro gráfico, os dados se distribuem ao longo de uma reta, que poderia ser pensada como uma elipse que ficou a mais elíptica possível. Entre os extremos, temos elipses de vários níveis de afilamento. Esse afilamento, que os geômetras clássicos chamam de excentricidade da elipse, é uma medida de quanto a altura do pai determina a do filho. Uma excentricidade alta significa que a hereditariedade é possante e a regressão à média é fraca; uma excentricidade baixa significa o contrário, que a regressão à média predomina. Galton chamou essa medida de correlação, termo que ainda usamos. Se a elipse de Galton é quase redonda, a correlação é próxima de zero; quando a elipse é afilada, alinhada ao longo do eixo nordeste-sudoeste, a correlação fica próxima de um. Por meio da excentricidade – uma grandeza geométrica pelo menos tão antiga quanto o trabalho de Apolônio de Perga no século III AEC – Galton descobrira um modo de medir a associação entre duas variáveis, e ao fazê-lo solucionara um problema no desenvolvimento da biologia do século XIX: a quantificação da hereditariedade.
Uma atitude cética apropriada agora exige que você pergunte: e se o gráfico de dispersão não tiver aspecto de elipse? E aí? Há uma resposta pragmática: os gráficos de dispersão de conjuntos de dados da vida real frequentemente se distribuem em elipses aproximadas. Isso nem sempre ocorre, mas se dá com frequência suficiente para tornar a técnica amplamente aplicável. Observamos o aspecto que tem o gráfico da parcela de eleitores que votou em John Kerry em 2004 em relação à parcela que Obama obteve em 2008. Cada ponto representa um único distrito da Câmara:
A elipse é clara de se ver, e é bastante afilada. A parcela de votos em Kerry está altamente correlacionada ao voto em Obama. O gráfico flutua visivelmente acima da diagonal, refletindo o fato de Obama, de forma geral, ter se saído melhor que Kerry.
Um gráfico de vários anos de variações diárias do preço das ações do Google e da GE tem a seguinte aparência:
Eis um quadro que já vimos, a pontuação média em exames do ensino médio em relação a despesas de ensino para um grupo de faculdades da Carolina do Norte:
E aqui estão os cinquenta estados americanos4 dispostos num gráfico (página seguinte) de dispersão segundo a renda média e a parcela de votos para George W. Bush na eleição presidencial de 2004; os ricos estados liberais, como Connecticut, estão embaixo, do lado direito, e os estados republicanos, com recursos mais modestos, estão na parte superior esquerda.
Esses conjuntos de dados vêm de fontes muito diferentes, mas os quatro gráficos de dispersão se arranjam no mesmo formato vagamente elíptico apresentado pela altura de pais e filhos. Nos três primeiros casos, a correlação é positiva: um aumento numa das variáveis é associado a um aumento na outra, e a elipse está disposta de nordeste a sudoeste. No último quadro, a correlação é negativa: em geral, estados ricos tendem a se inclinar para os democratas, e a elipse aponta de noroeste para sudeste.
A eficácia irracional da geometria clássica
Para Apolônio e os geômetras gregos, elipses eram seções cônicas: superfícies obtidas cortando-se um cone ao longo de um plano. Kepler mostrou (embora a comunidade astronômica tenha levado algumas décadas para aceitar) que os planetas percorriam órbitas elípticas, e não circulares, como se pensava antes. Agora, a mesmíssima curva surge como a forma natural englobando a altura de pais e filhos. Por quê? Não porque haja algum cone oculto governando a hereditariedade, e que, quando cortado no ângulo certo, produz as elipses de Galton. Nem porque alguma forma de gravidade genética impõe a forma elíptica dos gráficos de Galton via leis newtonianas da mecânica.
A resposta está numa propriedade fundamental da matemática – em certo sentido, a mesma propriedade que tem tornado a matemática tão magnificamente útil para os cientistas. Em matemática há muitos, muitos objetos complicados, e apenas alguns simples. Então, se você tem um problema cuja solução admite uma descrição matemática simples, há apenas algumas poucas possibilidades de solução. As entidades matemáticas mais simples são portanto ubíquas, forçadas a desempenhar tarefas múltiplas como solução para todos os tipos de problema científico.
As curvas mais simples são as retas. Está claro que as retas estão por toda parte na natureza, desde as arestas dos cristais até as trajetórias de corpos em movimento na ausência de força. As mais simples das curvas seguintes são aquelas definidas por equações
quádricas,e f nas quais não mais que duas variáveis são sempre multiplicadas entre si. Assim, elevar uma variável ao quadrado, ou multiplicar duas variáveis diferentes, é permitido, mas elevar uma variável ao cubo, ou multiplicar uma variável pelo quadrado da outra, é estritamente proibido. Curvas dessa classe, inclusive as elipses, ainda são chamadas de seções cônicas em deferência à história. No entanto, os geômetras algebristas de visão mais
progressista as chamam de quádricas.g Há montes de equações quádricas: qualquer uma que tenha a forma
A x2 + B xy + C y2 + D x + E y + F = 0,
para alguns valores das seis constantes A, B, C, D, E e F. (O leitor que queira pode verificar que nenhum tipo de expressão algébrica é permitido, sujeito à nossa exigência de que só podemos multiplicar duas variáveis entre si, jamais três.) Isso parece ser uma porção de escolhas – na verdade, infinitas! Mas essas quádricas, se nos ativermos a duas variáveis x e y,
acabam caindo em três classes principais: elipses, parábolas e hipérboles.h i Eis a aparência delas:
Encontramos essas três curvas repetidas e repetidas vezes como solução de problemas científicos, não só nas órbitas dos planetas, mas nos desenhos ideais de espelhos curvos, nos arcos dos projéteis e na forma do arco-íris.
Ou mesmo para além da ciência. Meu colega Michael Harris, distinto teórico dos números do Institut de Mathématiques de Jussieu, em Paris, tem uma teoria de que três dos principais
romances de Thomas Pynchon5 são governados pelas três seções cônicas: O arco-íris da gravidade é sobre parábolas (todos aqueles foguetes lançados e que caem!); Mason e Dixon, sobre elipses; e Contra o dia, sobre hipérboles. Para mim, essa parece uma teoria organizadora desses romances tão boa quanto qualquer outra que eu tenha encontrado. Decerto Pynchon, que se graduou em física e adora fazer referências em seus romances a fitas de Möbius e quatérnions, sabe muito bem o que são as seções cônicas.
Galton observou que as curvas por eles desenhadas à mão pareciam elipses, mas não era geômetra o bastante para ter certeza de que era exatamente esta curva a responsável, e não alguma outra figura de formato mais ou menos ovoide. Estaria ele permitindo que seu desejo de uma teoria universal e elegante afetasse sua percepção dos dados que havia coletado? Não seria o primeiro nem o último cientista a cometer esse erro. Galton, cuidadoso como sempre, buscou o conselho de J.D. Hamilton Dickson, matemático de Cambridge. Chegou a ponto de ocultar a origem de seus dados, apresentando o problema como se fosse oriundo da física, para evitar predispor Dickson no sentido de uma conclusão específica. Para seu deleite, Dickson rapidamente confirmou que a elipse era não só a curva sugerida pelos dados, mas a curva exigida pela teoria. Escreveu ele:
O problema pode não ser difícil para um matemático talentoso, mas eu decerto jamais senti um fulgor de lealdade e respeito
para com a soberania e o grande alcance da análise matemática como quando sua resposta chegou, confirmando, por puro
raciocínio matemático, minhas várias e laboriosas conclusões estatísticas, com muito mais minúcia do que eu ousara esperar,
porque os dados se mostravam um tanto grosseiros, e eu tive de apará-los com delicada cautela.6
Bertillonagem
Galton logo compreendeu que a ideia de correlação não se limitava ao estudo da hereditariedade; aplicava-se a qualquer par de qualidades que pudessem conter alguma relação entre si.
Acontece que Galton estava de posse de uma maciça base de dados referentes a medições anatômicas, do tipo que estavam na moda no fim do século XIX, graças ao trabalho de Alphonse Bertillon. Este era um criminologista francês com o espírito muito semelhante ao de Galton. Dedicava-se a uma visão rigorosamente quantitativa da vida humana, confiante nos
benefícios que tal abordagem podia produzir.j Em particular, Bertillon estava perplexo pelo modo fortuito e não sistemático com que a polícia francesa identificava suspeitos de crimes. Seria melhor e mais moderno, raciocinou Bertillon, anexar a cada celerado francês uma série de medidas numéricas: comprimento e largura da cabeça, comprimento dos dedos e dos pés, e assim por diante. No sistema de Bertillon, cada suspeito detido era medido e seus dados preenchidos em cartões e armazenados para uso futuro. Se o mesmo homem fosse novamente apanhado, identificá-lo era simples questão de pegar o medidor, registrar seus números e compará-los com os cartões no arquivo. “Aha, senhor 15-6-56-42, achou que ia se safar, não é?” Você pode substituir seu nome por um pseudônimo, mas não há pseudônimo para o formato da cabeça.
O sistema de Bertillon, tão de acordo com o espírito analítico da época, foi adotado pela Prefeitura de Polícia de Paris em 1883, e logo se espalhou pelo mundo. No seu auge, a bertillonagem tinha domínio sobre todos os departamentos de polícia, de Bucareste a Buenos Aires. “O gabinete de Bertillon”, escreveu Raymond Fosdick em 1915, “tornou-se a marca
distintiva da organização policial moderna.”7 No seu tempo, a prática era tão comum e incontroversa nos Estados Unidos que o juiz Anthony Kennedy a mencionou em sua opinião majoritária no caso Maryland vs. King, em 2013, permitindo aos estados tirar amostras de DNA de detidos por assalto à mão armada. Na opinião de Kennedy, uma sequência de DNA era simplesmente mais uma sequência de dados pontuais anexados a um suspeito, uma espécie de cartão de Bertillon do século XXI.
Galton perguntou-se: seria a escolha de medições de Bertillon a melhor possível? Ou seria possível identificar suspeitos com mais exatidão fazendo-se ainda outras medições? O problema, Galton deu-se conta, é que as medidas corporais não são inteiramente independentes. Se você já mediu as mãos de um suspeito, será que você realmente precisa medir também os seus pés? Você sabe o que dizem sobre homens de mãos grandes: seus pés, estatisticamente falando, também têm probabilidade de ser maiores que a média. Então, a adição do comprimento dos pés não acrescenta tanta informação ao cartão de Bertillon quanto seria de esperar. Adicionar mais e mais medições – se forem mal escolhidas – pode fornecer retornos cada vez mais reduzidos.
Para estudar esse fenômeno Galton fez outro gráfico de dispersão, dessa vez de altura
versus “cúbito”,8 a distância do cotovelo até a ponta do dedo médio. Para sua perplexidade, viu o mesmo padrão elíptico que surgira a partir da altura de pais e filhos. Mais uma vez, ele demonstrara graficamente que as duas variáveis, altura e cúbito, estavam correlacionadas, mesmo que uma não determinasse estritamente a outra. Se duas medidas estão altamente correlacionadas (como o comprimento do pé esquerdo e comprimento do pé direito), há pouco sentido em perder tempo registrando os dois números. As melhores medidas a serem tiradas são aquelas que não estão correlacionadas. E as correlações relevantes poderiam ser computadas a partir da vasta lista de dados antropométricos que Galton já havia coletado.
Acontece que a ideia da correlação de Galton não resultou em uma melhoria ampla do sistema de Bertillon. Isso em grande parte se deu por causa do próprio Galton, que defendia um sistema concorrente, a datiloscopia – o que hoje chamamos de impressões digitais. Como o sistema de Bertillon, as impressões digitais reduziam um suspeito a uma lista de números ou símbolos que podiam ser marcados sobre um cartão, classificados e arquivados. Mas as impressões digitais tinham certas vantagens óbvias; as digitais de um criminoso muitas vezes estavam acessíveis para medição em circunstâncias nas quais o próprio criminoso não se encontrava presente. Esse problema foi vividamente demonstrado pelo caso de Vincenzo Peruggia, que roubou a Mona Lisa do Louvre, numa ousada ação em plena luz do dia, em 1911. Peruggia já havia sido preso em Paris, mas seu cartão de Bertillon, devidamente registrado, arquivado segundo comprimentos e larguras de suas várias características físicas, não foi de grande serventia. Tivessem os cartões incluído informação datiloscópica, as impressões deixadas por Peruggia na moldura descartada da Mona Lisa o teriam identificado
imediatamente.k
Aparte: correlação, informação, compressão, Beethoven
Menti um pouquinho sobre o sistema de Bertillon. Na verdade, ele não registrava o valor numérico exato de cada característica física, mas apenas se era pequena, média ou grande. Quando você mede o comprimento do dedo, divide os criminosos em três grupos: dedos pequenos, dedos médios e dedos grandes. E aí, quando você mede o cúbito, divide cada um desses três grupos em três subgrupos, de modo que os criminosos acabam se dividindo em nove, ao todo. Ao fazer cinco medições no sistema básico de Bertillon, dividimos os criminosos em
3 × 3 × 3 × 3 × 3 = 35 = 243
grupos, e para cada um desses 243 há sete opções de olho e cor de cabelo. Assim, no final, Bertillon classificava os suspeitos em 35 × 7 = 1.701 minúsculas categorias. Quando se prendem mais de 1.701 pessoas, algumas categorias inevitavelmente conterão mais de um suspeito; mas a quantidade de gente em cada categoria é provavelmente bem pequena, diminuta o bastante para que um gendarme percorra os cartões e ache uma fotografia combinando com o homem acorrentado à sua frente. Se você se preocupasse em acrescentar outras medidas, triplicando o número de categorias toda vez que o fizesse, facilmente criaria categorias tão pequenas que não haveria dois criminosos – e, sob esse aspecto, dois franceses de qualquer tipo – partilhando o mesmo código de Bertillon.
É um artifício hábil acompanhar algo complicado como a forma de um ser humano com uma curta corrente de símbolos. O artifício não se limita à fisionomia humana. Sistema semelhante,
chamado código de Parsons,l é usado para classificar melodias musicais. Eis como ele funciona. Pegue uma melodia – uma que todos conheçamos, como “Hino à alegria”, de
Beethoven, o glorioso final na Nona Sinfonia. Marcamos a primeira nota com um l. E para
cada nota posterior, marca-se um dos três símbolos seguintes: u , se a nota em questão sobe em relação à nota anterior, d, se ela desce, ou r, se se repete a nota que veio antes. As primeiras
duas notas do “Hino à alegria” são iguais, então você começa com lr. Então uma nota mais alta
seguida por outra mais alta ainda: l ruu. Em seguida repete-se esta última nota mais alta, e aí vem uma sequência de quatro descidas. O código para todo esse segmento de abertura é
lruurdddd .
Não é possível repetir o som da obra-prima de Beethoven a partir do código de Parsons, da mesma forma que não se pode esboçar o retrato de um assaltante de bancos a partir de suas medidas de Bertillon. Mas se você tem um gabinete cheio de músicas categorizadas pelo código de Parsons, a sequência de símbolos faz um belo serviço na identificação de determinada melodia. Se, por exemplo, você tem o “Hino à alegria” na cabeça, mas não se
lembra do nome, pode entrar num website como a Musipedia e digitar lruurdddd . Essa breve sequência basta para reduzir as possibilidades ao “Hino à alegria” ou Concerto para piano n.12 de Mozart. Se você assobiar para si mesmo meras dezessete notas, há
316 = 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 × 3 = 43.046.721
diferentes códigos de Parsons. Isso decerto é mais que a quantidade de melodias já gravadas, e faz com que seja bastante raro duas canções com o mesmo código. Toda vez que você adiciona um símbolo novo, está multiplicando o número de códigos por três; e, graças ao milagre do crescimento exponencial, um código bastante breve lhe dá uma capacidade estarrecedoramente alta de discriminar duas canções.
Mas há um problema. Voltando a Bertillon, e se descobríssemos que os homens que chegam à delegacia de polícia sempre têm cúbitos na mesma categoria que seus dedos? Então, o que parecem ser nove alternativas para as primeiras duas medidas na verdade são apenas três: dedo pequeno/cúbito pequeno, dedo médio/cúbito médio, dedo grande/cúbito grande; das gavetas no gabinete de Bertillon ficam vazios. O número total de categorias na realidade não é 1.701, e sim meros 567, com uma correspondente redução da nossa capacidade de distinguir um criminoso de outro. Outra maneira de pensar isso é: achávamos que fazíamos cinco medições, mas, dado que o cúbito combina exatamente com a mesma informação que o dedo, na realidade fazíamos apenas quatro. É por isso que o número de cartões possíveis é reduzido de 7 × 35 = 1.701 para 7 × 34 = 567. (Lembrando que o 7 conta as possibilidades de cor de cabelo e dos olhos.) Mais relações entre as medidas tornariam o número efetivo de categorias ainda menor e o sistema de Bertillon ainda mais fraco.
A grande sacada de Galton foi que a mesma coisa se aplica ainda que o comprimento do dedo e o comprimento do cúbito não sejam idênticos, mas apenas correlacionados. Correlações entre as medidas tornam o código de Bertillon menos informativo. Mais uma vez, a aguçada percepção de Galton forneceu-lhe uma espécie de presciência intelectual. O que ele captou foi, em forma embrionária, um modo de pensar que viria a ser totalmente formalizado apenas meio século depois, por Claude Shannon, na sua teoria da informação. Como vimos no Capítulo 13, a medida formal da informação concebida por Shannon era capaz de fornecer limites para a rapidez com que bits podiam fluir através de um canal ruidoso. De forma muito parecida, a teoria de Shannon fornece um meio de captar a extensão na qual uma correlação entre variáveis reduz a capacidade de informação de um cartão. Em termos modernos diríamos que, quanto mais correlacionadas as medidas, menos informação (no sentido exato de Shannon) transmite um cartão de Bertillon.
Hoje, embora Bertillon tenha sumido, a ideia de que a melhor maneira de registrar a identidade é uma sequência de números adquiriu total predominância. Vivemos num mundo de informação digital. E a percepção de que a correlação reduz a quantidade efetiva de informação surgiu como princípio organizador central. Uma fotografia, que costumava ser um padrão de pigmentos numa folha de papel quimicamente revestida, agora é uma sequência de números, cada qual representando o brilho e a cor de um pixel. Uma imagem captada numa câmera de 4 megapixels é uma lista de 4 milhões de números – o que é uma capacidade de memória nada pequena para o dispositivo que está batendo a foto. Mas esses números são altamente correlacionados entre si. Se um pixel é verde brilhante, o vizinho tem probabilidade de ser também. A informação real contida na imagem é muito inferior a 4 milhões de números
– e é precisamente esse fato que possibilitam a compressão, a tecnologia matemática que permite que imagens, vídeos, músicas e textos possam ser armazenados em espaços muito menores do que se poderia imaginar. A presença de correlação torna a compressão possível. Realizá-la envolve ideias muito mais modernas, como a teoria de ondaletas (wavelets) desenvolvida nas décadas de 1970 e 1980 por Jean Morlet, Stéphane Mallat, Yves Meyer, Ingrid Daubechies e outros. A área da sensação comprimida está se desenvolvendo muito depressa. Teve início em 2005, com um artigo de Emmanuel Candès, Justin Romberg e Terry Tao, e logo se tornou um subcampo ativo da matemática aplicada.
O triunfo da mediocridade no clima
Ainda existe uma ponta solta que precisamos amarrar. Vimos como a regressão à média explica o “triunfo da mediocridade” que Secrist descobriu. E quanto ao triunfo da mediocridade que Secrist não observou? Quando registrou as temperaturas das cidades americanas, ele descobriu que as mais quentes, em 1922, ainda eram as mais quentes em 1931. Essa observação é crucial para seu argumento de que a regressão em empreendimentos nos negócios era algo específico da conduta humana. Se a regressão à média é um fenômeno universal, por que as temperaturas também não a seguem?
A resposta é simples. Seguem, sim.
A tabela a seguir mostra as temperaturas médias em janeiro, medidas em graus Fahrenheit, em treze estações de clima no sul de Wisconsin, sendo que duas delas não estão a mais de uma
hora de carro uma da outra.n
Jan 2011 Jan 2012
Clinton 15,9 23,5 Cottage Grove 15,2 24,8 Fort Atkinson 16,5 24,2 Jefferson 16,5 23,4 Lake Mills 16,7 24,4 Lodi 15,3 23,3 Aeroporto de Madison 16,8 25,5 Arboreto de Madison 16,6 24,7 Madison, Charmany 17,0 23,8 Mazomanie 16,6 25,3 Portage 15,7 23,8 Richland Center 16,0 22,5 Stoughton 16,9 23,9
Quando se faz um gráfico de dispersão no estilo de Galton dessas temperaturas, vê-se em geral que as cidades de temperaturas mais altas em 2011 tendiam a ter também as temperaturas mais altas em 2012.
Mas as três estações de temperaturas mais altas em 2011 (Charmany, aeroporto de Madison e Stoughton) acabaram sendo: a mais quente, a sétima mais quente e a oitava mais quente em 2012. Ao mesmo tempo, as três estações mais frias em 2011 (Cottage Grove, Lodi e Portage) tiveram temperaturas relativamente mais altas. Portage empatou como a quarta mais fria, Lodi era a segunda mais fria e Cottage Grove, em 2012, esteve na realidade mais quente que a maioria das outras cidades. Em outras palavras, os grupos “mais quente” e “mais frio” moveram-se em direção ao meio, exatamente como as lojas de equipamentos de Secrist.
Por que Secrist não viu esse efeito? Porque escolheu suas estações de clima de maneira diferente. Suas cidades não se restringiam a um pequeno punhado no Meio-Oeste, mas estavam muito mais espalhadas. Suponha que observemos as temperaturas de janeiro na região da
Califórnia, em vez de Wisconsin:o
Jan 2011 Jan 2012
Eureka 48,5 46,6 Fresno 46,6 49,3 Los Angeles 59,2 59,4 Riverside 57,8 58,9 San Diego 60,1 58,2 São Francisco 51,7 51,6 San Jose 51,2 51,4 San Luis Obispo 54,5 54,4 Stockton 45,2 46,7 Truckee 27,1 30,2
Não se vê nenhuma regressão. Os lugares frios, como Truckee, no alto da Serra Nevada, continuam frios, e os lugares quentes, como San Diego e Los Angeles, continuam quentes. Se pusermos essas temperaturas num gráfico de dispersão, obtemos um quadro bem diferente (ver tabela a seguir).
A elipse galtoniana em torno desses pontos seria realmente muito estreita. As diferenças que você vê nas temperaturas na tabela refletem o fato de que alguns lugares na Califórnia são simplesmente mais frios que outros, e as diferenças subjacentes entre as cidades sobrepujam a possibilidade de flutuação de ano para ano. Na linguagem de Shannon, diríamos que há montes de sinais e não tanto ruído. Para as cidades do centro-sul de Wisconsin vale o contrário. Climaticamente falando, Mazomanie e Fort Atkinson não são muito diferentes. Num dado ano, a posição dessas duas cidades no ranking de temperatura terá muito a ver com o acaso. Há montes de ruído e nem tanto sinal.
Secrist julgou que a regressão que documentara meticulosamente fosse uma nova lei da física dos negócios, algo que levaria mais certeza e rigor para o estudo científico do comércio. Contudo, era exatamente o contrário. Se os negócios fossem como as cidades da Califórnia – algumas realmente quentes, outras realmente não, refletindo diferenças inerentes à prática dos negócios –, você veria, de modo correspondente, menos regressão à média. O que os achados de Secrist realmente mostram é que os negócios são muito mais como as cidades de Wisconsin. Administração superior e percepção comercial realmente desempenham um papel, como também o mero acaso, em medida mais ou menos igual.
Eugenia, pecado original e o título enganoso deste livro
Num livro chamado O poder do pensamento matemático: a ciência de como não estar errado é um pouco estranho escrever sobre Galton sem falar sobre sua fama entre os não matemáticos: a teoria da eugenia, cuja paternidade lhe é atribuída. Se, como eu alego, a atenção para o lado matemático da vida ajuda a evitar erros, como pôde um cientista como Galton, de visão tão clara em relação a questões matemáticas, estar tão errado sobre os méritos de se criarem seres humanos segundo propriedades desejáveis? Galton qualificava suas opiniões sobre o assunto de modestas e sensatas, mas elas chocam os ouvidos contemporâneos.
Como na maioria dos outros casos de opiniões novas, a concepção errônea dos objetores à eugenia tem sido curiosa. As
representações erradas mais comuns são de que seus métodos devem ser totalmente os de uniões compulsórias, como na
criação de animais. Não é assim. Acho que a compulsão rígida deve ser exercida para impedir a livre propagação do
rebanho daqueles que são seriamente afligidos por demência, debilidade mental, criminalidade habitual e pauperismo, mas
isso é bem diferente de casamento compulsório. Como restringir casamentos malpressagiados é uma questão em si mesma,
se isso deve ser efetivado por isolamento, ou de outras maneiras a serem ainda divisadas, que sejam consistentes com a
opinião pública humana e bem-informada. Não posso duvidar de que a nossa democracia em última instância irá recusar o
consentimento a essa liberdade de propagar filhos que hoje se permite às classes indesejáveis, mas o populacho ainda
precisa ser ensinado acerca do real estado dessas coisas. Uma democracia não pode resistir, a menos que seja composta de
cidadãos capazes; portanto, em autodefesa, deve resistir à livre introdução de espécimes degenerados.9
O que posso dizer? Matemática é um jeito de não estar errado, mas não é um jeito de não estar errado em relação a tudo. (Sinto muito, não há devolução do dinheiro!) Estar errado é como o pecado original. Nós nascemos com ele e ele continua conosco, e é necessária uma vigilância constante se pretendemos restringir sua esfera de influência sobre nossas ações. Há um perigo real de que, fortalecendo nossas habilidades de analisar algumas questões matematicamente, adquiramos uma confiança geral em nossas crenças que se estenda injustificadamente àquelas coisas em relação às quais ainda estamos errados. Tornamo-nos como aquelas pessoas religiosas que, com o tempo, acumulam um senso tão forte de seu próprio virtuosismo que as leva a acreditar que as coisas ruins que fazem também são virtuosas.
Farei o meu melhor esforço para resistir a essa tentação. Mas fiquem de olho em mim.
As aventuras de Karl Pearson através da décima dimensão
É difícil exagerar o impacto da criação da correlação, por Galton, sobre o mundo conceitual que agora habitamos – não só em estatística, mas em cada área do empreendimento científico. Se você sabe alguma coisa sobre a palavra correlação é que “correlação não implica causalidade” – dois fenômenos podem ser correlacionados, no sentido de Galton, mesmo que um não cause o outro. Isso, em si, não era novidade. As pessoas certamente entendiam que irmãos têm uma probabilidade maior que outros pares de pessoas de compartilhar características físicas, e isso não ocorre porque irmãos altos fazem as irmãs mais novas serem altas também. Contudo, ainda assim existe uma relação causal à espreita lá no fundo: os pais altos cuja contribuição genética ajuda em fazer com que todos os filhos sejam altos. No mundo pós-Galton, poder-se-ia falar sobre uma associação entre duas variáveis e ainda permanecer completamente agnóstico em relação à existência de qualquer relação causal específica, direta ou indireta. A seu modo, a revolução conceitual que Galton engendrou tem algo em comum com o insight de seu primo mais famoso, Charles Darwin, que mostrou que se podia falar significativamente sobre progresso sem necessidade de invocar um propósito. Galton mostrou que se podia falar significativamente sobre associação sem necessidade de se invocar uma causa subjacente.
A definição de correlação original de Galton era um tanto limitada, aplicando-se unicamente àquelas variáveis cuja distribuição seguia a lei da curva do sino que vimos no
Capítulo 4. Mas a noção logo foi adaptada e generalizada por Karl Pearson,p para ser aplicada a qualquer variável possível.
Se eu fosse escrever agora a fórmula de Pearson, ou saísse procurando por ela, veria uma bagunça de raízes quadradas e frações que, a menos que você tenha a geometria cartesiana na ponta da língua, não seria muito esclarecedora. Na verdade, a fórmula de Pearson tem uma descrição geométrica bastante simples. Os matemáticos, desde Descartes, têm desfrutado a maravilhosa liberdade de oscilar de um lado para outro entre descrições algébricas e geométricas do mundo. A vantagem da álgebra é que é mais fácil formalizar e digitar num computador. A vantagem da geometria é que ela nos permite mobilizar nossa intuição física para encarar a situação, em particular quando se pode fazer um desenho. Poucas vezes sinto que realmente entendo uma peça matemática até saber do que se trata em termos de linguagem geométrica.
Então, para um geômetra, o que é correlação? Vai ajudar se tivermos um exemplo à mão. Olhe novamente a tabela que lista as temperaturas médias de janeiro em dez cidades da Califórnia em 2011 e 2012. Como vimos, as temperaturas de 2011 e 2012 têm uma forte correlação positiva. Na verdade, a fórmula de Pearson fornece um valor estratosférico de 0,989.
Se quisermos estudar a relação entre medidas de temperatura em dois anos diferentes, não importa se modificamos cada entrada na tabela de um mesmo valor. Se a temperatura de 2011 é correlacionada com a de 2012, é igualmente correlacionada com “temperatura de 2012 + 5 graus”. Dizendo de outra maneira, se você pegar os pontos no diagrama das temperaturas e movê-los dez centímetros para cima, isso não altera o formato da elipse de Galton, somente sua localização. Acontece que é proveitoso deslocar as temperaturas a partir de um valor uniforme para tornar o valor médio igual a zero tanto em 2011 quanto em 2012. Fazendo isso, obtém-se uma tabela assim:
Jan 2011 Jan 2012
Eureka −1,7 −4,1 Fresno −3,6 −1,4 Los Angeles 9,0 8,7 Riverside 7,6 8,2 San Diego 9,9 7,5 São Francisco 1,5 0,9 San Jose 1,0 0,7 San Luis Obispo 4,3 3,7 Stockton −5,0 −4,0 Truckee −23,1 −20,5
As linhas da tabela têm valores negativos para cidades frias como Truckee e valores positivos para lugares mais quentes como San Diego.
Agora vem o artifício. A coluna de dez números que acompanha as temperaturas de 2011 é uma lista de números, sim. Mas também é um ponto. Como assim? Isso remonta a nosso herói, Descartes. Você pode pensar num par de números (x,y) como um ponto no plano, x unidades para a direita e y unidades para cima da origem. Na verdade, você pode desenhar uma pequena seta apontando da origem para nosso ponto (x,y), uma seta chamada vetor.
Do mesmo modo, um ponto no espaço tridimensional é descrito por uma lista de três coordenadas (x,y,z). E nada, exceto o hábito e um medo covarde, nos impede de forçar a barra mais ainda. Uma lista de quatro números pode ser pensada como um ponto num espaço quadridimensional, e uma lista de dez números, como as temperaturas da Califórnia na nossa tabela, é um ponto num espaço decadimensional, ou dez-dimensional. Melhor ainda, pense nele como um vetor dez-dimensional.
Espere aí, você pode perguntar: como devo pensar nisso? Qual o jeitão de um vetor dez-dimensional?
O jeitão é este:
Esse é o segredinho sujo da geometria avançada. Pode parecer impressionante fazermos geometria em dez dimensões (ou cem, ou 1 milhão…), mas as figuras mentais que temos na cabeça são bi, no máximo tridimensionais. Isso é tudo que a nossa cabeça pode manipular. Felizmente, essa visão empobrecida em geral é suficiente.
Geometria de dimensões superiores pode parecer um pouco misteriosa, especialmente porque o mundo em que vivemos é tridimensional (ou quadridimensional, se você contar o tempo, ou talvez 26-dimensional, se você é um certo tipo de adepto da teoria das cordas; mesmo assim, porém, você acha que o Universo não se estende muito além da maioria dessas dimensões). Por que estudar geometria se ela não é realizada no Universo?
Uma resposta vem do estudo dos dados, que neste momento está super na moda. Lembre-se da foto digital tirada com a câmera de quatro megapixels: ela é descrita com 4 milhões de números, um para cada pixel. (E isso antes de levarmos em conta a cor!) Essa imagem é um vetor 4-milhões-dimensional, ou, se preferir, um ponto num espaço 4-milhões-dimensional. Uma imagem que varia com o tempo é representada por um ponto que se move através de um espaço 4-milhões-dimensional, traçando uma curva num espaço 4-milhões-dimensional, e, antes que você perceba, está fazendo cálculo 4-milhões-dimensional, e é aí que realmente começa a graça.
Voltando à temperatura. Há duas colunas na nossa tabela, cada qual nos fornecendo um vetor bidimensional. O aspecto é este:
Esses dois vetores apontam aproximadamente na mesma direção, o que reflete o fato de que as duas colunas não são tão diferentes. Como já vimos, as cidades mais frias em 2011 continuaram frias em 2012; idem para as mais quentes.
Essa é a fórmula de Pearson em linguagem geométrica. A correlação entre as duas variáveis é determinada pelo ângulo entre os dois vetores. Se você quer detalhes trigonométricos, a correlação é o cosseno do ângulo. Não importa se você lembra o que significa cosseno, basta saber que o cosseno de um ângulo é 1 quando o ângulo é 0 (isto é, quando os dois vetores estão apontando para o mesmo sentido) e −1 quando o ângulo é de 180 graus (vetores apontando em sentidos opostos). Duas variáveis são positivamente correlacionadas quando os vetores correspondentes são separados por um ângulo agudo – ou seja, um ângulo menor que 90 graus –, e negativamente correlacionadas quando o ângulo entre os vetores é maior que 90 graus, ou obtuso. Isso faz sentido: vetores em ângulo agudo entre si estão, em termos informais, “apontando no mesmo sentido”, enquanto vetores que formam um ângulo obtuso parecem trabalhar com propósitos opostos.
Quando o ângulo é reto, nem agudo nem obtuso, as duas variáveis têm uma correlação zero; no que diz respeito à correlação, elas não estão relacionadas entre si. Em geometria, dizemos de um par de vetores que formam um ângulo reto que eles são perpendiculares ou ortogonais. Por extensão, é prática comum entre os matemáticos e outros aficionados da trigonometria usar a palavra “ortogonal” para referir-se a alguma coisa que não tem relação com o assunto em pauta – “Poder-se-ia esperar que habilidades matemáticas estivessem associadas a magnífica popularidade, mas minha experiência mostra que as duas coisas são ortogonais”. Aos poucos, esse uso está se desvencilhando do dialeto nerd e penetrando na linguagem mais geral. Pode-
se ver isso num recente argumento na Suprema Corte dos Estados Unidos.10
Sr. Friedman: Acho que esse assunto é inteiramente ortogonal à questão aqui, porque a Commonwealth está
reconhecendo…
Presidente da Suprema Corte, juiz Roberts: Desculpe. Inteiramente o quê?
Sr. Friedman: Ortogonal. Ângulo reto. Sem relação. Irrelevante.
Juiz Roberts: Ah!
Juiz Scalia: Que adjetivo foi esse? Gosto dele.
Sr. Friedman: Ortogonal.
Juiz Scalia: Ortogonal?
Sr. Friedman: Certo, certo.
Juiz Scalia: Ah!
(Risos.)
Eu estou torcendo para ortogonal pegar. Já faz algum tempo desde que uma palavra matemática abriu caminho para entrar no inglês popular. Mínimo denominador comum a essa altura perdeu quase inteiramente seu sabor matemático, e exponencialmente… não quero nem
começar a falar no exponencialmente.q
A aplicação da trigonometria a vetores de dimensão superior com o objetivo de quantificar correlação não é, para falar delicadamente, o que aqueles que desenvolveram o cosseno tinham em mente. Hiparco, astrônomo de Niceia que anotou as primeiras tábuas trigonométricas no século II AEC, estava tentando calcular o lapso de tempo entre eclipses. Os vetores com os quais lidava descreviam objetos no céu e eram solidamente tridimensionais. Mas uma ferramenta matemática que serve exatamente bem para um propósito tende a se mostrar útil muitas outras vezes.
A compreensão geométrica da correlação ilumina aspectos da estatística que de outro modo poderiam ficar obscuros. Considere o caso do rico liberal elitista. Já há algum tempo esse sujeito ligeiramente vexaminoso se tornou personagem familiar no pontificado político. Talvez seu mais devotado cronista seja David Brooks, que escreveu um livro inteiro sobre um grupo que ele chamou de Bohemian Bourgeoisie – ou Burguesia Boêmia –, ou Bobo. Em 2001, contemplando a diferença entre o afluente e suburbano condado de Montgomery, em Maryland (o lugar onde nasci!), e o condado de Franklin, na Pensilvânia, bem classe média, ele especulou que a velha estratificação política segundo a classe econômica, com o GOP (Good Old Party, o “Bom e Velho Partido”, como se referem ao Partido Republicano, nos Estados Unidos) representando os ricaços e os democratas representando a classe trabalhadora, estava terrivelmente obsoleta.
Como áreas privilegiadas em toda parte, desde o Vale do Silício até a costa norte de Chicago e o Connecticut suburbano, o
condado de Montgomery apoiou a chapa democrata na última eleição presidencial por uma margem de 63% a 34%. Ao
mesmo tempo, o condado de Franklin foi republicano, 67% a 30%.11
Antes de tudo, esse “em toda parte” é um pouco forte. O condado mais rico de Wisconsin é Waukesha, nos elegantes subúrbios a oeste de Milwaukee. Ali Bush esmagou Gore, 65 a 31, enquanto Gore ganhou no estado por uma estreita margem.
Ainda assim, Brooks está indicando um fenômeno real, que vimos retratado com bastante clareza num gráfico de dispersão, algumas páginas atrás. Na paisagem eleitoral contemporânea dos Estados Unidos, os estados ricos têm maior probabilidade que os pobres de votar nos democratas. Mississippi e Oklahoma são fortalezas republicanas, enquanto o GOP nem se dá ao trabalho de disputar Nova York e Califórnia. Em outras palavras, ser de um estado rico está correlacionado positivamente a votar nos democratas.
Mas o estatístico Andrew Gelman descobriu 12 que a história é mais complicada que um retrato brooksiano de uma nova raça de liberais tomadores de latte, que gostam de guiar Toyotas Prius, têm casas enormes e de bom gosto e bolsas de marca cheias de dinheiro. Na verdade, gente rica ainda tem maior probabilidade de votar nos republicanos que os pobres, efeito que tem estado presente há décadas nos Estados Unidos. Gelman e seus colaboradores, escavando mais fundo os dados estado por estado, descobriram um padrão muito interessante. Em alguns estados, como Texas e Wisconsin, condados mais ricos tendem a votar mais nos
republicanos.13 Em outros, como Maryland, Califórnia e Nova York, os condados mais ricos são mais democratas. Estes últimos são aqueles onde vivem muitos pontífices políticos. Em seus mundinhos fechados, os bairros ricos estão, sim, carregados de liberais ricos, e para eles é natural generalizar sua experiência para o resto do país. Natural – mas, quando se olha para os números globais, está claramente errado.
Aqui parece haver um paradoxo. Ser rico está positivamente correlacionado a ser de um estado rico, mais ou menos por definição. E ser de um estado rico está positivamente correlacionado a votar nos democratas. Será que isso não significa que ser rico deve estar correlacionado a votar nos democratas? Geometricamente, sim. Se o vetor 1 forma um ângulo agudo com o vetor 2 e o vetor 2 forma um ângulo agudo com o vetor 3, o vetor 1 deve formar um ângulo agudo com o vetor 3?
Não! Veja a prova na figura:
Algumas relações, como “maior que”, são transitivas. Se eu peso mais que meu filho e meu filho pesa mais que minha filha, é certeza absoluta que eu peso mais que minha filha. “Vive na mesma cidade que” também é transitivo – se eu vivo na mesma cidade que Bill, que vive na mesma cidade que Bob, então eu vivo na mesma cidade que Bob.
A correlação não é transitiva, é mais como uma “relação consanguínea” – eu estou relacionado com meu filho, que está relacionado com minha esposa, mas minha esposa e eu não temos relação consanguínea. Na verdade, não é uma ideia terrível pensar que variáveis correlacionadas “compartilham parte de seu DNA”. Imagine uma pequena firma de administração financeira com apenas três investidores, Laura, Sara e Tim. Suas posições nos investimentos são bastante simples. Os recursos de Laura estão divididos 50-50 entre Facebook e Google; Tim tem metade na General Motors e metade na Honda; e Sara está equilibrada entre a velha economia e a nova, tem metade na Honda e metade no Facebook. É bastante óbvio que os retornos de Laura terão uma correlação positiva com os de Sara, porque elas têm metade da carteira de investimentos em comum. A correlação entre os retornos de Sara e de Tim será igualmente forte. Mas não há razão para se pensar que o desempenho das
ações de Tim esteja correlacionado ao desempenho das de Laura.r Esses dois fundos são como pais, cada um contribuindo com metade do “material genético” que forma o fundo híbrido de Sara.
A intransitividade da correlação de certo modo é óbvia e misteriosa ao mesmo tempo. No exemplo do fundo de investimentos, você jamais seria levado a pensar que um aumento na performance das ações de Tim lhe dê muita informação sobre como as de Laura estão se saindo. Mas nossa intuição não dá tão certo em outros domínios. Considere, por exemplo, o caso do “colesterol bom”, nome comum para o colesterol transportado na corrente sanguínea por lipoproteínas de alta densidade, ou HDL. Sabe-se há décadas que altos níveis de colesterol HDL no sangue estão associados a risco mais baixo de “acidentes cardiovasculares”. Caso você não seja falante nativo de medicalês, isso significa que gente com profusão de colesterol bom, em média, tem menos probabilidade de sofrer um entupimento do coração e cair morto.
Sabemos também que certas drogas aumentam confiavelmente os níveis de HDL. Uma droga popular é a niacina, uma forma de vitamina B. Se a niacina aumenta o HDL, e mais HDL está associado a menor risco de acidentes cardiovasculares, parece que caprichar na niacina é uma boa ideia. Foi isso que meu médico me recomendou, e provavelmente o seu também, a não ser que você seja um adolescente, corredor de maratona ou membro de alguma outra casta metabolicamente privilegiada.
O problema é que não está claro como a coisa funciona. A suplementação de niacina registrou resultados promissores em pequenos testes clínicos. Mas um teste em larga escala
realizado pelo National Heart, Lung, and Blood Institute foi interrompido em 2011,14 um ano e meio antes do encerramento programado, porque os resultados foram tão frágeis que não parecia valer a pena continuar. Pacientes que receberam niacina tinham níveis mais altos de HDL, tudo bem, mas tiveram tantos ataques cardíacos e derrames quanto os demais da população pesquisada. Como é possível? A correlação não é transitiva. A niacina está correlacionada ao HDL elevado, e o HDL elevado está correlacionado a baixo risco de ataque cardíaco, mas isso não significa que a niacina impeça os ataques.
Isso não quer dizer que manipular o colesterol HDL não dê em nada. Cada droga é diferente, e pode ser clinicamente relevante saber como você incrementa o nível de HDL. Voltando à firma de investimentos, sabemos que os retornos de Tim estão correlacionados aos de Sara, e você pode tentar melhorar os ganhos de Sara tomando medidas para melhorar os de Tim. Se sua abordagem fosse soltar uma dica de mercado falsamente otimista para subir o preço das ações da GM, descobriria ter conseguido melhorar a performance de Tim, enquanto Sara não se beneficiaria em nada. Mas se fizesse a mesma coisa com a Honda, os números de Tim e Sara melhorariam.
Se a correlação fosse transitiva, a pesquisa médica seria muito mais fácil do que realmente é. Décadas de observação e coleta de dados nos deram montes de correlações conhecidas com as quais trabalhar. Se tivéssemos transitividade, os médicos poderiam simplesmente ligar essas correlações em cadeias, criando intervenções confiáveis. Sabemos que os níveis de estrogênio estão correlacionados a menor risco de doença cardíaca, e sabemos que a terapia de reposição hormonal pode aumentar esses níveis. Então, seria de esperar que a terapia de reposição hormonal servisse como proteção contra doença cardíaca. De fato, esta costumava ser uma atitude clínica sensata. Mas, como você provavelmente já ouviu falar, a realidade é bem mais complicada. No começo da década de 2000, a Women’s Health Initiative, estudo de longo prazo envolvendo um gigantesco teste clínico aleatório, relatou que a terapia de
reposição hormonal com estrógeno e progestina na verdade parecia aumentar o risco15 de doença cardíaca na população estudada. Resultados mais recentes sugerem que o efeito da terapia de reposição hormonal pode ser diferente em grupos distintos de mulheres, ou que o
estrógeno sozinho16 poderia ser melhor para o coração que a dupla estrógeno-progestina, e assim por diante.
No mundo real, é quase impossível predizer que efeito a droga terá sobre uma doença, mesmo que você saiba um bocado sobre como ela afeta biomarcadores como o HDL ou o nível de estrogênio. O corpo humano é um sistema imensamente complexo, e só podemos medir algumas de suas características, que dizer então manipulá-las. Com base em correlações que podemos observar, há uma porção de drogas que poderiam ter, de modo plausível, um desejado efeito sobre a saúde. Elas são testadas em experimentos, e a maioria delas fracassa de maneira decepcionante. Trabalhar no desenvolvimento de drogas requer uma psique persistente, para não mencionar o vasto aporte de capital.
Sem correlação não significa sem relação Quando duas variáveis são correlacionadas, vimos que de algum modo elas se relacionam mutuamente. E se não houver correlação? Será que isso significa total ausência de relação, que uma não afeta a outra? De modo algum. A noção de correlação de Galton é limitada, e de uma maneira muito importante: ela detecta relações lineares entre variáveis, nas quais o aumento numa das variáveis tende a coincidir com um aumento (ou diminuição) de mesma proporção na outra. No entanto, da mesma forma que nem todas as curvas são retas, nem todas as relações entre as variáveis são relações lineares.
Vamos pegar a seguinte correlação:
Você está olhando para um quadro que fiz a partir de uma pesquisa política realizada pela Public Policy Polling em 15 de dezembro de 2011. Há mil pontos, cada um representando um eleitor que respondeu a um questionário de 23 perguntas. A posição de um ponto no eixo esquerda-direita representa, bem, esquerda e direita: pessoas que disseram apoiar o
presidente Obama, aprovar o Partido Democrata e opor-se ao Tea Partys tendem a estar do
lado esquerdo, enquanto aqueles que favorecem o GOP, não gostam de Harry Reidt e acreditam que há uma “Guerra ao Natal” estão do lado direito. O eixo vertical representa aproximadamente “grau de informação” – eleitores na base do gráfico tendem a responder “não sei” para questões mais específicas, que demandam mais informação, como, por exemplo, “Você aprova ou desaprova o trabalho que [o líder da minoria no Senado] Mitch McConnell está fazendo?”, bem como a manifestar pouca e nenhuma empolgação com a eleição presidencial de 2012.
Pode-se verificar que as variáveis medidas pelos dois eixos não apresentam correlação,u exatamente como é sugerido por uma simples olhada no gráfico. Não parece que os pontos tendam a ir mais longe para a esquerda ou para a direita à medida que você sobe na página. Mas isso não significa que as duas variáveis não estejam relacionadas entre si. Na verdade, a relação fica bastante clara a partir da figura. O gráfico tem “forma de coração”, com um lobo de cada lado e um ponto na base. À medida que os eleitores são mais bem informados, eles não tendem mais para democratas ou republicanos. Ficam mais polarizados: esquerdistas vão mais para a esquerda, direitistas vão mais para a direita, e o espaço esparsamente habitado no meio fica ainda mais disperso. Na metade inferior do gráfico, os eleitores menos informados tendem a adotar uma postura mais de centro. O gráfico reflete um fato social estabelecido, que já se tornou lugar-comum na literatura da ciência política. Eleitores indecisos, em sua grande maioria, não estão indecisos por estarem pesando cuidadosamente os méritos de cada candidato, sem ideias preconcebidas a respeito de dogmas políticos. Estão indecisos porque nem prestam muita atenção ao processo eleitoral.
Uma ferramenta matemática, como qualquer outro instrumento científico, detecta algum tipo de fenômeno, mas não outros; um cálculo de correlação não consegue ver a forma de coração (cardiomorfismo?) do gráfico, assim como sua câmera fotográfica não consegue detectar raios gama. Tenha isso em mente quando lhe disserem que dois fenômenos na natureza ou na sociedade foram considerados sem correlação. Isso não significa que não haja relação nenhuma, apenas que não há relação do tipo que a correlação é projetada para detectar.
a Ou pelo menos reinventou: o astrônomo John Herschel construiu uma espécie de gráfico de dispersão em 1833 para estudar as órbitas de estrelas binárias. Aliás, este não é o mesmo Herschel que descobriu Urano – o descobridor foi seu pai, William Herschel. Ingleses notáveis e seus parentes notáveis! Todo o material sobre a história do gráfico de dispersão apud Michael Friendly e Daniel Denis, “The early origins and development of the scatterplot”, Journal of the History of the Behavioral Sciences, v.41, n.2, primavera 2005, p.103-30.
b O que Florence Nightingale realmente chamou de coxcomb era o livreto contendo o gráfico, não o gráfico propriamente dito, mas todo mundo passou a adotar coxcomb, e agora é tarde demais para mudar.
c Esse fator 1,08 serve para fazer as alturas das mães se ajustarem aproximadamente às dos pais, de modo que as alturas de ambos possam ser medidas na mesma escala.
d As curvas isopléticas remontam a muito tempo antes disso. As primeiras que conhecemos foram as curvas isobáticas (de profundidade constante) desenhadas em mapas de rios e ancoradouros, que retrocedem até pelo menos 1584. Mas Halley parece ter inventado a técnica independentemente, e com toda a certeza a popularizou.
e Pode-se também argumentar em favor de curvas de crescimento exponencial, que são tão ubíquas quanto as seções cônicas.
f A diferença de nomenclatura em relação aos países de língua inglesa gera diferença na tradução (no original, quadratic); o termo “quadrática” no Brasil é quase universalmente aplicado a curvas do tipo y = ax² + b, que gera uma parábola no plano. (N.R.T.)
g De acordo com a definição, as curvas quádricas são superfícies de segundo grau no espaço, correspondendo a funções em três variáveis, mas nunca multiplicando mais de duas entre si (o que inclui variáveis elevadas ao quadrado – daí o nome). (N.R.T.)
h Na verdade, há alguns casos extras, como a curva com a equação xy = 0, que é um par de retas cruzando-se no ponto (0,0). Elas são consideradas “degeneradas”, e não falaremos sobre elas aqui.
i Se admitirmos três variáveis estaremos tratando com superfícies com um pouco mais de variedade: elipsoide, elipsoide de revolução (caso particular do elipsoide), esfera (caso particular do elipsoide de revolução), paraboloide elíptico, paraboloide de revolução (caso particular do paraboloide elíptico), paraboloide hiperbólico, hiperboloide de uma folha, hiperboloide de duas folhas, cone, cilindro elíptico, cilindro circular, cilindro hiperbólico, cilindro parabólico. (N.R.T.) .
j Com todo seu entusiasmo por dados, porém, Bertillon estragou o maior caso que lhe chegou às mãos. Ele ajudou a condenar Alfred Dreyfus por traição, com uma fajuta “prova geométrica” de que a carta em que havia a oferta de se venderem documentos franceses tinha sido escrita na caligrafia de Dreyfus. Ver L. Schneps e C. Colmez, A matemática nos tribunais, op.cit., para um relato completo do caso e do desafortunado envolvimento de Bertillon.
k Em todo caso, é assim que Fosdick conta a história em “The passing of the Bertillon system of identification”. Como no caso de qualquer crime famoso do passado, há um grande aumento de incerteza e teoria da conspiração em torno do roubo da Mona Lisa, e outras fontes contam histórias diferentes sobre o papel das impressões digitais.
l Leitores de certa idade podem gostar de saber que o Parsons que inventou o código era pai de Alan Parsons, que gravou “Eye in the sky”.
m Tudo bem, não é literalmente apenas uma questão de correlações entre pares de pixels, mas acaba se reduzindo à quantidade de informação (no sentido de Shannon) transmitida pela imagem.
n Mantivemos as temperaturas em graus Fahrenheit porque interessa aqui a comparação das unidades, e não propriamente as temperaturas. Lembra-se ao leitor interessado a fórmula de conversão de temperatura Fahrenheit para Celsius: T = 0,55 (T – C F 32), onde T e T são, respectivamente, as temperaturas Celsius e Fahrenheit. Para que se tenha uma ideia da faixa dessas C F
temperaturas, o gráfico a seguir vai de uma mínima aproximada de –9,5°C no eixo horizontal a uma máxima aproximada de – 3,5°C no eixo vertical (inverno no hemisfério norte). (N.T.)
o Variação das temperaturas em graus Celsius no gráfico a seguir, neste caso igual para ambos os eixos: mínima: 1°C, máxima: 15,5°C. (N.T.)
p Pai de Egon Pearson, que brigou com R.A. Fisher num capítulo anterior.
q Embora talvez seja melhor não ficar me queixando alto demais sobre o uso incorreto de exponencial para significar simplesmente “rápido” – há pouco vi um repórter esportivo, que sem dúvida havia sido em algum momento repreendido sobre a palavra exponencial, referir-se ao “impressionante, logarítmico aumento de velocidade” do corredor Usain Bolt, o que é ainda pior.
r Exceto no caso em que todo o mercado de ações tenda a se mover em uníssono, claro.
s Ala radical do Partido Republicano. (N.T.)
t Senador democrata pelo estado de Nevada, foi líder da maioria democrata no Senado entre 2007-2011. (N.T.)
u Nota técnica para os interessados: na verdade, essa é a projeção bidimensional fornecida por uma análise dos componentes principais das respostas à pesquisa, de modo que a inexistência de correlação dos dois eixos é automática. A interpretação dos eixos é minha. O exemplo destina-se apenas a ilustrar um ponto sobre correlação, e não deve, em nenhuma circunstância, ser tomado como ciência social de verdade!