Vogel: Análise Química Quantitativa

J Mendham · Capítulo 113 de 495

Páginas do PDF

Vogel: Análise Química Quantitativa

4.33 Tratamento multivariado de dados

Fig. 4.9 Planilha do simplex

 

A definição da quantidade a ser determinada (a resposta) nem sempre é trivial. Em

cromatografia com fase gasosa, a resposta deve envolver o tamanho do pico, a separação do pico e o tempo de retenção. Mais detalhes sobre a otimização em processos cromatográficos podem ser encontrados nas referências da Seção 4.38. Na espectroscopia atômica, a razão sinal/ruído talvez seja a resposta mais adequada. Efeitos de interferência ou a medida do sinal no limite da capacidade do detector podem produzir sinais de emissão e absorbância com ruído de fundo apreciável. O método simplex não dá informações sobre os efeitos dos fatores e sobre as interações. É possível que o simplex encontre um falso ótimo, mas uma busca univariada poderá confirmar se o verdadeiro ótimo foi encontrado. Além disto, a robustez da resposta em torno da região ótima pode servir como medida de variações bruscas do nível de um fator.

 

4.33 Tratamento multivariado de dados

A conversão de dados multivariados em uma informação útil, uma das mais importantes áreas da quimiometria, inclui o reconhecimento de padrões e a análise por componentes principais. Apresentaremos, nesta seção, somente uma introdução com exemplos de um ramo da área de reconhecimento de padrões, a análise por formação de grupos (cluster analysis). Na análise clássica, as análises repetidas geram apenas uma informação, o ponto final de uma titulação, por exemplo. No caso de instrumentos mais avançados, no entanto, um experimento pode gerar grande quantidade de dados multivariados. As intensidades e freqüências de um espectro de infravermelho são um bom exemplo. É razoável afirmar que nossa interpretação das informações dadas por muitos instrumentos modernos é freqüentemente limitada. A interpretação detalhada da região de impressão digital de um espectro de infravermelho é, na prática, muito difícil de fazer. Os métodos quimiométricos podem ajudar na interpretação dos dados. Pode-se, por exemplo, saber a origem de um derramamento de petróleo a partir da avaliação quimiométrica das freqüências e intensidades de um espectro de infravermelho do óleo.

Os dados multivariados existem em um espaço multi-dimensional, claramente

impossível de visualizar quando o número de dimensões é maior do que três. O objetivo principal da técnica de reconhecimento de padrões é reduzir o número de dimensões do conjunto de dados. Reduzidos a duas dimensões, os padrões podem ser reconhecidos e classificados visualmente. O processo de classificação é muito importante na captação da informação relevante. Existem duas abordagens principais, a classificação supervisionada e a não supervisionada. Os métodos supervisionados requerem um conjunto de dados que é usado como teste. Isto significa que é necessário reservar um certo número de amostras, cuja origem e classificação são conhecidas e que são previamente analisadas, para constituir um modelo. Os métodos não supervisionados não exigem um conjunto de amostras-teste. A análise por grupo pertence a esta última categoria.

Existem muitas variantes da técnica de análise por grupo. Descreveremos apenas uma

delas, usando exemplos. Para mais detalhes, consulte a lista da Seção 4.38.

 

Exemplo 4.18 Análise hierarquizada por grupo

 

Uma análise de quatro compostos diferentes por cromatografia com camada fina com três fases estacionárias diferentes deu os resultados tabelados de Rf, multiplicados por 100 e arredondados, dados a seguir. Quais são as fases estacionárias de comportamento mais semelhante?

 

Composto Fase estacionária

 

A B C

 

1 90 70 70

 

2 70 50 60

 

3 60 40 30

4 50 30 40

 

A primeira etapa do cálculo é construir a matriz de dessemelhanças. Isto pode ser feito

de várias maneiras. Uma das mais comuns utiliza a distância Euclidiana (Fig. 4.10). A distância Euclidiana em um espaço bidimensional pode ser determinada pelo teorema de Pitágoras.

Em três dimensões,

 

Em um espaço n-dimensional,

 

O termo dAB é a dessemelhança de AB. Quanto maior for a distância dAB, mais afastados estão os pontos A e B e menos semelhantes eles são.

Neste exemplo,

 

então, dAB = 40 (Rf × 100)

 

e

 

então, dAC = 38,7 (Rf × 100)

 

e, também,

 

então, dBC = 17,3 (Rf × 100)

 

A matriz de dessemelhanças é, então,

Fig. 4.10 2 2 1/2 Distância euclidiana: d AB = [(Ax) + (Áy) ]

 

 

Fig. 4.11 Dendrograma: as fases B e C são semelhantes e ambas são diferentes de A, logo, B e C podem formar um grupo

 

A próxima etapa é identificar as fases estacionárias mais semelhantes e combiná-las usando a média das distâncias para formar um grupo, o algoritmo de ligação. A distância BC é a menor, e as fases B e C são combinadas (aglomeradas) para formar o grupo B*.

Como

 

a nova matriz pode ser escrita como

O processo de aglomeração é repetido até que se forme uma matriz 2 X 2 (como é o caso neste exemplo).

 

Finalmente, constrói-se um dendrograma para visualizar a informação obtida (Fig.

4.11). As fases B e C são semelhantes e diferentes de A e, por isso, podem formar um grupo.

 

Pode-se, também, construir a matriz de dessemelhanças com os valores do coeficiente de correlação (a) ou com a distância de Manhattan (b):

 

(a) Calcule o coeficiente de correlação nos gráficos de A versus B, A versus C e B

versus C (Seção 4.16), e use os valores para formar a matriz de dessemelhanças. Observe que os valores da diagonal da matriz são iguais a 1,000.

(b) Calcule as distâncias de Manhattan pela soma das distâncias de cada variável. No

Exemplo 4.18, a soma das distâncias é dada por

(90 – 70) + (70 – 50) + (60 – 40) + (50 – 30) = 80

A soma da distância AC = 70 e a soma da distância BC = 30.

 

Assim, a matriz obtida usando a distância de Manhattan pode ser escrita como

 

Usa-se, com freqüência, mais de uma técnica de análise por grupo para saber se o número de grupos é o mesmo. Damos, adiante, um exemplo mais detalhado da formação hierarquizada de grupos para mostrar que é possível extrair muitas informações relevantes de um conjunto de dados à primeira vista pouco compreensível. Mesmo esse exemplo, em que o conjunto de dados inclui 40 valores, é pequeno em comparação com os conjuntos de dados usualmente encontrados na prática.

Exemplo 4.19

Os resultados a seguir foram obtidos em oito comprimentos de onda diferentes dos espectros eletrônicos de absorção de cinco extratos de plantas diferentes. Use a técnica de formação de grupos para determinar se os extratos podem ser agrupados.

 

Extrato Absorbância × 100

 

λ1 λ2 λ3 λ4 λ5 λ6 λ7 λ8

 

1 22 4 12 6 50 8 7

 

2 16 10 9 1 45 13 11 1

 

3 11 37 29 16 8 34 39 0

 

4 10 4 7 4 27 6 5 1

 

5 4 17 16 7 3 17 21 0

 

A matriz de dessemelhanças é obtida como no Exemplo 4.18

 

Os extratos mais semelhantes são 1 e 2. Aplica-se, então, o algoritmo de ligação e obtém-se