Revisão Sistemática da Literatura em Engenharia de Software: Teoria e Prática

Questão 4: Quantos pesquisadores devem participar da seleção de estudos primários?

Questão 4: Quantos pesquisadores devem participar

da seleção de estudos primários?

Decidir pelos estudos a serem incluídos em uma RS envolve julgamento por parte do(s) pesquisador(es)/revisor(es). Além disso, um único equívoco na aplicação dos critérios de seleção é suficiente para um estudo relevante ser excluído de uma RS, o que pode comprometer a qualidade dos resultados obtidos. Assim, é muito importante que mais de um revisor participe da seleção. Em especial, quando a RS estiver sendo conduzida por um pesquisador não especialista no tema de estudo, é fundamental que tanto a seleção quanto a avaliação da qualidade dos estudos sejam conduzidas por mais de um pesquisador, sendo que algum deles deve ser especialista no tema.

Na prática, a estratégia de seleção pode variar de revisão para revisão, dependendo da experiência dos revisores tanto no tema da RS, quanto no próprio processo de RS. No entanto, se a seleção é realizada por pelo menos dois revisores, há uma redução na possibilidade de que estudos relevantes

sejam descartados (EDWARDS et al., 2002).

A seleção pode ser realizada de diferentes formas, descritas a seguir.

• Configuração 1: dois ou mais pesquisadores de forma independente realizam a seleção e comparam

os resultados. Conflitos são solucionados por consenso. Por exemplo, na revisão conduzida por

Dieste e Juristo (2011), dois pesquisadores checaram de maneira independente os estudos.

• Configuração 2: o total de estudos é avaliado por dois (ou mais) pesquisadores, que realizam a

seleção de forma independente. Um pesquisador externo avalia o resultado da seleção e classifica os estudos que tiveram divergências quanto à seleção feita pelos pesquisadores. Como já mencionado na Questão 2, sugere-se que o conjunto de estudos a serem reavaliados pelo pesquisador externo seja composto de pelo menos 1/3 dos estudos, incluindo necessariamente os com classificações divergentes. Para completar esse conjunto, os demais estudos são escolhidos aleatoriamente. Pode-se, inclusive, optar pela revisão da totalidade dos estudos, caso esse número não seja muito grande e haja disponibilidade de recursos (tempo e revisores). Em caso de RS sendo conduzida por alunos de mestrado ou doutorado, é muito comum que os orientadores desempenhem o papel de avaliador, mas outros pesquisadores com conhecimento sobre o tema da RS podem atuar como pesquisadores externos. Enfim, a condição básica para atuar como avaliador da seleção é ser um especialista no

tema da revisão. Por exemplo, durante a seleção final da RS de Cruz et al. (2015), dois pesquisadores trabalharam independentemente. Um pesquisador externo, que não participou da seleção inicial auxiliou na resolução das divergências. Em casos nos quais um acordo não foi possível, as diferenças foram solucionadas em uma reunião de consenso.

• Configuração 3: dois pesquisadores em conjunto realizam a atividade de seleção, de forma

semelhante a uma sessão de programação em pares, adotada nos métodos de desenvolvimento ágeis.

• Configuração 4: um pesquisador realiza a atividade de seleção e um segundo pesquisador (ou vários)

avalia o resultado. Nesse caso, deve ser definida uma amostra de estudos a serem avaliados (contendo pelo menos 1/3 dos estudos), incluindo aqueles em que o pesquisador responsável pela seleção teve dúvidas quanto à sua classificação. Conflitos devem ser solucionados por consenso. Por

exemplo, na revisão conduzida por MacDonell e Shepperd (2007), um pesquisador executou a atividade de seleção e um segundo revisou a decisão de incluir ou não um subconjunto dos estudos.

Para resolver divergências sobre a inclusão de um estudo, é aconselhável obter informações adicionais sobre o trabalho. Adicionalmente, as razões que geraram discordâncias devem ser exploradas, pois podem revelar a necessidade de, por exemplo, melhorar a descrição dos procedimentos de seleção,

assim como refinar os critérios de inclusão e exclusão. Na revisão realizada por Hall et al. (2012), os critérios de inclusão e exclusão foram melhorados após as causas das discordâncias entre os revisores terem sido analisadas.

A confiabilidade da seleção pode ser medida pelo teste Kappa, que aponta a confiabilidade entre

classificações feitas por diferentes pesquisadores. Esse teste considera que concordância por acaso pode

ocorrer na seleção (estudos incluídos e excluídos) feitas por dois ou mais pesquisadores (SIEGEL &

CASTELLAN, 1988). Por exemplo, uma RS contendo 10 estudos a serem avaliados por dois pesquisadores (pesquisador 1 e pesquisador 2), sendo que cada pesquisador pode classificar os estudos

como incluído ou excluído. A Tabela 4.1 sumariza um possível resultado da seleção.

Tabela 4.1

Resultado da seleção contendo estudos incluídos e excluídos

 

Pesquisador 1 Pesquisador 2

Estudo 1 I E

Estudo 2 I I

Estudo 3 I I

Estudo 4 I E

Estudo 5 I I

Estudo 6 I I

Estudo 7 E E

Estudo 8 E E

Estudo 9 E I

Estudo 10 E E

I = Incluído; E = Excluído

Aplicando-se o teste Kappa, obtém-se um coeficiente de mesmo nome, o qual é calculado pela seguinte

expressão matemática:

 

(4.1)

 

onde:

• Co é a concordância observada ou a taxa de concordância real.

• Ca é a concordância ao acaso, ou aquela esperada se a classificação dos estudos como incluído ou

excluído fosse feita de maneira aleatória.

Os cálculos de Co e Ca para o exemplo da Tabela 4.1 são mostrados na Figura 4.2. É possível

observar que os dois pesquisadores tiveram uma concordância observada (Co) de 70%, ou seja,

40% + 30% (conforme ilustrado na Figura 4.2(a)). Pode-se notar que, em 40% das vezes, os dois

pesquisadores classificaram os mesmos estudos como incluídos (observe na Tabela 4.1 que quatro foram classificados como incluídos por ambos os pesquisadores – Estudos 2, 3, 5 e 6), e, em 30% das vezes, os

dois classificaram os mesmos estudos como excluídos (observe na Tabela 4.1 que três estudos foram classificados como excluídos por ambos os pesquisadores – Estudos 7, 8 e 10).

FIGURA 4.2 Etapas do cálculo do teste Kappa. (a) Cálculo da Concordância observada (Co)

 

(b) Cálculo dos Totais Marginais da Linha (TML) e Totais Marginais da Coluna (TMC) (c) Cálculo da Concordância ao acaso (Ca)

(d) Cálculo do Kappa

 

O cálculo da concordância ao acaso (Ca) é baseado nos marginais totais. O marginal total de uma linha

é calculado pela soma dos valores das células dessa linha e armazenado no final dessa linha (célula com

fundo cinza na Figura 4.2(b)). De maneira similar, o marginal total de uma coluna é calculado pela soma

dos valores das células dessa coluna e armazenado no final da mesma (célula com fundo cinza na

Figura 4.2(b)). A seguir, calcula-se a concordância ao acaso dos dois pesquisadores terem incluído os

mesmos estudos, ou seja, Ca(I), conforme ilustrado na Figura 4.2(c). Para isso, multiplicam-se os

marginais totais da linha (I) e da coluna (I). No nosso exemplo, Ca(I) é 30%, ou seja, 60% * 50%. Na

mesma linha, calcula-se a concordância ao acaso dos dois pesquisadores terem excluído os mesmos

estudos, ou seja, Ca(E). Para isso, multiplicam-se os marginais totais da linha (E) e da coluna (E),

conforme ilustrado na Figura 4.2(c). Dessa forma, Ca(E) é 20%, que corresponde à 40% * 50%. Em

seguida, o valor da concordância ao acaso Ca é calculado somando-se ambas as concordâncias ao acaso,

resultando em 50%, que corresponde a Ca(I) + Ca(E) = 30% + 20%. O valor da Kappa é, então,

calculado utilizando-se a expressão matemática, o que resulta em Kappa igual a 40% ou 0,4, conforme

ilustrado na Figura 4.2(d).

Para interpretar o valor do Kappa, pode-se adotar a tabela de concordância proposta por Landis e Koch (1977). Como regra, valores do Kappa menores do que zero são considerados sem concordância, valores de 0 a 0,19: concordância pobre; de 0,20 a 0,39: concordância considerável; de 0,40 a 0,59: concordância moderada; de 0,60 a 0,79: concordância substancial; e de 0,80 a 1,00: concordância excelente. Quanto mais próximo de 1, maior a confiabilidade da seleção. Por outro lado, valores próximos ou menores que zero sugerem que a concordância foi ao acaso. No nosso exemplo, a concordância foi moderada. É recomendado que os valores do Kappa sejam maiores do que 0,6.

Exemplos de RSs na área de ES que utilizaram o teste Kappa são os trabalhos de Kitchenham e Brereton

(2013) e Osborne-OHagan et al. (2014).