Revisão Sistemática da Literatura em Engenharia de Software: Teoria e Prática
Questão 3: O que é a avaliação da qualidade de estudos primários?
Questão 3: O que é a avaliação da qualidade de estudos
primários?
A qualidade de uma RS depende da qualidade dos estudos primários incluídos. A qualidade de cada estudo está diretamente associada à sua qualidade metodológica, que pode ser medida por aspectos como: validade interna (medir efetivamente o que se deseja mensurar), validade externa (poder de generalizar os resultados), relevância do tema de pesquisa (questões de pesquisa e objetivos bem definidos e embasados na literatura), adoção de métodos que conduzam aos objetivos propostos, entre outros.
Após a seleção final (aplicação dos critérios de inclusão e exclusão após a leitura do texto completo
dos estudos), muitas vezes, os revisores realizam a avaliação da qualidade desses estudos. Staples e
Niazi (2007) dizem que após a seleção final, uma avaliação da qualidade permite aos pesquisadores analisarem mais detalhadamente os estudos.
A avaliação da qualidade é realizada por meio de formulários desenvolvidos pelos próprios pesquisadores. Esses são compostos pelos critérios de qualidade, ou seja, perguntas sobre aspectos
metodológicos de cada estudo (KITCHENHAM, 2004; STAPLES & NIAZI, 2007). Embora exemplos de
formulários de qualidade possam ser encontrados na literatura (KITCHENHAM & CHARTERS, 2007;
KITCHENHAM, 2004; IMTIAZ et al., 2013; KITCHENHAM & BRERETON, 2013), recomendamos que os mesmos sejam elaborados especificamente para cada revisão, de acordo com o tema a ser abordado e em conformidade com as questões de pesquisa.
Um exemplo de RS que fez uso de critérios de qualidade foi a conduzida por Mendes et al. (2014), cujo objetivo foi identificar o melhor modelo de estimativa de esforço no desenvolvimento de software web dentre dois modelos: construídos usando conjuntos de dados de várias organizações; e construídos a
partir de dados de organizações individuais. O formulário construído por Mendes et al. (2014) é composto por questões que avaliam aspectos metodológicos dos estudos, tais como: Os métodos utilizados para construção dos modelos de estimativas foram totalmente definidos (ferramentas e métodos utilizados)? O resultado da análise de sensibilidade (ou análise de resíduos) foi usado para remover pontos de dados anormais, se necessário? Analisando as questões do formulário de Mendes et al., é possível observar que o grande desafio da avaliação da qualidade é a elaboração de critérios objetivos, que garantam que a RS se mantenha reproduzível. Por isso, apesar de recomendadas,
avaliações de qualidade nem sempre são realizadas. Por exemplo, na RS conduzida por Oliveira et al.
(2012), essa atividade não foi considerada. Isso se deve ao fato desse tipo de avaliação poder introduzir um viés na RS, pois critérios de qualidade, na maioria das vezes, são subjetivos e difíceis de serem aplicados por pesquisadores inexperientes.
Se são atribuídas escalas numéricas para os itens que compõem os formulários, então valores numéricos da qualidade (índices de qualidade) podem ser obtidos. Por exemplo, se questões de um formulário puderem ser respondidas por sim ou não (correspondendo a uma pontuação de 1 e 0, respectivamente), então, para um questionário composto por quatro questões, o nível de qualidade de um estudo variaria de 0 (estudo de baixa qualidade) a 4 (estudo de alta qualidade). Esses índices podem ser usados para excluir estudos. No entanto, pode valer mais a pena utilizá-los para avaliar o peso que cada estudo possui dentro do contexto geral dos estudos incluídos. Ou seja, com base nos índices de qualidade, encorajamos que os pesquisadores discutam sobre a qualidade (ou maturidade) dos estudos incluídos e o impacto de cada um deles nos resultados gerais da RS. Um estudo pode ser classificado em
diferentes níveis de maturidade, como discutido por Wieringa et al. (2005). Nesse sentido, a avaliação da qualidade também pode ser usada para auxiliar a análise e a síntese dos dados. Nesse caso, os índices de qualidade são usados para identificar subgrupos de estudos. A diferença de qualidade entre os subgrupos é investigada para verificar se essa diferença pode explicar resultados divergentes identificados nos estudos incluídos.