Inteligência Artificial
4.5 Separação em conjunto de dados
A etapa de normalização de dados tem o objetivo de evitar que valores de
maior amplitude exerçam influência sobre a convergência dos algoritmos utilizados na etapa de treinamento da rede, privilegiando determinada variáve em detrimento de outras com menor amplitude (mas não menos importantes) Para a obtenção de um bom desempenho das RNAs, geralmente, trabalham com dados num intervalo definido, na maioria das vezes na faixa de [0,1] ou
[-1,1]. A equação (4.1) mostra o procedimento de normalização no intervalo
[0,1], enquanto a equação (4.2) trata da normalização no intervalo [-1,1].
(4.1)
(4.2)
4.5 Separação em conjunto de dados
Sob a perspectiva de aprendizagem supervisionada, o conjunto de padrões disponíveis para um dado problema pode ser separado em subconjuntos que contribuem ainda mais para o aumento da capacidade de generalização da rede. Assim, o conjunto original de dados é subdividido em três subconjuntos treinamento; validação; teste. Esta subdivisão do conjunto de dados origina em três subconjuntos é muito comum em aplicações de inteligência artificial principalmente em algoritmos que requerem algum tipo de treinamento supervisão e aprendizagem. Essa divisão obedece a uma porcentagem para cada subconjunto. O conjunto de treinamento deve reunir o maior número possível de padrões, sem prejudicar, obviamente, os outros subconjuntos, de forma a representar convenientemente o universo das observações e permitir a generalização do aprendizado. O conjunto de validação é utilizado para verificar a eficiência da rede quanto a sua capacidade de generalização durante o treinamento, e também pode ser empregado como critério de parada da etapa de treinamento.