Coletânea Python do ZERO às Redes Neurais Artificiais

Fernando Feltrin · Capítulo 252 de 287

Páginas do PDF

Coletânea Python do ZERO às Redes Neurais Artificiais

Características Específicas do Aprendizado por Reforço

Características Específicas do Aprendizado por

Reforço

 

À medida que vamos construindo nossa bagagem de conhecimento sobre

o assunto, vamos cada vez mais contextualizando ou direcionando nosso foco para as redes neurais artificiais intuitivas. Nesse processo será fundamental começarmos a entender outros conceitos das mesmas, entre eles, o de aprendizado por reforço utilizado neste tipo de rede neural.

Como mencionado anteriormente de forma rápida, o chamado

aprendizado por reforço implicitamente é a abstração da forma cognitiva de como nós seres vivos aprendemos de acordo com a forma com que experenciamos esse mundo. Por meio de nossos sentidos enxergamos, ouvimos, saboreamos e tocamos deferentes objetos e criando memórias de como interagimos e que experiência tivemos com os mesmos.

Da mesma forma, porém de forma artificial, teremos um agente que

simulará um ser vivo ou ao menos um objeto inteligente que por sua vez, via sensores (equivalendo aos seus sentidos), ele fará a leitura do ambiente e com o chamado aprendizado por reforço, experenciará o mesmo realizando ações com os objetos e aprendendo com base em tentativa erro ou acerto.

Para isso, existirão uma série de algoritmos que veremos nos capítulos

subsequentes em maiores detalhes que literalmente simularão como esse agente usará de seus recursos de forma inteligente. Desde o mapeamento do ambiente, dos estados e das possíveis ações até a realização das mesmas em busca de objetivos a serem cumpridos gerando recompensas ou penalidades, por fim guardando os melhores estados em uma memória.

Então, apenas definindo algumas características deste tipo de algoritmo,

podemos destacar:

 

- A partir do seu start, toda execução posterior é autônoma, podendo ser em tempo real via backpropagation ou em alguns casos via aprendizado por gerações quando numa tarefa repetitiva.

- Pode ter ou não um objetivo definido, como ir de um ponto A até o B ou aprender a se movimentar dentro de um ambiente fechado, respectivamente.

- Realiza leitura de sensores que simulam sentidos, mapeando o ambiente ao seu redor e o seu estado atual (que tipo de ação está realizando).

- Busca alcançar objetivos da forma mais direta, de menor tempo de execução ou mais eficiente, trabalhando com base em sua memória de experiência, estado e recompensas.

- Usa de redes neurais realizando processamento retroalimentado em tempo real, convertendo as saídas encontradas em tomadas de decisão.

- Possui um tempo considerável de processamento até gerar suas memórias de curta e longa duração, dependendo da complexidade de sua aplicação, precisando que uma determinada ação seja repetida milhares ou milhões de vezes repetidamente até que se encontre e aprenda o padrão correto.