Inteligência Artificial
6.2 Definições básicas
obter um mapeamento f, tal que y = f(x). Se os atributos representam as propriedades essenciais dos exemplos, o sistema de AM pode representá-los em uma estrutura capaz de generalizar o conhecimento implicitamente associado aos exemplos.
Em geral, os sistemas de AM computacionalmente factíveis não operam
bem na presença de grande quantidade de atributos, e, neste contexto, a aplicação da TCA é particularmente apropriada na obtenção de atributos em bancos de dados, fornecendo uma abordagem sistemática na descoberta de
conhecimentos e na sua representação de forma compacta e eficiente. Em Pila
(2001) são encontrados detalhes relacionados à seleção de atributos relevantes para o aprendizado de máquina, utilizando a abordagem dos Conjuntos
Aproximados. O artigo de Shen e Chouchoulas (2001) aborda a questão da redução de dimensionalidade em processos de aprendizagem (supervisionado ou não), utilizando procedimentos baseados na TCA.
Os próximos itens deste capítulo contêm as definições básicas sobre
Conjuntos Aproximados, as relações com sistemas de informações e exemplos de aplicações.
6.2 Definições básicas
Um espaço aproximado é definido por S = (U, A), onde U é um conjunto de exemplos, objetos ou observações (o1) chamado de universo, e A é um conjunto de atributos de condições (a ). Para um Sistema de Informação (SI j representado por uma tabela de atributos-valores do gênero “objeto = condições + decisão”, a representação típica é dada por SI = [U, A, V, f], na qual se determinam classificações f:UxA → V, onde V constitui um conjunto de valores de atributos. A representação tabular genérica de um SI está
ilustrada na Tabela 6.1, onde os valores dos atributos de decisão estão incorporados na coluna d da tabela.
Tabela 6.1
Representação tabular genérica de um SI
Tabela 6.2
Sistema de informação relativo ao Exemplo 6.1
Em conjuntos aproximados trabalha-se geralmente com valores discretos
Para atributos numéricos é necessário aplicar algum processo de discretização
para torná-los nominais (Risvik, 1999). Algumas abordagens foram propostas
para minimizar eventuais efeitos da quantização nos dados de um SI (Nguyen
e Skowron, 1995; Carvalho, 2010).
Um conceito importante na TCA é o conceito da relação de não
discernimento ou indiscernibilidade. Se essa relação existe entre dois objetos então, tem-se um conjunto de atributos associados, e se os valores desses atributos são idênticos entre si, não se distingue um objeto do outro. Para cada subconjunto de atributos B ⊆ A, uma relação de equivalência IND(B) é associada e recebe o nome de relação de não discernimento, sendo definida
pela expressão (6.1).
(6.1)
Um atributo a é chamado dispensável em B se IND(B) = IND(B – {a }) k k
caso contrário, é indispensável. O conjunto de todas as classes de equivalência determinadas por IND(B) é representado pela notação U/IND(B). Das classes de equivalência emergem dois outros conceitos importantes: a aproximação inferior e a aproximação superior. Sendo O um conjunto de observações ta
que O ⊆ U, define-se a aproximação inferior B dada pela equação (6.2), que * representa o conjunto de possíveis exemplos ou objetos que podem ser classificados com certeza como membros de O para o correspondente conjunto de atributos B.
(6.2)
A aproximação superior B* é definida pela equação (6.3), que indica a
possibilidade dos elementos de O fazerem parte da classificação em questão.
(6.3)
Um conjunto O de objetos ou exemplos é denominado preciso (crisp) se B
(O) = B*(O), caso contrário, ele é definido como impreciso, grosseiro (rough) ou aproximado, lembrando que todos os elementos do conjunto de aproximação inferior fazem parte do conjunto de aproximação superior. Os objetos ou observações que não pertencem ao conjunto dos elementos que caracteriza a aproximação superior (que engloba também a aproximação
superior) são denominados fora da região, sendo essa definida por (6.4). A região conhecida como de borda ou de fronteira é dada pela diferença da aproximação superior pela inferior.
(6.4)
As aproximações citadas têm métricas definidas em termos dos próprios
elementos que as definem. O coeficiente de imprecisão α (O) representa a B qualidade da aproximação em relação aos elementos de O, e é expresso por
(6.5), onde |B (O)| e |B*(O)| denotam a cardinalidade da aproximação inferior e *
superior, respectivamente. O valor de α (O) varia no intervalo [0, 1], e quanto B mais próximo de um é este valor, mais preciso é O em relação ao conjunto de atributos de B. Por outro lado, quanto mais próximo de zero é o valor, mais impreciso (rough) é O em relação ao conjunto de atributos de B.
(6.5)
O coeficiente de qualidade da aproximação superior α (B*(O)), definido por B
(6.6), é interpretado como sendo o percentual de todos os objetos possivelmente classificados como pertencentes a O, sendo |U| a cardinalidade do conjunto de objetos do sistema de informação em questão.
(6.6)
O coeficiente de qualidade da aproximação inferior α (B (O)), definido po B *
(6.7), é interpretado como sendo o percentual de todos os objetos certamente classificados como pertencentes ao conjunto O.
(6.7)
O próximo item traz os procedimentos necessários para processar os dados
de um sistema de informação, objetivando extrair as informações mínimas necessárias para representá-lo de forma concisa, mesmo que na presença de imprecisões e ambiguidades.