Pular para o conteúdo principal

Minicurso - SBBD 2020 - LNCC Aprendizado de Máquina Aplicado a KG

Fonte -> https://youtu.be/hWaoEOdTwas

Slides: https://sbbd.org.br/2020/wp-content/uploads/sites/13/2020/10/Aprendizado-de-Maquina-aplicado-a-Grafos-de-Conhecimento-3-Unicode-Encoding-Conflict.pdf

  1. Introdução
  2. Modelos e Sistemas para KG
  3. Tarefas de KG
    1. Construção
    2. Completação
  4. Trabalhos Futuros, Problemas em Aberto, Aplicações

Terceira onde de Inteligência Artificial é o contexto atual e de desenvolvimento dos KGs

Representação e Raciocínio de Conhecimento é uma su área de IA: Redes Semânticas (Taxonomias, Frames), Ontologias, Web Semantica, LOD e KG

Things is not strings : Google para impulsionar os KG

Não existe uma definição formal para KG. Elementos que caracterizam: Entidades do mundo real, Relacionamento entre entidades, Podem conter restrições e regras (uma ontologia ou esquema para descrever, na forma de grafo também), Permitem inferência de novos fatos (não observados, existentes no KG) ... Componentes Terminológicas /Taxonomia / Esquema & Componentes Assercionais / Instâncias / Entidades do Mundo Real

Associados a: GraphDB, TripleStores, Ontologias, Redes Semânticas, Bases de Conhecimento (KB)

Integração de Dados: KG como artefato de integração

SciGraph: outro exemplo de KG acadêmico

Aplicação: Agentes Conversacionais (Chat Bot), Integrações de Dados (Silo de dados, Medicina personalizada), Verificação de fatos (Identificar o menor caminho entre duas entidades de um grafo pode fornecer evidências para provar ou refutar afirmações), Q&A (perguntas em linguagem natural como consultas, mapeamento em um esquema mais flexível), Sistemas de Recomendação (grafos bipartidos, problema de Cold Start, como caracterizar a similaridade entre entidades e como modelar essas entidades com esse propósito) e Motores de Busca (primeiras aplicações, recuperam entidades relacionadas) 

Amazon Neptune usa modelo RDF e LPG

Namespaces: prefixos para URI

Três Desafios: Cobertura / Completude, Atualização e Acurácia / Corretude. 

No escopo: Como construir KG a partir de documentos? Como inferir novo conhecimento a partir dos fatos existentes no grafo?

Fora do escopo: Como realizar o merge entre KG? Como verificar a veracidade dos fatos contidos no KG? Como alinhar KG ou Ontologias?

Tarefas que usam NLP e Embeddings para extrair informação de dados não estruturados: 

  1. Named Entity Recognition (NER)
  2. Entity Linking (EL): Desambiguação, Geração de candidatos, Ranking de candidatos (mais próximo do contexto de interesse deve ser mais relevante)
  3. Relation Extraction: identificar as relações entre as Entidades anteriormente linkadas

Exemplo de sistemas: Fonduer (SIGMOD 2018) - funções de rotulagem para classificação usando modelos de aprendizagem de máquina; GAIA (ACL 2020) - usa redes de convolução para as tarefas com dados de entrada que podem ser texto, tabelas, imagens, ...

Completação / Predição de Links: A tripla (s,p,o) é verdadeira? Qual seria um o possível, se p for uma relação entre objetos? Qual seria um o possível, se p for um atributo de s? Qual seria um o possível, se p for o tipo de s?  Qual seria um s possível? Qual seria um p possível? 

Classificação (is a) de entidades é um tipo específico de predição de link. 

Relational Machine Learning

  • Modelos probabilístico: modelam a interdependência entre as triplas
  • Graph Feature Model:  associar features a entidades e relacionamentos, triplas independentes, engenharia de características
  • Latent Feature Models: embeddings

KGE

Representações para Entidades, Relações, Caminhos, Grafo Completo e no espaço vetorial aprendido as entidades semelhantes ficarão próximas. 

Grafo de entrada, Geração de exemplos negativos (manual ou negative sampling), Função de custo, Score de cada tripla e algoritmo de otimização

TransE: relações estão representadas como a distancia vetorial entre os seus nós. O score da tripla é a distância L1 entre a representação vetorial dos nós, soma o Vs e Vr e diminui o Vo. Não lida com relações 1-N, N-1 e N-M. 

Modelos shallow: poucas camadas ... o TransE é um exemplo, aplicar uma função linear aos embeddings

Deep: as funções de classificação possuem camadas escondidas, cuidado com overfitting e a complexidade de tempo e espaço ... ConvE (AAAI 2018)  é um exemplo

Hiper grafos de conhecimento: Beyond Triples Hyper KG Embeddings for Linking Prediction WWW 2020 HINGE

Beyond Triplet Reasoning: Subgraph matching may be exponential and partially observed data

Query2box: ICLR 2020


Embedding Logical Queries on KG (NIPS 2018)

AmpliGraph com Tensorflow

KGE e a falta de representação simbólica para regras e restrições


Comentários

Postagens mais visitadas deste blog

Aprendizado de Máquina Relacional

 Extraído de -> https://www.lncc.br/~ziviani/papers/Texto-MC1-SBBD2019.pdf   Aprendizado de máquina relacional (AMR) destina-se à criação de modelos estatísticos para dados relacionais (seria o mesmo que dados conectados) , isto é, dados cuja a informação relacional é tão ou mais impor tante que a informação individual (atributos) de cada elemento.    Essa classe de aprendizado tem sido utilizada em diversas aplicações, por exemplo, na extração de informação de dados não estruturados [Zhang et al. 2016] e na modelagem de linguagem natural [Vu et al. 2018].   A adoção de técnicas de aprendizado de máquina relacional em tarefas de comple mentação de grafo de conhecimento se baseia na premissa de existência de regularidades semânticas presentes no mesmo . Modelos grafos probabilísticos  Baseada em regras / heurísticas que não podem garantir 100% de precisão no resultado da inferência mas os resultados podem ser explicados. Modelos de características de ...

Defesa de Doutorado de Grettel Monteagudo Garcia

A última atividade presencial que fiz na PUC-Rio foi assistir a defesa de tese da Grettel Monteagudo Garcia , em 13/03/2020 (uma sexta-feira 13 !!!!). O título da tese é “ A Keyword-based Query Processing Method for Datasets with Schemas ” e me interessou por causa do projeto do NIMA. A proposta parte do cenário onde usuários possam consultar dados, armazenados em bancos de dados relacionais e TripleStores, de maneira semelhante ao Google, ou seja, digitando palavras-chave, e deixando para o sistema recuperar os dados que melhor correspondem ao conjunto de palavras-chave.  Na tese estão descritos um algoritmo e um framework projetados para processar consultas baseadas em palavras-chave para bases de dados com esquema, especificamente bancos relacionais e bases de dados em RDF. A primeira etapa do algoritmo é a conversão do conjunto de palavras chaves em uma consulta abstrata explorando um esquema abstrato . Nesta etapa o principal desafio é achar onde a informação está (os matches...

Metodologia Científica II - continuação

No primeiro post  foram detalhados os 6 primeiros vídeos do canal do Youtube do professor Eduardo Ogasawara do CEFET/RJ   Mais 3 vídeos foram disponibilizados e estão comentados a seguir: Gráficos, Figuras e Tabelas (33 minutos) - como apresentar os resultados das avaliações experimentais. Gráficos: associar análises dos resultados a cada gráfico apresentado, problemas comuns na montagem de gráficos (não usar todo eixo X ou Y, não usar área útil com uma escala adequada a ver o comportamento dos números, não marcar os pontos de observação da série, inconsistência no uso de cores ), escala logarítmica x linear, eixo X para a variável independente e Y para a dependente (resposta), escrever boas legendas para os gráficos, observar se diferenças entre variáveis apresentadas em gráficos separados podem atrapalhar a interpretação dos resultados. Diagramas devem ser pensados de acordo com o propósito, trata-se de uma abstração e cada elemento deve ser explicado no texto, rótulos...