Pular para o conteúdo principal

KGTK @ VM029 - NTriples extraída do Allegro - parte II

Agendado via crontab na VM029

Embeddings do grafo

kgtk graph-embeddings -i lattes-prof3.tsv -o lattes-g_emb-ComplEx.glo --output_format glove -op ComplEx

Início 04/06 23:40           Término 05/06 02:22              Arquivo de resultado com 2.6G

kgtk graph-embeddings -i lattes-prof3.tsv -o lattes-g_emb-TransE.tsv --output_format kgtk -op TransE

Início 05/06 02:22           Término 05/06 04:59              Arquivo de resultado com 2.6G

kgtk graph-embeddings -i lattes-prof3.tsv -o lattes-g_emb-RESCAL.tsv --output_format kgtk -op RESCAL

Início 05/06 04:59           Término 05/06 20:36              Arquivo de resultado com 2.6G

kgtk graph-embeddings -i lattes-prof3.tsv -o lattes-g_emb-DistMult.w2v --output_format w2v -op DistMult

Início 05/06 20:36           Término 05/06 20:57              Arquivo de resultado com 2.6G

Mais explicações sobre cada opção em https://versant-pesquisadedoutorado.blogspot.com/2021/05/kgtk-graph-embeddings.html

Propriedades usadas para Text Embeddings

Rótulos: foaf:name foaf:citationName dc:title skos:prefLabel
Descrição: bio:biography
Tipos: rdf:type e bibo:degree (subtipo para tese ou dissertação)
Outras propriedades: foaf:identifier, bibo:doi, foaf:homepage


kgtk sort -c node1 -i lattes-prof3.tsv -o lattes-prof4.tsv
kgtk text-embedding -i lattes-prof4.tsv -o lattes-prof-t_emb.tsv --model bert-base-wikipedia-sections-mean-tokens bert-base-nli-cls-token --label-properties foaf:name foaf:citationName dc:title skos:prefLabel --description-properties bio:biography --isa rdf:type bibo:degree --has-properties foaf:identifier bibo:doi foaf:homepage --dimensional-reduction tsne
kgtk sort -c node2 -i lattes-prof4.tsv -o lattes-prof4-sorted.tsv

* até o momento não consegui concluir a execução da geração do text embeddings por questões técnicas da VM, da última vez a máquina travou depois de 48 horas executando, deixei processando novamente

Comentários

  1. Na última segunda, dia 28/06 as 20:30, foi executado novamente a geração de word embeddings mas processo não foi concluído novamente. A última linha do log mostra 57%, a data/hora da última atualização do arquivo de log está como 29/06 as 23:04 mas não indica erro e também não tem registro de reinicialização da máquina
    57%|█████▋ | 954621/1665264 [26:21:42<153834:35:59, 779.30s/it]

    Alterei o comando para colocar em modo verbose e para dois processos paralelos para verificar se vai funcionar.

    Se não concluir até quarta-feira, pretendo fazer um filtro no arquivo de entrada e separa a geração de embeddings para entidades do tipo Autor/Pesquisador/Pessoa e entidades do tipo Produções

    ResponderExcluir
    Respostas
    1. Ainda não consegui executar essa geração de Text Embeddings

      Excluir

Postar um comentário

Sinta-se a vontade para comentar. Críticas construtivas são sempre bem vindas.

Postagens mais visitadas deste blog

Aprendizado de Máquina Relacional

 Extraído de -> https://www.lncc.br/~ziviani/papers/Texto-MC1-SBBD2019.pdf   Aprendizado de máquina relacional (AMR) destina-se à criação de modelos estatísticos para dados relacionais (seria o mesmo que dados conectados) , isto é, dados cuja a informação relacional é tão ou mais impor tante que a informação individual (atributos) de cada elemento.    Essa classe de aprendizado tem sido utilizada em diversas aplicações, por exemplo, na extração de informação de dados não estruturados [Zhang et al. 2016] e na modelagem de linguagem natural [Vu et al. 2018].   A adoção de técnicas de aprendizado de máquina relacional em tarefas de comple mentação de grafo de conhecimento se baseia na premissa de existência de regularidades semânticas presentes no mesmo . Modelos grafos probabilísticos  Baseada em regras / heurísticas que não podem garantir 100% de precisão no resultado da inferência mas os resultados podem ser explicados. Modelos de características de ...

Defesa de Doutorado de Grettel Monteagudo Garcia

A última atividade presencial que fiz na PUC-Rio foi assistir a defesa de tese da Grettel Monteagudo Garcia , em 13/03/2020 (uma sexta-feira 13 !!!!). O título da tese é “ A Keyword-based Query Processing Method for Datasets with Schemas ” e me interessou por causa do projeto do NIMA. A proposta parte do cenário onde usuários possam consultar dados, armazenados em bancos de dados relacionais e TripleStores, de maneira semelhante ao Google, ou seja, digitando palavras-chave, e deixando para o sistema recuperar os dados que melhor correspondem ao conjunto de palavras-chave.  Na tese estão descritos um algoritmo e um framework projetados para processar consultas baseadas em palavras-chave para bases de dados com esquema, especificamente bancos relacionais e bases de dados em RDF. A primeira etapa do algoritmo é a conversão do conjunto de palavras chaves em uma consulta abstrata explorando um esquema abstrato . Nesta etapa o principal desafio é achar onde a informação está (os matches...

Metodologia Científica II - continuação

No primeiro post  foram detalhados os 6 primeiros vídeos do canal do Youtube do professor Eduardo Ogasawara do CEFET/RJ   Mais 3 vídeos foram disponibilizados e estão comentados a seguir: Gráficos, Figuras e Tabelas (33 minutos) - como apresentar os resultados das avaliações experimentais. Gráficos: associar análises dos resultados a cada gráfico apresentado, problemas comuns na montagem de gráficos (não usar todo eixo X ou Y, não usar área útil com uma escala adequada a ver o comportamento dos números, não marcar os pontos de observação da série, inconsistência no uso de cores ), escala logarítmica x linear, eixo X para a variável independente e Y para a dependente (resposta), escrever boas legendas para os gráficos, observar se diferenças entre variáveis apresentadas em gráficos separados podem atrapalhar a interpretação dos resultados. Diagramas devem ser pensados de acordo com o propósito, trata-se de uma abstração e cada elemento deve ser explicado no texto, rótulos...