Pular para o conteúdo principal

WikiData Overview

Alguns vídeos

https://youtu.be/m_9_23jXPoE
https://youtu.be/Oips1aW738Q
https://youtu.be/1jHoUkj_mKw
https://youtu.be/TXdjxnjCvng
https://youtu.be/GFh9gVUgbuA
https://youtu.be/YwhDkxDwsbA
https://youtu.be/iZVrhkoj6BM
https://youtu.be/he_ezHMVtO8

Wikidata é Linked Data, Machine and Human readable. 

As an encyclopedia is to people – a cross-referenced collection of information people can use to learn and to verify knowledge – a knowledge base is to machines. Knowledge bases can be used to drive machine learning and other AI techniques to provide core data to feed software projects, and as tools for cross-integration and cross-validation of databases, among many other uses.

It is important to have some sort of repository of knowledge that is structured to be reused within and across such projects, and this is Wikidata’s primary role. 

A Wikipedia Infobox is a summary description of a person, place, or thing in some sort of structure that allows it to be collected or contrasted with other similar things. The structure is edited by a Wikipedia editor as a set of attributes and values. 

Perguntas complexas: Quais as universidades do Reino Unido? 

Open Knowledge Graph. OPEN = cc0 license permite qualquer uso


A informação é atualizada em todas as 400+ línguas independente da língua onde foi criada ou editada. 

Schema.org > 30% dos dados publicados na Web seguem esse esquema

> 8,5 milhões de queries SPARQLs por dia

wdt: é o prefixo usado comumente para WikiData. 

As propriedades do schema Wikidata seguem o padrão P<99999> (exemplo P21 é gênero) e os itens (entidades) dos sujeitos e objetos das declarações seguem o padrão Q<999999> (exemplo Q6501072 é Feminino, Q34851 é Elizabeth Taylor, atriz )

Identificadores únicos (Q ID) para todos os itens criados. 

QIDs e PIDs são justificados pq são universais para qq língua, são estáveis (rótulos human readable podem mudar), não são reusados, são pequenos (curtos)

Os itens (entidades) podem ser conceitos concretos ou abstratos. Pessoas, Lugares, Instituições, Livros, Planetas, Elementos da Natureza, ... e também sentimentos, emoções, assuntos/temas, ...

A visão do WikiData como um documento para cada item possui: ID, Label (como se fosse o título), Descrição, Lista de Aliases, na lingua de preferência,  Statements / Declarações com propriedades e valor da propriedade ou a relação com outra entidade e o Label da Entidade em outras línguas.

Os aliases são rótulos alternativos para referenciar uma entidade, são equivalentes quando tratados como parâmetro de busca. 

Wikidata is structured as a repository of items. An item is, in common knowledge base terms, a thing, an entity, a concept. In short, whatever can be described. A repository has properties, the most important of which in Wikidata terms are the label and description. An item might also have one or more aliases, alternative labels.

Each item has a unique identifier. It is always in the form of a letter Q followed by a number. Each property also has an identifier, a P followed by a number. A statement is the triple of an item ID, a property ID, and a value. A value can be another item, which is called a reference to another item

As declarações / statements (arestas direcionadas do grafo) possuem qualificadores como data de início e fim para melhor contextualizar a informação, ou seja, são anotadas com pares de propriedade-valor

Não tem curadoria, não se colocam como a fonte primária das informações, não se preocupam com a veracidade mas com o que diversas fontes dizem sobre o assunto. O link entre as fontes de dados e cada declaração deve ser especificado como qualificador para direcionar para autoridades no assunto.  

Notice where it says “O references.” Wikipedia and related sites strongly encourage contributors to cite sources. This goes for structured data as well.

Cada propriedade possui um tipo de dados como objeto: entidades de um tipo específico, quantidades, pontos no tempo, URLs, texto em determinada língua, etc .... Uma vez associados a um tipo isso não pode ser mudado. As propriedades também possuem restrições/constraints que podem ser aplicadas online ou offline

There is actually a defined constraint on this property that values must be “administrative territorial entity” items, which would normally be enough to automatically catch this “Chao Zhongxun” issue, but unlike in most databases and much software, Wikidata constraints are not automatically enforced. You can have bots run consistency checks on the data, and the idea is that errors are allowed. Never forget that the Wikimedia projects are all about human curation, even in the case of Wikidata, the most machine-oriented.

Multi-grafo pq a mesma aresta pode ocorrer mais de uma vez com diferentes anotações

No Wikidata Query Service (WDQS) tem exemplos de queries que podem ser respondidas com o KB. Várias formas de visualização dos dados como Timeline, Mapa, Gráfico de Barras, etc... 

https://query.wikidata.org                ..........    WDQS
https://tools.wmflabs.org/sqid/#/

Freebase era do Google e foi encerrado em 2015.

Wikidata surgiu em 2012 para estruturar as informações disponíveis nos verbetes da Wikipedia.

QUERY LINKS (Histropedia - Timeline): - 

Women educated at the university of Edinburgh (simple version) : http://tinyurl.com/hvp7kjk

Women educated at the university of Edinburgh (improved version): http://tinyurl.com/jcvnw6g

Women educated at the university of Edinburgh (timeline of improved version): http://tinyurl.com/j97j3xz

É mandatório especificar a língua dos rótulos que se deseja obter ao realizar as consultas e acrescentar o sufixo "Label" nas variáveis para retornar o rótulo ao invés do ID da Entidade.

Como aumentar o conteúdo da Wikipedia dentro da WikiData? Informações redundantes fazem sentido para representação para humanos em linguagem natural. 

WikiData não tem inferência, só contém fatos mas é possível colocar uma máquina de inferência sobre ela para deduzir a partir dos fatos e responder a perguntas de senso comum como "Podem as vacas voar?".

Tutorial para acessar WikiData com jupyter notebook -> https://youtu.be/j5KwP4ifHWs

How to search entities in wikidata database and get a short description about them using Wikidata API. 

Code here: https://gist.github.com/nikhilkumarsi... https://www.wikidata.org/w/api.php

IRI para recuperar entidades da Wikidata
 
http://www.wikidata.org/entity/Q5 redirects permanently (301) to https://www.wikidata.org/entity/Q5, which redirects (303) to https://www.wikidata.org/wiki/Special:EntityData/Q5, which by default redirects (303) to a JSON document https://www.wikidata.org/wiki/Special:EntityData/Q5.json.
 
curl -L -H "Accept: text/turtle" http://www.wikidata.org/entity/Q5
 
Curso sobre KG que cobre Wikidata -> https://iccl.inf.tu-dresden.de/web/Knowledge_Graphs_(WS2020)/en
Canal do YouTube -> https://www.youtube.com/channel/UCCvDWNsR8YlQrB1tSj9Xqsw/videos

Recursos que podem ser interessantes explorar

https://github.com/nichtich/wikidata-taxonomy

@dataset{benno_funfstuck_2020_3701865,
  author       = {Benno Fünfstück},
  title        = {Wikidata Dump Taxonomy},
  month        = mar,
  year         = 2020,
  publisher    = {Zenodo},
  doi          = {10.5281/zenodo.3701865},
  url          = {https://doi.org/10.5281/zenodo.3701865}
}

http://wikifier.org/info.html ..... tem post sobre aqui no Blog

Graph Database que suporta a WDQS -> https://blazegraph.com/

Comentários

  1. Descobri que no DBLP é possível acessar a referência de um autor no Wikidata. Vou verificar se o mesmo acontece para Revistas, Conferências e Artigos

    ResponderExcluir
  2. Não tem curadoria para Qnodes mas tem para Pnodes (propriedades)

    ResponderExcluir
  3. Wikibase stores data internally as JSON and makes that data available in various formats including, but not limited to, RDF.

    Wikibase stores data in JSON instead of RDF because Wikibase’s data model is considerably more complex than a simple triple -- users may add references, qualifiers and ranks.

    A descrição do JSON está aqui -> https://doc.wikimedia.org/Wikibase/master/php/md_docs_topics_json.html

    ResponderExcluir
    Respostas
    1. O modelo de dados WD -> https://www.mediawiki.org/wiki/Wikibase/DataModel

      Tentar entender melhor esse conceito de snack

      Excluir

Postar um comentário

Sinta-se a vontade para comentar. Críticas construtivas são sempre bem vindas.

Postagens mais visitadas deste blog

Aprendizado de Máquina Relacional

 Extraído de -> https://www.lncc.br/~ziviani/papers/Texto-MC1-SBBD2019.pdf   Aprendizado de máquina relacional (AMR) destina-se à criação de modelos estatísticos para dados relacionais (seria o mesmo que dados conectados) , isto é, dados cuja a informação relacional é tão ou mais impor tante que a informação individual (atributos) de cada elemento.    Essa classe de aprendizado tem sido utilizada em diversas aplicações, por exemplo, na extração de informação de dados não estruturados [Zhang et al. 2016] e na modelagem de linguagem natural [Vu et al. 2018].   A adoção de técnicas de aprendizado de máquina relacional em tarefas de comple mentação de grafo de conhecimento se baseia na premissa de existência de regularidades semânticas presentes no mesmo . Modelos grafos probabilísticos  Baseada em regras / heurísticas que não podem garantir 100% de precisão no resultado da inferência mas os resultados podem ser explicados. Modelos de características de ...

Connected Papers: Uma abordagem alternativa para revisão da literatura

Durante um projeto de pesquisa podemos encontrar um artigo que nos identificamos em termos de problema de pesquisa e também de solução. Então surge a vontade de saber como essa área de pesquisa se desenvolveu até chegar a esse ponto ou quais desdobramentos ocorreram a partir dessa solução proposta para identificar o estado da arte nesse tema. Podemos seguir duas abordagens:  realizar uma revisão sistemática usando palavras chaves que melhor caracterizam o tema em bibliotecas digitais de referência para encontrar artigos relacionados ou realizar snowballing ancorado nesse artigo que identificamos previamente, explorando os artigos citados (backward) ou os artigos que o citam (forward)  Mas a ferramenta Connected Papers propõe uma abordagem alternativa para essa busca. O problema inicial é dado um artigo de interesse, precisamos encontrar outros artigos relacionados de "certa forma". Find different methods and approaches to the same subject Track down the state of the art rese...

Knowledge graphs: Introduction, history, and perspectives - Leitura de Artigo

Chaudhri, V. K., C. Baru, N. Chittar, X. L. Dong, M. Genesereth, J. Hendler, A. Kalyanpur, D. Lenat, J. Sequeda, D. Vrandečić, and K.Wang 2022. “ Knowledge graphs: Introduction, history, and perspectives. ” AI Magazine 43: 17–29. https://doi.org/10.1002/aaai.12033 Knowledge graphs (KGs) have emerged as a compelling abstraction for organizing the world’s structured knowledge and for integrating information extracted from multiple data sources. KNOWLEDGE GRAPH DEFINITION A KG is a directed labeled graph in which domain-specific meanings are associated with nodes and edges. [ Definição focado no COMO representar, diferente dos KBs ] There are multiple approaches for associating meanings with the nodes and edges. At the simplest level, the meanings could be stated as documentation strings expressed in a human understandable language such as English. At a computational level, the meanings can be expressed in a formal specification language such as first-order logic. An active area of curren...