O DHBB como corpus: minerando informações através de uma abordagem linguisticamente motivada

Ano
2021
Escola
CPDOC - Escola de Ciências Sociais
Aluno-pesquisador
Daniel Bonatto Seco
Orientador
Profª. Suemi Higuchi
Localidade
Rio de Janeiro

O Dicionário Histórico-Biográfico Brasileiro (DHBB), concebido em 1974 pelo CPDOC-FGV, teve suas primeiras edições publicadas em formato físico até que, em 2010, o movimento de democratização de acesso à informação acompanhado da inerente potencialização de seu uso culminou na digitalização e disponibilização web do seu acervo. Hoje conta com mais de 7 mil verbetes, entre biográficos e temáticos, de livre acesso, que compõe um corpus de excelente qualidade, baseado em uma série de regras de redação e formato, dos quais podem-se aplicar métodos cada vez mais complexos e eficientes de recuperação da informação a fim de promover a estruturação e categorização de diversos elementos presentes neste conjunto de documentos, de enorme valor para a consulta historiográfica e estatística dentro do campo das ciências humanas.

O presente trabalho, coordenado pela profª. drª. Suemi Higuchi em conjunto com os profs. drs. Alexandre Rademaker e Jaqueline Porto Zulini, buscou a aplicação de técnicas e ferramentas de Processamento de Linguagem Natural (PLN) ao corpus do DHBB com o objetivo de treinar e aperfeiçoar um modelo de aprendizado de máquina desenvolvido a partir da ferramenta IBM Watson Natural Language Understanding/Watson Knowledge Studio capaz de realizar a tarefa de Reconhecimento de Entidades Nomeadas (NER) dentro do conjunto de verbetes do dicionário.