O Dicionário Histórico-Biográfico Brasileiro (DHBB), concebido em 1974 pelo CPDOC-FGV, teve suas primeiras edições publicadas em formato físico até que, em 2010, o movimento de democratização de acesso à informação acompanhado da inerente potencialização de seu uso culminou na digitalização e disponibilização web do seu acervo. Hoje conta com mais de 7 mil verbetes, entre biográficos e temáticos, de livre acesso, que compõe um corpus de excelente qualidade, baseado em uma série de regras de redação e formato, dos quais podem-se aplicar métodos cada vez mais complexos e eficientes de recuperação da informação a fim de promover a estruturação e categorização de diversos elementos presentes neste conjunto de documentos, de enorme valor para a consulta historiográfica e estatística dentro do campo das ciências humanas.
O presente trabalho, coordenado pela profª. drª. Suemi Higuchi em conjunto com os profs. drs. Alexandre Rademaker e Jaqueline Porto Zulini, buscou a aplicação de técnicas e ferramentas de Processamento de Linguagem Natural (PLN) ao corpus do DHBB com o objetivo de treinar e aperfeiçoar um modelo de aprendizado de máquina desenvolvido a partir da ferramenta IBM Watson Natural Language Understanding/Watson Knowledge Studio capaz de realizar a tarefa de Reconhecimento de Entidades Nomeadas (NER) dentro do conjunto de verbetes do dicionário.