Classificação Léxica de Publicações de Humanidades Digitais Apoiada em Abordagem Taxonômica
Humanidades Digitais, Análise por Tópicos, Aprendizado de Máquina
O uso de análises automatizadas de texto é uma das ferramentas computacionais principais na classificação de publicações acadêmicas. Dentre outros atributos, uma motivação relevante do uso dessas ferramentas reside na sua capacidade de auxiliar a comunidade acadêmica na busca e recuperação de referências bibliográficas em meio à inundação informacional a qual estamos inseridos atualmente. Partindo de uma quantidade relativamente pequena de publicações classificadas artesanalmente por especialistas, o emprego de uma ferramenta de classificação automatizada estende amplamente essa quantidade. Nesse contexto, propomos a utilização da versão supersionada do método de classificação léxica denominado Latent Dirichlet Allocation (LDA). para realizar a em duas etapas. A etapa de treinamento do método é realizado com um corpus de publicações classificadas artesanalmente por especialistas do campo adquiridos do grupo Doing Digital Humanities - A DARIAH Bibliography disponível na plataforma Zotero. As classes utilizadas nessa classificação artesanal corresponde a estratos da estrutura semântica hierárquica própria da taxonomia TaDiRAH, elaborada por uma iniciativa internacional para a classificação de publicações em Humanidades Digitais. Com o intuito de produzir um modelo mais preciso, propomos procedimentos para lidar com desbalanceamento de quantidade de amostras em cada classe e com sobreposições de publicações em múltiplos estratos. O modelo assim produzido é então usado para classificar um corpus de publicações retiradas da Web Of Science. Objetivamos colaborar para o desenvolvimento do campo no sentido de estimular o uso da TaDiRAH rumo a universalização da organização, armazenamento e recuperação de recursos de pesquisa.