Agregação Bootstrap e Florestas Aleatórias

Ano
2021
Escola
EMAp - Escola de Matemática Aplicada
Aluno-pesquisador
Igor Cortes Junqueira
Orientador
Profª. Asla Medeiros e Sá
Localidade
Rio de Janeiro

Contemplado com bolsa PIBIC em 2021.1, e dando continuidade ao percurso de iniciacão científica, cursei a disciplina de Téctinas e Algoritmos em Ciência de Dados, na qual obtive aprovacão. Nela, além do conteúdo e exercícios casuais, houveram duas avaliações, A1 e A2, compostas igualmente por uma prova e trabalho cada. Nos trabalhos, foram desenvolvidos uma série de ferramentas e técnicas.

No primeiro trabalho, passando pela manipulação e limpeza de dados, exploramos conjuntos divididos por categorias com sua projeção de pontos, histogramas e índices de correlação. Feito isso, implementamos manualmente um modelo classificador baseado na mistura de gaussianas em python.

Por fim, foi feita uma análise comparativa do modelo implementado (mistura de gaussianas), com outros classificadores comumente utilizados como Naive- Bayes, K-Nearest-neighbour e um classificador bayesiano com uma única gaussiana.

Para a comparacão, traçamos diversas métricas como Accuracy, Precision, Recall, AUC-ROC e AUC-PR. Por fim, a implementação feita foi adaptada para um classificador como da biblioteca scikit learn.

Já na segunda parte da disciplina, o trabalho final trouxe outros conceitos. Nele, construímos uma rede neural 'do zero' com uma arquitetura especificada e a treinamos com um algoritmo de retro programação. Ademais, foi implementado também um modelo de arvores ensacadas, usando agregagação de bootstrap, baseando em outro conjunto de dados. Na mesma linha, também foi feita e treinada uma oresta aleatória.

Finalmente, similar ao feito no primeiro trabalho, comparamos os dois ultimos modelos no conjunto de dados usando novamente as mesmas métricas. Ademais, como questão extra, tivemos um conjunto de dados ao qual adequar o modelo que elegessemos de forma a realizar previsões para outro conjunto. A ideia era conseguir as melhores previsões sem saber o processo gerador, os valores reais ou a melhor escolha de modelo.