O projeto foi desenvolvido a partir de uma planilha da UCI contendo dados de 1885 participantes de uma pesquisa que relaciona as características pessoais de idade, gênero, educação, país de origem e etnia além de resultados de análises das características de personalidade NEO-FFI-R, escala de impulsividade Barratt BIS-11, teste de procura de sensações ImpSS e nível de uso de diversos tipos de drogas.
Para trabalhar com essa planilha foi necessária uma organização dos dados para extrair informações importantes antes de começar a classificação. Foi possível, então, descobrir o número de ocorrências de nível de uso de cada droga, organizados de “nunca usou” até “usou no último dia”.
Depois da organização da planilha decidimos utilizar como métrica de uso/não uso o uso a partir do último mês, encontramos as médias das análises de personalidade NEO-FFI-R dos indivíduos que usaram a droga dentro desta métrica (último mês) e comparamos com as médias gerais para criar grupos comuns de uso de drogas.
Com base nesses grupos, aplicamos três modelos de classificação nos dados: Naive Bayes, Decision Tree e Random Forest e calculamos a taxa de acerto dos modelos para escolher aquele que melhor descreve o comportamento dos indivíduos.
Para ter acesso ao trabalho completo, envie um e-mail para: pibic@fgv.br