Detecting at-risk students for dropout: a comparative study of longitudinal vs. aggregated data models
Loading...
Submission Date
Defense Date
2026-06-22
Edition
Authors
Advisors
Co-Advisors
Editors
Journal Title
Journal ISSN
Volume Title
Publisher
Description
A evasão estudantil no ensino superior representa um desafio global crítico e multifacetado, com impactos significativos para os estudantes, as instituições de ensino e a sociedade. As abordagens tradicionais de monitoramento e intervenção frequentemente apresentam limitações para capturar a complexidade e os sinais precoces associados ao processo de evasão. Nesse contexto, o Aprendizado de Máquina tem se consolidado como uma abordagem promissora para a identificação precoce de estudantes em risco de evasão, embora sua aplicação prática exija o enfrentamento dos desafios inerentes aos dados educacionais. Com base em uma base de dados longitudinal, na qual cada estudante é representado por múltiplas amostras correspondentes aos semestres cursados, este trabalho compara duas abordagens de modelagem: (1) a representação longitudinal original e (2) uma representação agregada, em que cada estudante é representado por uma única amostra. Os resultados demonstraram uma melhoria relativa de 10,22% na área sob a curva de Precisão-Recall (AUPRC). Além disso, verificou-se que o balanceamento dos dados não proporciona ganhos de desempenho e, em alguns casos, resulta na redução da performance dos modelos. Os resultados sugerem que, embora os classificadores sejam robustos ao desbalanceamento de classes, a forma como os estudantes são representados permanece como um desafio fundamental. Por fim, a interpretação do modelo por meio do SHAP evidenciou a importância do processamento adequado de variáveis numéricas e categóricas e identificou os principais fatores associados à evasão, tornando o modelo uma ferramenta prática de apoio à tomada de decisão institucional. [resumo fornecido pelo autor]
Abstract
Student dropout in higher education is a critical, multifaceted global challenge with significant implications for students, institutions, and society at large. Traditional monitoring and intervention approaches often struggle to capture the complexity and early signals associated with student disengagement. In response, Machine Learning has emerged as a strategic approach for the early identification of students at risk of dropping out, but its practical application requires addressing the challenges inherent in educational data. Based on a raw longitudinal dataset, where each student is represented by multiple samples corresponding to the enrolled semesters, we compare two modeling approaches: (1) the original longitudinal representation, and (2) an aggregated representation, where each student is represented by a single sample. The results demonstrated a relative improvement of 10.22% in the area under the Precision-Recall Curve (AUPRC). Additionally, we found that balancing the data offers no performance gains and, in some cases, leads to a decrease in model performance. The results suggest that while the classifiers are robust to class imbalance, how students are represented remains a critical challenge. Finally, the model interpretation using SHAP highlighted the importance of numerical and categorical feature processing and identified the key factors associated with dropout, transforming the model into a practical tool for institutional decision support. [resumo fornecido pelo autor]
