Saltar al contenido
Menú

Apariencia

Idioma

GitHub — @IchiSieben
Proyectos

Predictor de Ingresos e Informalidad

En vivo usable

Comparé 9 especificaciones de modelo para predecir el ingreso laboral y el riesgo de informalidad en Perú, con la encuesta ENAHO.

Estima el ingreso laboral y la probabilidad de empleo informal en Perú con microdatos ENAHO 2025. Compara nueve especificaciones y muestra el camino completo, no solo el modelo ganador.

2 min de lectura Demo en vivo (puede tardar ~1 min en despertar) → Las apps gratuitas de Streamlit se duermen si nadie las visita; el primer visitante las despierta, y eso puede tardar cerca de un minuto. Código →

Tecnología

  • Machine learning
  • Visualización

Sector

  • Economía & finanzas
  • Sector público

Problema

La conversación pública sobre informalidad laboral en Perú discute con anécdotas. Los microdatos de ENAHO ya existen, pero casi nadie fuera de la academia los convierte en un número que un tomador de decisiones o un visitante curioso pueda usar de verdad, o muestra la disyuntiva entre un modelo que explica y uno que solo predice.

Enfoque

Torneo de modelos (OLS, Mincer, Lasso, RF, GB) más un clasificador de informalidad, construido para mostrar el camino completo, no solo el modelo que ganó.

Nueve especificaciones de ingreso corren bajo el mismo split 80/20 y validación cruzada de 5 pliegues, desde una lectura literal de la ecuación de Mincer de aula hasta gradient boosting sobre el logaritmo del ingreso, seleccionadas por MAE de validación cruzada y no espiando el conjunto de prueba. El modelo desplegado (E9, gradient boosting) mejora a la mejor especificación interpretable en S/ 79 de MAE -una brecha que se lee como el aporte de no linealidades e interacciones que una forma lineal no puede capturar, no como prueba de que el modelo simple está mal. Ningún R² supera 0,5 en soles, algo que el README encuadra contra el propio R² de libro de Mincer, de 0,25-0,35 en logaritmo del ingreso -otra escala, citada para que la cifra no se confunda con un ajuste mejor del que realmente es.

Un segundo clasificador, entrenado por separado, estima el riesgo de empleo informal con los mismos microdatos: gradient boosting llega a un PR-AUC de 0,96 contra una prevalencia base de 0,68, con un punto operativo elegido sobre probabilidades out-of-fold de entrenamiento (nunca de test), de modo que, de cada 1 000 trabajadores señalados, cerca de 900 son efectivamente informales. Se reporta también una ablación estructural -quitar solo el tamaño de empresa baja el PR-AUC a 0,957- justamente para que el número no se lea como más de lo que es: una herramienta de focalización para programas, no un pronóstico del futuro laboral de nadie.

Resultado

MAE, modelo de ingreso desplegado (S/)
610,8S/

reports/torneo_regresion.md

PR-AUC, clasificador de informalidad (test)
0,961

reports/clasificador_informalidad.md

especificaciones comparadas
9

README.md

Estándares

Calidad de software (ISO/IEC 25010) Se atacó con el torneo mismo, no con un pase formal de ISO/IEC 25010: 9 especificaciones comparadas bajo el mismo split 80/20 y CV de 5 pliegues, más un estudio de ablación sobre el clasificador (README §2-3).
Rendimiento web (Core Web Vitals) no medido
Accesibilidad (WCAG 2.2) no medido
Software de investigación (FAIR4RS) parcial — la fuente de datos (ENAHO 2025, INEI) está citada y el código es público, pero el análisis en sí no tiene DOI ni archivo de citación
Higiene de seguridad no medido
Reproducibilidad Dependencias fijadas; el mismo split 80/20 y CV de 5 pliegues se reutiliza en las 9 especificaciones para que los resultados sean comparables entre sí, no solo reproducibles por separado.
Metodología de benchmark Benchmark con validación cruzada y protocolo declarado (CV de 5 pliegues, un split fijo, selección por métrica de CV antes de tocar test) — README §2, confirmado en el conjunto de prueba reservado.
Documentación de datos / modelo Presente: tablas de métricas por modelo (MAE, R², PR-AUC, Brier), tabla de punto operativo y ablación estructural sobre el clasificador (README §2-3).
Versionado y registro de cambios Código y modelos con licencia Apache-2.0 (LICENSE), documentación CC BY-NC 4.0; sin CHANGELOG.

Qué haría después

  • Publicar la página HTML propia en /predictor-ingresos/ con el iframe ?embed=true (congelada en este pase; ver nota en el front matter).
  • Reprobar el arranque en frío de Streamlit tras más de 12 h de inactividad y sumar la etiqueta honesta de espera si sigue durmiéndose.
  • Publicar los coeficientes ponderados del modelo explicativo (educación, género, tamaño de empresa) como una segunda vista legible junto a la predictiva.