MODELADO PREDICTIVO Y APRENDIZAJE AUTOMÁTICO
Optimización de Movilidad Urbana · Citi Bike NYC
Sprint 3
DataPedal Consulting Group · Grupo 301 · CRISP-DM · Mayo 2026
4 modelos ML
99.6M de viajes (datos)
Daniel Castro Knöhr A01788052 Jorge Gerardo Maya A01664595 Javier Emmanuel Murillo Ángeles A01659139 Axel Molina A01029496 Sebastian Gonzalez Del Moral A01786196
Objetivo y hallazgos clave del Sprint 3
RESUMEN EJECUTIVO:
Objetivo: Aplicar Machine Learning supervisado y no supervisado sobre la tabla trips_weather que incluye 99.6M viajes desde ene 2024 a abr 2026.
Fase 1 · No supervisada
Fase 2 · Supervisada
Clustering K-Means de estaciones para inferir el tipo de zona urbana.
Clasificación para predecir si un viaje es de usuario member o casual.
MODELOS APLICADOS
CÓMO LO HICIMOS : Pipeline
Primero agrupamos las varaibles por su comportamiento: luego usamos esos grupos para predecir el tipo de usuario.
Paso 1 · Agrupar estaciones
Paso 2 · Predecir el usuario
Con K-Means agrupamos las 2,421 estaciones según cómo se usan (volumen, horario, duración…). Resultado: cada estación recibe un tipo de zona.
Con ese tipo de zona y los datos del viaje, predecimos si el usuario es member o casual. Probamos 4 modelos y elegimos el mejor.
4 TIPOS DE ESTACIÓN Agrupadas por cómo se usan
Commuter Hub
Urbano Mixto
Turístico
Residencial
735
782
134
770
estaciones
estaciones
estaciones
estaciones
Oficinas y transporte. Viajes cortos en hora pico.
Zonas densas. Mezcla de trabajo y ocio diario.
Parques y atracciones. Viajes largos de fin de semana.
Periferia. Complemento del metro en tramos cortos.
15% casual
20% casual
36% casual
25% casual
LOS 4 MODELOS DE ESTO
Los 4 modelos en juego
EL GANADOR
Random Forest
K-Means
Arma los grupos de estaciones.
0.71
63%
67%
Logistic Regression
precisión (AUC)
casuales detectados
members detectados
Modelo base de comparación
¿Por qué este y no el de mejor número? Gradient Boosting tenía mejor AUC, pero clasificaba casi todo como member: solo encontraba el 7% de los casuales. Como el objetivo es convertir casuales, ese modelo no sirve. Random Forest los detecta de forma equilibrada.
Gradient Boosting
Alcanza el mejor desempeño predictivo
Random Forest
Equilibrado y accionable
QUÉ DELATA AL USUARIO Las variables que más contribuyen a las predicciones
3 variables concentran el 68% del peso para realizar las predicciones
46%
Duración del viaje
Los casuales viajan aproximadamente 70% más tiempo (18.9 vs 11.1 min).
13%
Temperatura
Con buen clima sube la actividad casual y recreativa.
9%
Hora del día
Las horas pico concentran a los members (commute).
6%
Fin de semana
Los casuales están sobre-representados el finde.
5%
Tipo de bici
Los members eligen más la eléctrica para ir al trabajo.
EL HALLAZGO CLAVE hay casuales que ya actúan como members
Separamos a los casuales en 3 grupos según qué tanto se parecen a un member. El grupo de alto potencial es el que tiene más utilidad.
BAJO potencial
MEDIO
ALTO potencial
Turista puro
Indeciso
Casi un member
Duración
38.7 min
Duración
14.5 min
Duración
7.9 min
% fin de semana
65%
% fin de semana
31%
% fin de semana
18%
% en hora pico
17%
% en hora pico
32%
% en hora pico
49%
No invertir: su uso no justifica membresía.
Campañas selectivas según costo.
Targeting agresivo: ya viaja como member.
Lo que más los distingue: la duración del viaje — 38.7 vs 7.9 min, casi 5× más corto en el alto potencial.
A QUIÉN APUNTAR
Tamaño del universo (viajes)
Siguiente paso: Pensar en las siguientes cosas
Alto potencial
Approximadamente 4.4 M
Dónde
Targeting agresivo · ROI alto
Concentrar en las 134 estaciones turísticas.
Cuándo
Campañas con clima de 20-30°C.
Medio
Aproximadamente 8.8 M
A quién
Campañas selectivas
Casuales que ya se comportan como members.
Qué decir
Bajo potencial
Aproximadamente 4.4 M
Mensaje distinto por grupo (ahorro vs pase turista).
No invertir en membresía anual
Con qué
Mensajes personalizados con IA por tipo de zona.
QUÉ APRENDIMOS
Las estaciones son un continuo
Mejores datos > modelo complejo
El número más alto engaña
Gradient Boosting tenía mejor AUC pero solo detectaba 7% de casuales. Hay que mirar el equilibrio, no un solo número.
Con solo 6 variables el AUC bajaba a 0.68. Agregar clima y zona ayudó más que cambiar de algoritmo.
Los grupos no son perfectos (silhouette bajo): son una simplificación útil, no una división natural y exacta.
La prueba: agregar contexto duplicó con creces la detección de casuales
CONCLUSIONES
Pipeline de 2 pasos cumplido
Agrupamos estaciones y elegimos el mejor modelo por su valor real, no solo por la métrica.
Sabemos qué predice al usuario
Duración, clima, zona y horario explican y predicen si alguien es casual o member.
El target convertible está identificado
Los casuales que ya viajan como members son los candidatos prioritarios para campañas.
DataPedal Consulting Group · TI3003B — Analítica y Gobierno de Datos · Grupo 301 · Mayo 2026
DataPedal_Sprint3_Presentacion_v2.pptx.pptx
Sebastián González Del Moral
Created on May 29, 2026
Start designing with a free template
Discover more than 1500 professional designs like these:
View
Essential Business Proposal
View
Project Roadmap Timeline
View
Step-by-Step Timeline: How to Develop an Idea
View
Artificial Intelligence History Timeline
View
Word Search: Corporate Culture
View
Match the Verbs in Spanish: Present and Past
View
Process Flow: Corporate Recruitment
Explore all templates
Transcript
MODELADO PREDICTIVO Y APRENDIZAJE AUTOMÁTICO
Optimización de Movilidad Urbana · Citi Bike NYC
Sprint 3
DataPedal Consulting Group · Grupo 301 · CRISP-DM · Mayo 2026
4 modelos ML
99.6M de viajes (datos)
Daniel Castro Knöhr A01788052 Jorge Gerardo Maya A01664595 Javier Emmanuel Murillo Ángeles A01659139 Axel Molina A01029496 Sebastian Gonzalez Del Moral A01786196
Objetivo y hallazgos clave del Sprint 3
RESUMEN EJECUTIVO:
Objetivo: Aplicar Machine Learning supervisado y no supervisado sobre la tabla trips_weather que incluye 99.6M viajes desde ene 2024 a abr 2026.
Fase 1 · No supervisada
Fase 2 · Supervisada
Clustering K-Means de estaciones para inferir el tipo de zona urbana.
Clasificación para predecir si un viaje es de usuario member o casual.
MODELOS APLICADOS
CÓMO LO HICIMOS : Pipeline
Primero agrupamos las varaibles por su comportamiento: luego usamos esos grupos para predecir el tipo de usuario.
Paso 1 · Agrupar estaciones
Paso 2 · Predecir el usuario
Con K-Means agrupamos las 2,421 estaciones según cómo se usan (volumen, horario, duración…). Resultado: cada estación recibe un tipo de zona.
Con ese tipo de zona y los datos del viaje, predecimos si el usuario es member o casual. Probamos 4 modelos y elegimos el mejor.
4 TIPOS DE ESTACIÓN Agrupadas por cómo se usan
Commuter Hub
Urbano Mixto
Turístico
Residencial
735
782
134
770
estaciones
estaciones
estaciones
estaciones
Oficinas y transporte. Viajes cortos en hora pico.
Zonas densas. Mezcla de trabajo y ocio diario.
Parques y atracciones. Viajes largos de fin de semana.
Periferia. Complemento del metro en tramos cortos.
15% casual
20% casual
36% casual
25% casual
LOS 4 MODELOS DE ESTO
Los 4 modelos en juego
EL GANADOR
Random Forest
K-Means
Arma los grupos de estaciones.
0.71
63%
67%
Logistic Regression
precisión (AUC)
casuales detectados
members detectados
Modelo base de comparación
¿Por qué este y no el de mejor número? Gradient Boosting tenía mejor AUC, pero clasificaba casi todo como member: solo encontraba el 7% de los casuales. Como el objetivo es convertir casuales, ese modelo no sirve. Random Forest los detecta de forma equilibrada.
Gradient Boosting
Alcanza el mejor desempeño predictivo
Random Forest
Equilibrado y accionable
QUÉ DELATA AL USUARIO Las variables que más contribuyen a las predicciones
3 variables concentran el 68% del peso para realizar las predicciones
46%
Duración del viaje
Los casuales viajan aproximadamente 70% más tiempo (18.9 vs 11.1 min).
13%
Temperatura
Con buen clima sube la actividad casual y recreativa.
9%
Hora del día
Las horas pico concentran a los members (commute).
6%
Fin de semana
Los casuales están sobre-representados el finde.
5%
Tipo de bici
Los members eligen más la eléctrica para ir al trabajo.
EL HALLAZGO CLAVE hay casuales que ya actúan como members
Separamos a los casuales en 3 grupos según qué tanto se parecen a un member. El grupo de alto potencial es el que tiene más utilidad.
BAJO potencial
MEDIO
ALTO potencial
Turista puro
Indeciso
Casi un member
Duración
38.7 min
Duración
14.5 min
Duración
7.9 min
% fin de semana
65%
% fin de semana
31%
% fin de semana
18%
% en hora pico
17%
% en hora pico
32%
% en hora pico
49%
No invertir: su uso no justifica membresía.
Campañas selectivas según costo.
Targeting agresivo: ya viaja como member.
Lo que más los distingue: la duración del viaje — 38.7 vs 7.9 min, casi 5× más corto en el alto potencial.
A QUIÉN APUNTAR
Tamaño del universo (viajes)
Siguiente paso: Pensar en las siguientes cosas
Alto potencial
Approximadamente 4.4 M
Dónde
Targeting agresivo · ROI alto
Concentrar en las 134 estaciones turísticas.
Cuándo
Campañas con clima de 20-30°C.
Medio
Aproximadamente 8.8 M
A quién
Campañas selectivas
Casuales que ya se comportan como members.
Qué decir
Bajo potencial
Aproximadamente 4.4 M
Mensaje distinto por grupo (ahorro vs pase turista).
No invertir en membresía anual
Con qué
Mensajes personalizados con IA por tipo de zona.
QUÉ APRENDIMOS
Las estaciones son un continuo
Mejores datos > modelo complejo
El número más alto engaña
Gradient Boosting tenía mejor AUC pero solo detectaba 7% de casuales. Hay que mirar el equilibrio, no un solo número.
Con solo 6 variables el AUC bajaba a 0.68. Agregar clima y zona ayudó más que cambiar de algoritmo.
Los grupos no son perfectos (silhouette bajo): son una simplificación útil, no una división natural y exacta.
La prueba: agregar contexto duplicó con creces la detección de casuales
CONCLUSIONES
Pipeline de 2 pasos cumplido
Agrupamos estaciones y elegimos el mejor modelo por su valor real, no solo por la métrica.
Sabemos qué predice al usuario
Duración, clima, zona y horario explican y predicen si alguien es casual o member.
El target convertible está identificado
Los casuales que ya viajan como members son los candidatos prioritarios para campañas.
DataPedal Consulting Group · TI3003B — Analítica y Gobierno de Datos · Grupo 301 · Mayo 2026