Want to create interactive content? It’s easy in Genially!

Get started free

DataPedal_Sprint3_Presentacion_v2.pptx.pptx

Sebastián González Del Moral

Created on May 29, 2026

Start designing with a free template

Discover more than 1500 professional designs like these:

Corporate Fluid Presentation

Corporate Culture Presentation

Executive Presentation

Professional Presentation

Creative Presentation

Bricks Quiz

Mobile Phone Call

Transcript

MODELADO PREDICTIVO Y APRENDIZAJE AUTOMÁTICO

Optimización de Movilidad Urbana · Citi Bike NYC

Sprint 3

DataPedal Consulting Group · Grupo 301 · CRISP-DM · Mayo 2026

4 modelos ML

99.6M de viajes (datos)

Daniel Castro Knöhr A01788052 Jorge Gerardo Maya A01664595 Javier Emmanuel Murillo Ángeles A01659139 Axel Molina A01029496 Sebastian Gonzalez Del Moral A01786196

Objetivo y hallazgos clave del Sprint 3

RESUMEN EJECUTIVO:

Objetivo: Aplicar Machine Learning supervisado y no supervisado sobre la tabla trips_weather que incluye 99.6M viajes desde ene 2024 a abr 2026.

Fase 1 · No supervisada

Fase 2 · Supervisada

Clustering K-Means de estaciones para inferir el tipo de zona urbana.

Clasificación para predecir si un viaje es de usuario member o casual.

MODELOS APLICADOS

CÓMO LO HICIMOS : Pipeline

Primero agrupamos las varaibles por su comportamiento: luego usamos esos grupos para predecir el tipo de usuario.

Paso 1 · Agrupar estaciones

Paso 2 · Predecir el usuario

Con K-Means agrupamos las 2,421 estaciones según cómo se usan (volumen, horario, duración…). Resultado: cada estación recibe un tipo de zona.

Con ese tipo de zona y los datos del viaje, predecimos si el usuario es member o casual. Probamos 4 modelos y elegimos el mejor.

4 TIPOS DE ESTACIÓN Agrupadas por cómo se usan

Commuter Hub

Urbano Mixto

Turístico

Residencial

735

782

134

770

estaciones

estaciones

estaciones

estaciones

Oficinas y transporte. Viajes cortos en hora pico.

Zonas densas. Mezcla de trabajo y ocio diario.

Parques y atracciones. Viajes largos de fin de semana.

Periferia. Complemento del metro en tramos cortos.

15% casual

20% casual

36% casual

25% casual

LOS 4 MODELOS DE ESTO

Los 4 modelos en juego

EL GANADOR

Random Forest

K-Means

Arma los grupos de estaciones.

0.71

63%

67%

Logistic Regression

precisión (AUC)

casuales detectados

members detectados

Modelo base de comparación

¿Por qué este y no el de mejor número? Gradient Boosting tenía mejor AUC, pero clasificaba casi todo como member: solo encontraba el 7% de los casuales. Como el objetivo es convertir casuales, ese modelo no sirve. Random Forest los detecta de forma equilibrada.

Gradient Boosting

Alcanza el mejor desempeño predictivo

Random Forest

Equilibrado y accionable

QUÉ DELATA AL USUARIO Las variables que más contribuyen a las predicciones

3 variables concentran el 68% del peso para realizar las predicciones

46%

Duración del viaje

Los casuales viajan aproximadamente 70% más tiempo (18.9 vs 11.1 min).

13%

Temperatura

Con buen clima sube la actividad casual y recreativa.

9%

Hora del día

Las horas pico concentran a los members (commute).

6%

Fin de semana

Los casuales están sobre-representados el finde.

5%

Tipo de bici

Los members eligen más la eléctrica para ir al trabajo.

EL HALLAZGO CLAVE hay casuales que ya actúan como members

Separamos a los casuales en 3 grupos según qué tanto se parecen a un member. El grupo de alto potencial es el que tiene más utilidad.

BAJO potencial

MEDIO

ALTO potencial

Turista puro

Indeciso

Casi un member

Duración

38.7 min

Duración

14.5 min

Duración

7.9 min

% fin de semana

65%

% fin de semana

31%

% fin de semana

18%

% en hora pico

17%

% en hora pico

32%

% en hora pico

49%

No invertir: su uso no justifica membresía.

Campañas selectivas según costo.

Targeting agresivo: ya viaja como member.

Lo que más los distingue: la duración del viaje — 38.7 vs 7.9 min, casi 5× más corto en el alto potencial.

A QUIÉN APUNTAR

Tamaño del universo (viajes)

Siguiente paso: Pensar en las siguientes cosas

Alto potencial

Approximadamente 4.4 M

Dónde

Targeting agresivo · ROI alto

Concentrar en las 134 estaciones turísticas.

Cuándo

Campañas con clima de 20-30°C.

Medio

Aproximadamente 8.8 M

A quién

Campañas selectivas

Casuales que ya se comportan como members.

Qué decir

Bajo potencial

Aproximadamente 4.4 M

Mensaje distinto por grupo (ahorro vs pase turista).

No invertir en membresía anual

Con qué

Mensajes personalizados con IA por tipo de zona.

QUÉ APRENDIMOS

Las estaciones son un continuo

Mejores datos > modelo complejo

El número más alto engaña

Gradient Boosting tenía mejor AUC pero solo detectaba 7% de casuales. Hay que mirar el equilibrio, no un solo número.

Con solo 6 variables el AUC bajaba a 0.68. Agregar clima y zona ayudó más que cambiar de algoritmo.

Los grupos no son perfectos (silhouette bajo): son una simplificación útil, no una división natural y exacta.

La prueba: agregar contexto duplicó con creces la detección de casuales

CONCLUSIONES

Pipeline de 2 pasos cumplido

Agrupamos estaciones y elegimos el mejor modelo por su valor real, no solo por la métrica.

Sabemos qué predice al usuario

Duración, clima, zona y horario explican y predicen si alguien es casual o member.

El target convertible está identificado

Los casuales que ya viajan como members son los candidatos prioritarios para campañas.

DataPedal Consulting Group · TI3003B — Analítica y Gobierno de Datos · Grupo 301 · Mayo 2026