Machine Learning — el laboratorio de patrones
Predicciones a 21 días
| valor | P(subir 21d) | lectura |
|---|---|---|
| MANALIPETC.NS | 50.0% | sin señal |
la Mesa de Trading las usa como filtro (veta entradas con P<44%) — ahí el listón es más bajo porque el gatillo técnico manda y el ML solo confirma.
El menú de modelos, según los libros
promedia cientos de árboles descorrelacionados: reduce varianza sin inflar el sesgo — exactamente lo que pide un mercado con señal débil y ruido brutal. López de Prado lo prefiere sobre boosting en finanzas porque el boosting persigue el error hasta memorizar el ruido.
más potente en datos limpios; en retornos diarios sobreajusta el ruido con facilidad. Utilizable con regularización agresiva y validación purgada — candidato a segundo modelo del ensemble, no a sustituto.
necesitan señal/ruido y volumen de datos que los retornos diarios no tienen (4,672 muestras efectivas: una red profunda memoriza eso en minutos). Donde SÍ pagan: texto (noticias, transcripts, filings) — la ruta correcta es un transformer leyendo lenguaje, no prediciendo precios (NLP with Transformers; nuestro agente de noticias ya apunta ahí).
interpretable, difícil de sobreajustar, y si el bosque no le gana con claridad, el bosque no está aportando — Narang: el modelo simple es el listón, no el enemigo.
no predicen retornos: clasifican el ESTADO del mercado (tendencia/rango, calma/estrés) — útil para que otros agentes cambien de playbook. Complementa al clasificador de ciclo macro actual.
agrupa activos por comportamiento real en vez de por etiqueta GICS — útil para pares, riesgo de concentración oculta y para validar la mesa sectorial (¿NVDA se mueve con semis... o ya es un sector propio?).
minería de datos pura: con suficientes combinaciones siempre aparece un patrón espurio (Harvey: la mayoría de los hallazgos publicados son falsos). Sin mecanismo causal declarado, no entra — Causal Factor Investing (López de Prado 2023).
El diseño del modelo en producción (con citas)
Random forest (600 árboles, profundidad 4, hojas mínimas 100) sobre features normalizadas por volatilidad; label de umbral de volatilidad a 21 días; validación walk-forward PURGADA con embargo de 21 días (sin fuga de información entre train y test); importancia por MDA; muestras efectivas = n/21 por el solapamiento del label. Cada decisión de diseño tiene página:
- Advances in Financial Machine Learning — Marcos López de Prado, p. 132-137 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 137-141 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 129-133 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 71-76 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 75-79 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 102-105 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 141-145 —
- Advances in Financial Machine Learning — Marcos López de Prado, p. 144-148 —
Hoja de ruta (del consejo de revisión): neutralizar features por sector y beta, mecanismo causal declarado por feature (tipo-A vs tipo-B de López de Prado), ensemble con lineal regularizado como baseline, HMM de regímenes, y transformers para TEXTO (noticias/transcripts) cuando llegue la ANTHROPIC_API_KEY — no para predecir precios con redes, que la literatura desaconseja.