Noon Barbari
Todos los artículos
análisis a fondoPublicado ·10 min de lectura·Por el research desk de Noon Barbari Cómo testeamos

Ejecutamos 11,440 backtests. La estrategia 'ganadora' media perdió la mitad de su ventaja en datos que nunca había visto

Diez familias clásicas de estrategias, 5,720 configuraciones de parámetros, veinte pares de cripto y una regla honesta: ajustar solo con el pasado y luego probar una única vez en datos que la estrategia nunca vio. Esto es exactamente cuánto de la 'rentabilidad backtesteada' sobrevivió.

En esta página

Todos los foros de trading tienen la misma publicación recurrente: una curva de capital preciosa, un conjunto de parámetros ajustado y el pie de foto "esto funciona". Nosotros queríamos una cifra que dijera cuánto de eso es real. Así que lo medimos — a escala, con un protocolo que no nos deja hacer trampas y con el código del barrido subido a nuestro repositorio para que cualquiera pueda repetirlo.

La versión corta: ajustamos 200 combinaciones estrategia-moneda sobre su propio histórico y ejecutamos cada ganador ajustado una sola vez sobre datos que nunca había visto. El ratio de Sharpe del ganador atractivo mediano cayó de 1.22 a 0.64 — aproximadamente la mitad de la "ventaja" era memoria, no señal. El 54% perdió más de la mitad de su Sharpe y, entre las 200 elecciones ajustadas, el 44% acabó en cero o en negativo. Lo que sigue es el método, los gráficos, las cifras que nos sorprendieron en ambas direcciones y lo que de verdad sobrevive.

El experimento

Tomamos las diez familias de estrategias de nuestra biblioteca pública de plantillas — los mismos conjuntos de reglas YAML que cualquiera puede ejecutar en el sitio: reversión a la media con RSI, cruce de EMA, tendencia con MACD, SuperTrend, ruptura de SMA, reversión de Bollinger, ruptura de ATR, Trend Magic y dos plantillas de smart money concepts (order blocks y fair value gaps).

Para cada familia definimos una malla de parámetros pequeña y realista — los mismos mandos que los usuarios de la estrategia ajustan de verdad: periodos de lookback, umbrales de entrada/salida, anchos de banda, distancias de stop. Sin parámetros exóticos ni mallas de mil combinaciones: entre 9 y 64 combinaciones por familia, exactamente el tipo de exploración de "déjame probar unos cuantos ajustes" que hace todo trader.

Después, para cada uno de 20 pares líquidos en USDT (BTC, ETH y el resto del universo de gran capitalización), sobre velas diarias desde enero de 2021 hasta julio de 2026:

  1. **Dividir el histórico cronológicamente: primer 70% in-sample, último 30% out-of-sample.** La ventana out-of-sample abarca aproximadamente los últimos 20 meses — condiciones de mercado que la ventana in-sample no contiene.
  2. **Ejecutar cada combinación de parámetros sobre la ventana in-sample** y elegir la que tenga el mejor ratio de Sharpe. Esta es la configuración que un curve-fitter pondría en producción — y, siendo honestos, la configuración que muestran la mayoría de las capturas de backtests.
  3. **Ejecutar ese ganador una sola vez sobre la ventana out-of-sample.** Sin reajustes, sin segundas miradas, sin sesgo de supervivencia: todos los resultados están en los datos de abajo, incluidos los vergonzosos.

Eso son 5,720 configuraciones, cada una ejecutada en ambas ventanas — 11,440 ejecuciones del motor en total, todas a través del mismo backtester dirigido por eventos que impulsa nuestro backtester gratuito, con su modelo por defecto de comisiones y slippage. El script del barrido, las mallas y el código de análisis viven en nuestro repositorio; el estudio es reproducible de principio a fin.

Hallazgo 1: la mayoría de las combinaciones nunca llegó a tener buena pinta

Antes de cualquier prueba out-of-sample, una línea base que da que pensar: incluso con la libertad de elegir la mejor entre docenas de configuraciones, solo 37 de 200 combinaciones estrategia-moneda (el 18%) produjeron un resultado in-sample "atractivo" — un Sharpe de al menos 1.0 con al menos 10 operaciones. Tres familias (reversión a la media con RSI, tendencia con MACD y reversión de Bollinger) no superaron ese listón en *ni una sola* moneda de las veinte, incluso después del ajuste.

Recuérdalo la próxima vez que una captura te enseñe la que funcionó: estás mirando al superviviente de una pila enorme e invisible.

Hallazgo 2: el recorte out-of-sample

Diagrama de dispersión del Sharpe in-sample frente al Sharpe out-of-sample para cada ganador estrategia-moneda ajustado. La mayoría de los puntos queda muy por debajo de la diagonal de no degradación, y muchos quedan por debajo de la línea de cero.
Cada punto es la mejor configuración ajustada de una familia de estrategias en una moneda. X: qué tan bien lucía sobre los datos con los que se ajustó. Y: qué hizo sobre datos que nunca había visto. La línea discontinua es 'sin degradación'; los puntos rojos acabaron en cero o en negativo.

Si el ajuste encontrara señal pura, los puntos se pegarían a la diagonal. No lo hacen — la nube se sitúa sistemáticamente por debajo. Para los 37 ganadores atractivos:

  • **El Sharpe mediano cayó de 1.22 in-sample a 0.64 out-of-sample.** Alrededor de la mitad de la ventaja aparente se evaporó al entrar en contacto con datos no vistos.
  • **El 54% perdió más de la mitad de su Sharpe.** El **recorte mediano fue de 0.69** puntos de Sharpe.
  • **El 16% se derrumbó por completo** hasta un Sharpe de cero o inferior.
  • Entre **las 200** elecciones ajustadas (no solo las atractivas), **el 44% acabó en cero o en negativo** out-of-sample.
Histograma del recorte de Sharpe (in-sample menos out-of-sample) entre los ganadores atractivos, con la mediana marcada.
El recorte out-of-sample. A la derecha del cero significa que la estrategia lo hizo peor en datos no vistos — que son casi todas.

Hallazgo 3: el ranking in-sample es una guía débil — pero no inútil

Aquí es donde los datos rebatieron la lectura cínica, y también lo contamos. Dentro de cada malla estrategia-moneda clasificamos cada combinación por Sharpe in-sample y de nuevo por Sharpe out-of-sample, y luego medimos la correlación de rangos.

La correlación de rangos mediana fue de 0.37 — positiva, pero débil. Y era tremendamente inestable: en una cuarta parte de las mallas la correlación fue cero o negativa (elegir al ganador in-sample no era mejor que elegir al azar), mientras que en el mejor cuartil superó 0.60.

Ajustar mallas pequeñas y estructurales sí aportaba *algo* de señal: la elección ajustada batió a los ajustes de fábrica de la plantilla en out-of-sample en el 69% de las celdas. Así que la conclusión honesta no es "nunca ajustes" — es que las diferencias in-sample son mayormente ruido con un poco de señal mezclada, y no puedes saber en qué malla estás sin reservar datos. Cuanto más grande es la malla, más gana el ruido: cada combinación extra que pruebas eleva el listón que tu resultado tiene que superar — que es exactamente lo que corrige un ratio de Sharpe deflactado, y la razón por la que nuestro scorecard de robustez lo usa.

Qué familias aguantaron

Gráfico de barras horizontales de la tasa de colapso por familia de estrategias entre los ganadores in-sample atractivos.
Proporción de los ganadores in-sample atractivos de cada familia que acabó con Sharpe ≤ 0 en datos no vistos. Solo se grafican las familias con al menos 3 ganadores — una tasa calculada sobre 1 o 2 puntos de datos es ruido.

La dispersión es instructiva. SuperTrend fue el ganador in-sample más prolífico (13 de 20 monedas) — y 8 de esos 13 perdieron más de la mitad de su Sharpe out-of-sample. La plantilla de fair value gap produjo 11 ganadores atractivos y aguantó comparativamente bien. Y las tres familias que nunca produjeron un ganador atractivo en ninguna parte no son necesariamente estrategias *malas* — en velas diarias durante este periodo, simplemente nunca tuvieron la ventaja que promete su reputación, por mucho que se girasen los mandos. Eso también conviene saberlo antes de que lo descubra el dinero real.

Lo que esto no dice

Un estudio honesto enumera sus límites: esto es una sola clase de activo (cripto), un solo timeframe (velas diarias), un solo punto de corte (70/30), una malla por familia y el modelo de comisiones por defecto del motor. El Sharpe sobre una ventana de ~20 meses es en sí mismo una estimación ruidosa — algunos "colapsos" son mala suerte y no curve-fitting, y algunos supervivientes tuvieron suerte. Una familia solo-largos que se topa con un régimen out-of-sample hostil recibe una paliza injusta. Nada de eso rescata el titular: en diez diseños de estrategia sin relación entre sí, el ajuste in-sample prometió sistemáticamente el doble de lo que entregó.

Y una cosa que este estudio explícitamente no es: evidencia de que hacer backtesting sea inútil. Es evidencia de que el backtesting *sin validar* fabrica confianza. La solución no es dejar de probar — es probar como lo hizo este estudio: reserva datos, tócalos una sola vez, cuenta tus intentos y deja que el resultado sobreviva sobre datos que nunca vio.

Los datos son públicos

No te fíes de nuestra palabra. El dataset completo — los 11.440 runs del motor, una fila cada uno, con la combinación exacta de parámetros y el Sharpe, el rendimiento, el drawdown y el número de trades de ambas ventanas — está publicado bajo CC BY 4.0 en nuestra página de datos abiertos, en CSV y JSONL, con tabla de esquema y cita sugerida. Repite el análisis, córtalo de otra forma o intenta tumbar la conclusión.

Pasa tu propia estrategia por el mismo calvario

Todo lo que este estudio hizo a mano — los datos reservados, la puntuación de robustez, el veredicto honesto — es lo que nuestro backtester gratuito ejecuta sobre cualquier estrategia en aproximadamente un minuto. Sin registro, sin tarjeta. Si tu idea es real, sobrevivirá. Si no lo es, acabas de descubrirlo gratis.

El rendimiento pasado no garantiza resultados futuros. Este estudio es contenido educativo, no asesoramiento financiero.

Pruébalo con tus datos

Cada concepto de arriba está implementado en la plataforma. Backtest, walk-forward, paper trading, luego live — el mismo conjunto de reglas en cada etapa.

Lecturas relacionadas

Guías relacionadas

Términos clave