En esta página
Todos los foros de trading tienen la misma publicación recurrente: una curva de capital preciosa, un conjunto de parámetros ajustado y el pie de foto "esto funciona". Nosotros queríamos una cifra que dijera cuánto de eso es real. Así que lo medimos — a escala, con un protocolo que no nos deja hacer trampas y con el código del barrido subido a nuestro repositorio para que cualquiera pueda repetirlo.
La versión corta: ajustamos 200 combinaciones estrategia-moneda sobre su propio histórico y ejecutamos cada ganador ajustado una sola vez sobre datos que nunca había visto. El ratio de Sharpe del ganador atractivo mediano cayó de 1.22 a 0.64 — aproximadamente la mitad de la "ventaja" era memoria, no señal. El 54% perdió más de la mitad de su Sharpe y, entre las 200 elecciones ajustadas, el 44% acabó en cero o en negativo. Lo que sigue es el método, los gráficos, las cifras que nos sorprendieron en ambas direcciones y lo que de verdad sobrevive.
El experimento
Tomamos las diez familias de estrategias de nuestra biblioteca pública de plantillas — los mismos conjuntos de reglas YAML que cualquiera puede ejecutar en el sitio: reversión a la media con RSI, cruce de EMA, tendencia con MACD, SuperTrend, ruptura de SMA, reversión de Bollinger, ruptura de ATR, Trend Magic y dos plantillas de smart money concepts (order blocks y fair value gaps).
Para cada familia definimos una malla de parámetros pequeña y realista — los mismos mandos que los usuarios de la estrategia ajustan de verdad: periodos de lookback, umbrales de entrada/salida, anchos de banda, distancias de stop. Sin parámetros exóticos ni mallas de mil combinaciones: entre 9 y 64 combinaciones por familia, exactamente el tipo de exploración de "déjame probar unos cuantos ajustes" que hace todo trader.
Después, para cada uno de 20 pares líquidos en USDT (BTC, ETH y el resto del universo de gran capitalización), sobre velas diarias desde enero de 2021 hasta julio de 2026:
- **Dividir el histórico cronológicamente: primer 70% in-sample, último 30% out-of-sample.** La ventana out-of-sample abarca aproximadamente los últimos 20 meses — condiciones de mercado que la ventana in-sample no contiene.
- **Ejecutar cada combinación de parámetros sobre la ventana in-sample** y elegir la que tenga el mejor ratio de Sharpe. Esta es la configuración que un curve-fitter pondría en producción — y, siendo honestos, la configuración que muestran la mayoría de las capturas de backtests.
- **Ejecutar ese ganador una sola vez sobre la ventana out-of-sample.** Sin reajustes, sin segundas miradas, sin sesgo de supervivencia: todos los resultados están en los datos de abajo, incluidos los vergonzosos.
Eso son 5,720 configuraciones, cada una ejecutada en ambas ventanas — 11,440 ejecuciones del motor en total, todas a través del mismo backtester dirigido por eventos que impulsa nuestro backtester gratuito, con su modelo por defecto de comisiones y slippage. El script del barrido, las mallas y el código de análisis viven en nuestro repositorio; el estudio es reproducible de principio a fin.
Hallazgo 1: la mayoría de las combinaciones nunca llegó a tener buena pinta
Antes de cualquier prueba out-of-sample, una línea base que da que pensar: incluso con la libertad de elegir la mejor entre docenas de configuraciones, solo 37 de 200 combinaciones estrategia-moneda (el 18%) produjeron un resultado in-sample "atractivo" — un Sharpe de al menos 1.0 con al menos 10 operaciones. Tres familias (reversión a la media con RSI, tendencia con MACD y reversión de Bollinger) no superaron ese listón en *ni una sola* moneda de las veinte, incluso después del ajuste.
Recuérdalo la próxima vez que una captura te enseñe la que funcionó: estás mirando al superviviente de una pila enorme e invisible.
Hallazgo 2: el recorte out-of-sample

Si el ajuste encontrara señal pura, los puntos se pegarían a la diagonal. No lo hacen — la nube se sitúa sistemáticamente por debajo. Para los 37 ganadores atractivos:
- **El Sharpe mediano cayó de 1.22 in-sample a 0.64 out-of-sample.** Alrededor de la mitad de la ventaja aparente se evaporó al entrar en contacto con datos no vistos.
- **El 54% perdió más de la mitad de su Sharpe.** El **recorte mediano fue de 0.69** puntos de Sharpe.
- **El 16% se derrumbó por completo** hasta un Sharpe de cero o inferior.
- Entre **las 200** elecciones ajustadas (no solo las atractivas), **el 44% acabó en cero o en negativo** out-of-sample.

Hallazgo 3: el ranking in-sample es una guía débil — pero no inútil
Aquí es donde los datos rebatieron la lectura cínica, y también lo contamos. Dentro de cada malla estrategia-moneda clasificamos cada combinación por Sharpe in-sample y de nuevo por Sharpe out-of-sample, y luego medimos la correlación de rangos.
La correlación de rangos mediana fue de 0.37 — positiva, pero débil. Y era tremendamente inestable: en una cuarta parte de las mallas la correlación fue cero o negativa (elegir al ganador in-sample no era mejor que elegir al azar), mientras que en el mejor cuartil superó 0.60.
Ajustar mallas pequeñas y estructurales sí aportaba *algo* de señal: la elección ajustada batió a los ajustes de fábrica de la plantilla en out-of-sample en el 69% de las celdas. Así que la conclusión honesta no es "nunca ajustes" — es que las diferencias in-sample son mayormente ruido con un poco de señal mezclada, y no puedes saber en qué malla estás sin reservar datos. Cuanto más grande es la malla, más gana el ruido: cada combinación extra que pruebas eleva el listón que tu resultado tiene que superar — que es exactamente lo que corrige un ratio de Sharpe deflactado, y la razón por la que nuestro scorecard de robustez lo usa.
Qué familias aguantaron

La dispersión es instructiva. SuperTrend fue el ganador in-sample más prolífico (13 de 20 monedas) — y 8 de esos 13 perdieron más de la mitad de su Sharpe out-of-sample. La plantilla de fair value gap produjo 11 ganadores atractivos y aguantó comparativamente bien. Y las tres familias que nunca produjeron un ganador atractivo en ninguna parte no son necesariamente estrategias *malas* — en velas diarias durante este periodo, simplemente nunca tuvieron la ventaja que promete su reputación, por mucho que se girasen los mandos. Eso también conviene saberlo antes de que lo descubra el dinero real.
Lo que esto no dice
Un estudio honesto enumera sus límites: esto es una sola clase de activo (cripto), un solo timeframe (velas diarias), un solo punto de corte (70/30), una malla por familia y el modelo de comisiones por defecto del motor. El Sharpe sobre una ventana de ~20 meses es en sí mismo una estimación ruidosa — algunos "colapsos" son mala suerte y no curve-fitting, y algunos supervivientes tuvieron suerte. Una familia solo-largos que se topa con un régimen out-of-sample hostil recibe una paliza injusta. Nada de eso rescata el titular: en diez diseños de estrategia sin relación entre sí, el ajuste in-sample prometió sistemáticamente el doble de lo que entregó.
Y una cosa que este estudio explícitamente no es: evidencia de que hacer backtesting sea inútil. Es evidencia de que el backtesting *sin validar* fabrica confianza. La solución no es dejar de probar — es probar como lo hizo este estudio: reserva datos, tócalos una sola vez, cuenta tus intentos y deja que el resultado sobreviva sobre datos que nunca vio.
Los datos son públicos
No te fíes de nuestra palabra. El dataset completo — los 11.440 runs del motor, una fila cada uno, con la combinación exacta de parámetros y el Sharpe, el rendimiento, el drawdown y el número de trades de ambas ventanas — está publicado bajo CC BY 4.0 en nuestra página de datos abiertos, en CSV y JSONL, con tabla de esquema y cita sugerida. Repite el análisis, córtalo de otra forma o intenta tumbar la conclusión.
Pasa tu propia estrategia por el mismo calvario
Todo lo que este estudio hizo a mano — los datos reservados, la puntuación de robustez, el veredicto honesto — es lo que nuestro backtester gratuito ejecuta sobre cualquier estrategia en aproximadamente un minuto. Sin registro, sin tarjeta. Si tu idea es real, sobrevivirá. Si no lo es, acabas de descubrirlo gratis.
El rendimiento pasado no garantiza resultados futuros. Este estudio es contenido educativo, no asesoramiento financiero.
Pruébalo con tus datos
Cada concepto de arriba está implementado en la plataforma. Backtest, walk-forward, paper trading, luego live — el mismo conjunto de reglas en cada etapa.