11 min de lectura· Publicado el July 19, 2026

Cómo hacer backtest a un agente de trading con IA antes de operar en real

Un método régimen a régimen para hacer backtest a estrategias agénticas, las cifras del informe que de verdad importan y por qué los backtests con LLM se halagan a sí mismos.

Por Florent Poux
Revisado por Benjamin Sultan
A model ship in a wave tank facing four painted wave patterns of increasing hostility

Un agente que construiste a partir de un prompt en lenguaje natural parece testeado en el momento en que reformula tu estrategia correctamente. No lo está. Reformular es comprensión; el backtest es evidencia. Antes de que un agente toque capital real, quieres saber cómo se habrían comportado sus reglas exactas a lo largo de años de historia real de mercado, y para hacer bien el backtest a un agente de trading con IA necesitas tres cosas: reglas fijadas con la suficiente firmeza para replicarlas, periodos de prueba lo bastante hostiles para que importen y la disciplina de leer el informe como un crítico y no como un fan. Esta guía cubre las tres, más un modo de fallo exclusivo de las estrategias impulsadas por LLM.

Fija las reglas hasta que una máquina pudiera replicarlas

Un backtest replica tu lógica contra datos históricos, vela a vela. Eso solo funciona si cada decisión que toma tu agente es calculable a partir de datos que existían en ese momento. «Compra cuando el RSI(14) diario cierra por debajo de 30 y el precio está por encima de la media móvil de 200 días» se replica a la perfección. «Compra cuando las noticias parecen exageradas» no, porque «parecer» no está en ninguna vela.

Así que el primer trabajo es convertir las condiciones reformuladas de tu agente en una especificación completa. Una prueba útil: ¿podría una hoja de cálculo con precios históricos y tus reglas decidir cada entrada, cada salida y cada tamaño de posición, sin dejar ningún juicio pendiente? Si una regla necesita interpretación, el motor de backtest la interpretará de algún modo, y su interpretación se convierte en tu estrategia sin tu consentimiento.

Vigila también los parámetros silenciosos. Los supuestos de slippage y comisiones, el tipo de orden (una orden de mercado se ejecuta; una limitada a veces no) y qué pasa con las señales fuera del horario de mercado en las acciones. Si eres nuevo en cómo funcionan estos motores en general, nuestra guía sobre software de backtesting cubre los fundamentos; este artículo se centra en lo que cambia con los agentes. Y si aún no has definido entrada, salida, tamaño e invalidación de tu estrategia, hazlo primero; es el paso dos de crear un agente de trading con IA.

A model ship in a wave tank facing four painted wave patterns of increasing hostility

Cómo hacer backtest a un agente de trading con IA a través de los regímenes de mercado

Una estrategia testeada solo sobre el pasado reciente es una apuesta a que el pasado reciente continúa. El arreglo es deliberado: elige ventanas de prueba que fuercen distintos modos de fallo y exige que el agente sobreviva a la mayoría. Cuatro regímenes de la última década cubren mucho terreno:

Periodo Qué fue Qué pone a prueba
2018 Bajista de desgaste (cripto ~80 % abajo, fuerte caída de la renta variable en el Q4) Disciplina de salida, tolerancia al dolor del DCA, muerte por mil cortes
Feb–mar 2020 Desplome vertical, luego recuperación en V Stops ante gaps y slippage, si reentras o te quedas asustado
2021 Subida persistente sin freno Si los cortos y las reglas de reversión a la media pelean contra el mercado, toma de beneficios prematura
2022 Caída por subida de tipos, acciones y cripto cayendo juntas Supuestos de correlación, filtros de tendencia, topes de drawdown

Corre las reglas del agente por cada ventana por separado, no solo una única media larga. Una regla de compra en caídas puede brillar en 2020 y 2021, y luego devolverlo todo en 2022; una sola cifra agregada esconde esa historia. No exiges beneficio en los cuatro regímenes. Exiges saber, por adelantado, qué régimen daña a tu agente y si su regla de invalidación se dispara antes de que el daño se acumule.

Aquí es donde el instrumental importa en la práctica: en Obside, el motor de backtesting replica años de datos históricos en minutos con supuestos de slippage incorporados, así que testear cuatro ventanas son cuatro ejecuciones antes de comer y no un proyecto de fin de semana. Sea cual sea el motor que uses, el principio se mantiene: regímenes, no medias.

Lee el informe como un adversario

Un informe de backtest es un argumento de ventas escrito por tus propias esperanzas. Lee cada cifra por lo que puede y no puede decirte.

El ratio de Sharpe mide el rendimiento por unidad de volatilidad. Entre 0,5 y 1,5 aproximadamente está la zona honesta para la mayoría de estrategias retail; un Sharpe por encima de 3 en un backtest es más a menudo un error, un sesgo o un sobreajuste que un hallazgo.

El drawdown máximo es la pérdida más profunda de pico a valle. Compáralo con lo que de verdad puedes aguantar y luego asume que en real será peor, porque el peor caso histórico es un suelo, no un techo.

El win rate no significa nada por sí solo. Un 90 % de aciertos con ganancias pequeñas y pérdidas catastróficas raras describe una estrategia que recoge monedas delante de una apisonadora; emparéjalo con el ratio medio de ganancia/pérdida antes de admirarlo.

El número de operaciones es tu tamaño de muestra. Por debajo de unas 30 operaciones, tienes una anécdota. Por debajo de 10, tienes un cuento.

La exposición te dice cuánto tiempo estuvo el capital en el mercado para ganar el rendimiento, que es el riesgo que la curva de capital no muestra.

Luego corre una variación de estrés: dobla los supuestos de slippage y comisiones y vuelve a ejecutar. Las estrategias que operan a menudo, o que operan activos poco líquidos, pueden ver evaporarse su ventaja en esa única prueba. Si pequeños cambios de parámetros (RSI 30 frente a 32, stop al 4 % frente al 5 %) hunden los resultados, probablemente estés mirando un ajuste a la curva; toda esa familia de fallos se disecciona en nuestra guía sobre el sobreajuste en el backtest.

A model ship in a wave tank facing four painted wave patterns of increasing hostility

La advertencia del LLM: cuando el modelo ya conoce el final

Las estrategias agénticas introducen un modo de fallo que los bots clásicos nunca tuvieron. Si un modelo de lenguaje grande toma decisiones dentro del bucle del backtest (elegir activos, cronometrar entradas, sopesar noticias), sus datos de entrenamiento pueden contener la mismísima historia sobre la que estás testeando. El modelo no predice 2021; lo recuerda.

Esto no es hipotético. La investigación sobre estrategias de inversión basadas en LLM encontró backtests inflados por memorización y lookahead: los modelos cuyos datos de entrenamiento se solapan con la ventana de prueba pueden recordar tickers, fechas y movimientos de precio, y el rendimiento a menudo se degrada fuera de muestra («Can LLM-based Financial Investing Strategies Outperform the Market?», arXiv:2505.07078, 2025). Un benchmark de seguimiento con memoria controlada mostró que, cuando la historia de mercado memorizada se excluye como es debido, la habilidad aparente de los agentes de trading con LLM cae con fuerza (arXiv:2605.28359, 2026). Una revisión del campo señala el mismo patrón en varios estudios: ventanas de prueba cortas, universos pequeños y riesgo de lookahead (arXiv:2408.06361, 2024).

Dos defensas prácticas. Primera, si un LLM decide las operaciones, confía solo en ventanas de prueba posteriores a su corte de entrenamiento, lo que normalmente te deja meses de datos, no años. Segunda, y mejor para la mayoría del uso retail: mantén al LLM fuera del bucle de replicación por completo. Deja que traduzca tu estrategia a reglas deterministas una sola vez, y luego haz backtest a esas reglas de la forma clásica. Así está construido Obside: el copilot interpreta tu lenguaje, pero el backtest replica condiciones fijas contra velas históricas, así que no hay modelo en el bucle que recuerde las respuestas.

Criterios de aprobado: cómo se ve un backtest que pasa

Antes de avanzar, escribe qué significa «aprobar» y luego contrasta el informe con ello en frío. Un listón razonable:

  • Sobrevive a al menos tres de los cuatro regímenes, es decir, las pérdidas se mantuvieron dentro de la regla de invalidación, incluso donde no fue rentable.
  • Drawdown máximo igual o por debajo de la cifra que declaraste tolerable antes de correr la prueba.
  • Al menos 30 operaciones en toda la prueba, suficientes para significar algo.
  • Sigue positivo tras doblar los supuestos de costes.
  • Los valores de parámetros vecinos dan resultados similares, una meseta y no un único pico mágico.
  • Puedes explicar su peor racha perdedora con palabras llanas: qué condición de mercado la causó y por qué la estrategia sigue siendo sólida.

Falla en un criterio y tienes un objetivo de rediseño. Falla en tres y tienes que buscar una estrategia distinta. Y un aprobado completo tampoco es permiso para operar en real: un backtest no puede probar la traducción de tu intención sobre datos en vivo, el timing de ejecución ni tu propio comportamiento viendo drawdowns reales. Para eso está la siguiente etapa, y la misma definición del agente debería pasar a ella sin cambios; el caso y la lista de comprobación viven en nuestra guía sobre paper trading de un agente de IA.

Por dónde seguir

Hacer backtest a un agente va menos de encontrar cifras estupendas que de comprar información barata: qué régimen rompe tus reglas, cómo es tu peor mes, si los costes se comen la ventaja. Cada uno de esos hallazgos no cuesta nada en un backtest y dinero real en vivo. Fija las reglas, corre los cuatro regímenes, lee el informe como un adversario y mantén cualquier LLM lejos del bucle de replicación. Cuando quieras un motor que replique años en minutos, incorpore el slippage y promueva el mismísimo agente a paper trading en un paso, corre tu próximo backtest en Obside.

Contenido educativo únicamente. Esto no es asesoramiento de inversión. Operar conlleva riesgos, incluida la posible pérdida de capital.

FAQ

Lo bastante atrás para incluir al menos un mercado bajista, un desplome y un rally fuerte; para la mayoría de estrategias eso significa cinco años o más. La longitud importa menos que la variedad: tres años que cubran de 2020 a 2022 enseñan más que ocho años de mercado alcista tranquilo. Para estrategias más rápidas, confirma además el tamaño de muestra, ya que más de 30 operaciones es un suelo razonable antes de que la estadística signifique gran cosa.

Artículos relacionados

Prueba Obside en tu cartera

Conecta tu bróker y construye tu cartera con un prompt.

Empezar