Backtesting y verificación intermediate 13 min de lectura

Cómo leer un informe de backtest de MT5: qué población mide cada cifra

Informe de backtest de MT5: cada cifra es una afirmación sobre un conjunto de operaciones y un histórico de precios concretos. Leímos los 23 informes publicados aquí: 14 de los 20 que publican los dos tramos favorecen al periodo con el que se eligió el EA, un informe cubre solo 303 de sus propias 315 operaciones, y el mismo EA sobre otro histórico pasó de 1,35 (aprobado) a 1,13 (suspenso).

Publicado · Revisado

Un informe de backtest de MT5 es una afirmación sobre un conjunto concreto de operaciones producido sobre un histórico de precios concreto. Casi todas las malas lecturas nacen de dejarse fuera la mitad de esa frase. El factor de beneficio de cabecera se lee como si fuera una propiedad del expert advisor. Es una propiedad de otras dos cosas: la población de operaciones que cubrió el informe, y los ticks con los que se alimentó al probador.

Este artículo es el orden de lectura que produce una decisión. Qué dio por supuesto el informe antes de imprimir nada, qué métrica responde a qué pregunta, dónde te miente cada cifra y qué te dice cada lectura que cambies. El procedimiento para producir un informe es otro trabajo — cómo hacer un backtest lo cubre de principio a fin.

Condiciones de la prueba
ID del experimentoEXP-REPORT-READING-001
Experimento padreEXP-BACKTEST-RUNBOOK-001
Fuentedata/run-manifests/*.jsonresults, ledger_recomputed, shadow_runs
Poblaciónall 23 runs published on mt5depot at the time of derivation
Build de MT56090 and 6140
ModeloEvery tick generated from M1 bars (Model 0) and Every tick based on real ticks (Model 4)
Cuenta10,000 USD deposit on all 23 runs
Última verificación2026-08-26

Todas las cifras de abajo salen de un backtest, y las 23 ejecuciones llevan un veredicto PASS — son las que superaron el filtro de publicación. Eso convierte a esto en un conjunto de supervivientes, así que nada de lo que hay aquí dice con qué frecuencia se aprueba un backtest. Dice qué aspecto tiene por dentro un informe aprobado.

Preparación: qué dio por supuesto el informe antes de imprimir una cifra

El bloque Settings de la parte de arriba de un informe de MT5 no es un preámbulo. Es la lista de supuestos que heredan todas las cifras de debajo, y seis de ellos deciden si merece la pena leer el resto. El nombre del bróker y el build van en la propia línea del título del informe — el nuestro decía Exness-MT5Trial5 (Build 6090).

Campo de SettingsQué fija en realidadQué registran los nuestros
Symbol: / Period:Los regímenes de los que el resultado es una muestra22 ejecuciones empiezan en enero de 2019; cairn empieza en junio de 2021
Model (generación de ticks)Cómo se produjeron los ticks dentro de cada velaModel 0 (generados a partir de velas M1) en 12 ejecuciones, Model 4 (ticks reales) en 11
Initial Deposit:El denominador de todos los porcentajes de la página10.000 USD en las 23
SpreadEl coste que se le quita a cada pataMedido en exactamente 1 de 23 — el resto heredan lo que llevara el histórico
CommissionUn coste que el probador aplica solo si lo pones tú0 en las 23
Inputs:Los ajustes que produjeron esto, al completoVerificados contra el informe en todas las ejecuciones

La lista de Inputs: es la fila que la gente se salta, y es la que hace que un informe sea reproducible siquiera: es el conjunto completo de valores que tendrías que volver a teclear para recuperar la misma página.

Dos de esas filas merecen un momento. Una comisión a cero no significa que la comisión se ignorara. Significa que no se cobró ninguna sobre el símbolo probado. Son afirmaciones distintas, y solo el registro de la ejecución te dice cuál se aplica. Y un spread sin medir no es un spread cero: en 22 de nuestras 23 ejecuciones ese campo está vacío porque no corrió ningún registrador junto a la prueba. Cada pata se llevó sin más el spread que llevara el histórico M1. Solo tidewell-slack puede declarar su propia media, 19,14 puntos.

Aquí encaja una trampa de nombres. El campo que las guías más antiguas llaman calidad del modelado lo imprime MT5 como History Quality:, en el bloque Results junto a Bars:, Ticks: y Symbols:. Buscar «modelling quality» dentro de un informe del Build 6090 no encuentra nada. En nuestros propios registros la cifra está presente solo en 2 de los 23 manifiestos, porque se conserva cuando el informe de origen declaraba una — eso es una propiedad de estos registros, no una medición de cada cuánto la imprime MetaTrader. En la práctica significa que no la puedes usar como filtro para informes que no hayas generado tú. La fuente de datos de ticks es la pregunta que hay debajo, y esa siempre se puede responder: pregunta qué histórico usó la ejecución.

Leer el informe, métrica a métrica

Lee la página en este orden. A propósito no es el orden en el que la imprime MetaTrader, porque los dos motivos de descarte más baratos están al final del informe.

  1. Lee primero Settings. El modelo, Initial Deposit:, el spread y la comisión. Todos los porcentajes de debajo los heredan, y una ejecución con un spread sin medir no es una ejecución sin spread.
  2. Lee Total Trades: antes que cualquier ratio. Un ratio y su tamaño de muestra son un solo dato, no dos. Apunta el número de operaciones al lado del ratio.
  3. Pregunta qué operaciones cubre la cabecera. Si se publica una lista de operaciones junto al informe, comprueba que su total coincide con Total Trades:. Uno de nuestros 23 informes no coincide.
  4. Lee Equity Drawdown Maximal:, no la línea de saldo, y anota si cogiste la cifra Maximal o la Relative — son filas distintas.
  5. Localiza el histórico de precios. Qué bróker, qué fuente, qué periodo. Este es el campo que movió un veredicto en nuestros registros; el modelo de ticks no.

Aquí tienes la lectura entera en una tabla, usando las etiquetas que imprime de verdad el informe. La columna «En nuestro conjunto» es lo que hizo cada métrica a lo largo de 23 ejecuciones publicadas. Eso gana a un rango de libro de texto, porque está medido sobre la misma clase de informe que tienes tú delante.

Etiqueta del informeLa pregunta que respondeEn nuestro conjuntoSeñal de alarma
Total Trades:Cuánta evidencia hayDe 108 a 4.725 por ejecuciónMenos de ~100; un ratio sobre 20 operaciones es un rumor
Profit Factor:Beneficio bruto dividido entre pérdida bruta (factor de beneficio)De 1,22 a 1,59 en las 23Por encima de ~2,0 sobre una ventana corta; mira antes Total Trades:
Profit Trades (% of total):La tasa de acierto — la forma de la distribución, no su signoDe 30,80% a 82,27%, todas rentablesCitada a solas, sin un factor de beneficio al lado
Total Net Profit:Divisa ganada, sin contextoDe 386,05 a 28.687,43 USD sobre el mismo depósito de 10.000 USDCitado sin Initial Deposit: y sin el número de años
Balance Drawdown Maximal:La peor caída sobre operaciones cerradas (drawdown máximo)De 0,67% a 18,24%Citado mientras hay una línea de capital en la misma página
Equity Drawdown Maximal:La peor caída incluyendo las posiciones abiertasMás profundo que el de saldo en 23 de 23Ignorado — es la cifra sobre la que vive tu margen
Expected Payoff:Resultado medio por operación, en divisaNo lo llevan nuestros manifiestosLeído como un pronóstico y no como una media
Recovery Factor: / Sharpe Ratio:Rentabilidad por unidad de sufrimiento, de dos manerasNo lo llevan nuestros manifiestosComparado entre informes con números de operaciones distintos
History Quality:Si el flujo de ticks puede resolver tu stopDeclarado en 2 de 23Ausente y con la fuente de datos desconocida

Hay dos convenciones de ese bloque que pillan a la gente antes de que empiece ninguna interpretación.

Total Trades: y Total Deals: son recuentos distintos. En MetaTrader 5 una operación de ida y vuelta son dos deals — uno de entrada y otro de salida —, así que un informe que muestra Total Trades: 50 muestra Total Deals: 100 al lado, y los cierres parciales suman deals sin sumar trades. Lee los ratios contra las operaciones, nunca contra los deals.

Hay seis líneas de drawdown, no una. El informe imprime Absolute, Maximal y Relative tanto para el saldo como para el capital. Peor todavía: el importe y el porcentaje intercambian sitio entre dos de ellas: Balance Drawdown Maximal: 36.84 (0.37%) pone primero la divisa, y Balance Drawdown Relative: 0.37% (36.84) pone primero el porcentaje. Dos informes pueden citar “0.37%” y “36.84” de líneas contiguas y estar hablando del mismo suceso — o de sucesos distintos.

El resto del bloque Results — Z-Score:, AHPR:, GHPR:, LR Correlation:, LR Standard Error:, Margin Level: y las correlaciones MFE/MAE — describe la forma de la curva de capital más que su tamaño. Nada de eso rescata a un informe con demasiadas pocas operaciones, y nada de eso sobrevive a un cambio de histórico de precios mejor de lo que sobrevive el factor de beneficio. Léelo después de los cinco pasos de arriba, o no lo leas.

Dos de las filas de métricas hacen casi todo el daño en la práctica, así que léelas juntas y no una detrás de otra.

El beneficio neto necesita su denominador y su calendario. Las 23 ejecuciones parten de los mismos 10.000 USD, lo que las hace inusualmente comparables. Aun así van del 0,51% al 57,38% anual. El extremo bajo es instructivo. orrery marca un factor de beneficio de 1,46 con un drawdown máximo del 0,67% — el par de cifras más bonito del catálogo. Ganó 386,05 USD a lo largo de 7,58 años. Nada de ese informe es deshonesto. Está respondiendo a una pregunta distinta de la que la mayoría de los lectores cree estar haciendo.

La tasa de acierto y el factor de beneficio son casi independientes aquí. A lo largo de las 23 ejecuciones publicadas, la correlación entre ambos es de 0,37. La mayor parte de lo que decide si un EA gana dinero es, por tanto, invisible para la línea de la tasa de acierto. nautical gana el 30,80% de sus operaciones y devuelve un factor de beneficio de 1,22; gyre gana el 82,27% y devuelve 1,59. Los dos son rentables, y sus tasas de acierto están a 51 puntos de distancia.

El factor de beneficio que tu informe no te está enseñando

Esta es la parte que ningún informe te enseña, y es la razón por la que pudimos escribir este artículo a partir de nuestros propios datos. Toda ejecución publicada conserva su registro completo de operaciones cerradas, así que cada informe se parte en dos. Está el tramo con el que se eligió el EA — la ventana de desarrollo contra la que se filtró la publicación. Y están las operaciones que ocurrieron después de que saliera en vivo, sobre las que no se eligió nada. Veinte de nuestras 23 ejecuciones publican los dos tramos; las otras tres no publican ningún tramo posterior a la publicación.

EATramo de desarrolloTramo posterior a la publicaciónCabecera
orrery1,28 (195 operaciones)6,43 (15 operaciones)1,46 (210 operaciones)
windrose1,31 (101 operaciones)3,58 (7 operaciones)1,38 (108 operaciones)
cairn1,48 (4.583 operaciones)1,64 (142 operaciones)1,48 (4.725 operaciones)
gyre1,55 (136 operaciones)— (5 operaciones, ninguna perdedora)1,59 (141 operaciones)
tessera1,28 (624 operaciones)0,88 (21 operaciones)1,27 (645 operaciones)
zerqon1,53 (232 operaciones)0,72 (21 operaciones)1,43 (253 operaciones)

Lee juntas la primera y la última columna de la fila de orrery. La cabecera dice 1,46; el periodo con el que se eligió de verdad el EA dice 1,28; la diferencia son 15 operaciones — el 7% del registro — corriendo a un factor de beneficio de 6,43. Lee la fila de zerqon igual y va en la dirección contraria: 1,53 en el tramo de desarrollo, 0,72 en las 21 operaciones posteriores, y una cabecera de 1,43 que esconde las dos cosas.

A lo largo de las 20 ejecuciones que publican los dos tramos, la cabecera queda mejor que el tramo de desarrollo en 14 y peor en 6. Las otras tres se dejan fuera a propósito: al tener un solo tramo, su cabecera y su cifra de desarrollo cubren exactamente las mismas operaciones, así que la diferencia entre ambas no es en absoluto un efecto de población — es el redondeo a dos decimales del propio informe frente al registro recalculado. almanac imprime 1.52 donde el registro recalcula 1,5153. Aplica ese mismo suelo de redondeo a las 20 y 13 de ellas siguen enseñando una brecha que el redondeo no explica, 8 de ellas en la dirección que halaga.

Esa asimetría no es un escándalo. Una cabecera que abarca dos periodos se ve arrastrada hacia aquel que tuvo más suerte. Lo que sí significa es que la cabecera nunca es la cifra con la que contrastar una afirmación sobre el comportamiento futuro.

Trampas: cómo engañan estas cifras

El modo de fallo que hay debajo de las cinco es el mismo: un informe es la medición de una población, y todas las métricas de la página heredan en silencio la población a la que se apuntó al probador.

Mejora: qué te dice cada lectura que cambies

Un cambio por iteración, y vuelve a leer cada vez las mismas tres cifras: el número de operaciones, el factor de beneficio y el drawdown de capital. El orden de abajo va por coste — las comprobaciones baratas primero, porque dos de ellas terminan la investigación con regularidad.

  1. Si el número de operaciones es pequeño, alarga el periodo — no toques los parámetros. Un factor de beneficio construido sobre menos de unas 100 operaciones se mueve más con una ventana más larga que con cualquier ajuste que pudieras cambiar. Nuestra ejecución publicada más pequeña tiene 108 operaciones, y es aquella cuyos ratios citamos con más cuidado.
  2. Si la cabecera y el tramo de desarrollo no coinciden, vuelve a leer solo sobre el tramo de desarrollo. Esa es la cifra contra la que se eligieron los ajustes. Es la que hay que comparar contra cualquier otra candidata.
  3. Si el drawdown de capital está bastante por encima del de saldo, dimensiona sobre la cifra de capital. La brecha te dice cuántas posiciones sostiene el EA dentro del mismo movimiento. La ejecución de chrysalis lo dice sin rodeos: hasta siete a la vez.
  4. Si el informe salió de los datos de otra persona, vuelve a ejecutarlo sobre una segunda fuente antes que nada. Esta comprobación tiene el efecto medido más grande de todo nuestro conjunto, y es la última que ejecuta la gente.

Qué movió de verdad las cifras: el histórico de precios, no el modelo de ticks

Uno de nuestros EA se volvió a ejecutar a propósito para separar esas dos variables, y el registro de la ejecución etiqueta cada sombra con lo que aísla.

Ejecución de tidewell-slackQué cambióOperacionesFactor de beneficioDrawdown máximoCalidad del históricoVeredicto
PublicadaHistórico M1 de Exness, Model 03031,359,92%99%PASS
Sombra — aísla el históricoHistórico de Dukascopy, Model 03511,1318,18%99%FAIL
Sombra — aísla los ticks realesHistórico de Dukascopy, Model 43451,1118,20%100%FAIL

Léelo como dos experimentos separados. Cambiar solo el histórico de precios — de la primera fila a la segunda, con el mismo modelo de ticks — llevó el factor de beneficio de 1,35 a 1,13, casi dobló el drawdown y dio la vuelta al veredicto, de aprobado a suspenso. Cambiar solo el modelo de ticks sobre ese histórico nuevo — de la segunda fila a la tercera — movió el factor de beneficio 0,02 y el drawdown 0,02 puntos. Y la calidad del histórico marca 99% y 100% en las dos ejecuciones que suspendieron, así que el campo por el que criba la mayoría de la gente fue excelente todo el rato.

Un segundo EA apunta en la misma dirección desde otro ángulo. kestrel-hover está publicado sobre ticks reales de Dukascopy con un factor de beneficio de 1,33 y un drawdown del 7,11%, y su ejecución sombra sobre histórico M1 de Exness con Model 0 marca 1,30 y 6,76% — cambiaron a la vez la fuente y el modelo, y el resultado apenas se movió. La estabilidad entre fuentes de datos es posible. Lo que pasa es que no es algo que un informe suelto pueda demostrar.

La regla práctica: un informe es evidencia trasladable solo en la medida en que lo sea su histórico de precios. Volver a ejecutarlo sobre una segunda fuente cuesta una tarde. En nuestros registros es la única comprobación de este artículo que ha cambiado una decisión.

Próximos pasos: del informe a la decisión

Leer bien un informe es el segundo de cuatro pasos. La secuencia es backtest → lectura → análisis walk-forward → demo, y cada uno elimina una forma distinta de estar equivocado. Un informe que sobrevive a los cuatro se ha ganado una posición pequeña; uno que sobrevive a los dos primeros se ha ganado otra prueba.

  • Practica sobre registros que estén completos. Cada uno de los EA publicados lleva su lista completa de operaciones cerradas y el manifiesto de su ejecución, así que puedes recalcular tú mismo una cabecera y ver exactamente qué operaciones la produjeron. Ese es el único ejercicio que hace que la lectura se te quede.
  • Si una cifra te devuelve a la estrategia en lugar de a la prueba, el Builder es donde cambia la regla en sí. Buscar entre ajustes es otro trabajo distinto, y está cubierto en optimización de parámetros.
  • Antes de dimensionar nada a partir de una cifra de drawdown que acabas de leer, la gestión del riesgo para quien opera con EA la convierte en un depósito y un tamaño de lote.
  • Cómo producimos, puntuamos y registramos todo esto está explicado en nuestra metodología de pruebas.

Los resultados pasados en un probador no son un pronóstico, y ninguna de las ejecuciones de arriba es una promesa sobre los próximos 12 meses. El sentido de leer bien un informe es más pequeño y más útil que una predicción. Te dice qué se ha demostrado, y qué se ha limitado a imprimirse.

Preguntas frecuentes

¿Qué factor de beneficio es bueno en un informe de backtest de MT5?
Pregunta qué operaciones cubre antes de juzgar la cifra. Los 23 informes publicados en este sitio se sitúan entre 1,22 y 1,59, y la distancia dentro de un mismo informe es mayor que la que hay a lo largo de todo el catálogo: orrery marca 1,28 sobre las 195 operaciones con las que se eligió y 1,46 en cuanto se incluyen 15 operaciones posteriores. Un factor de beneficio empieza a significar algo cuando puedes decir cuántas operaciones lo produjeron y si esas operaciones se usaron para elegir los ajustes. Por debajo de unas 25 operaciones no informa casi de nada — 16 de nuestros 20 tramos posteriores a la publicación son así de pequeños, y sus factores de beneficio van de 0,72 a 6,43.
¿Por qué mi informe de MT5 muestra dos cifras de drawdown distintas?
Porque MetaTrader mide por separado la curva de saldo y la de capital, y la de capital arrastra las posiciones abiertas. El drawdown de capital es el más profundo de los dos en los 23 informes; la mayor brecha es la de cairn, con un 14,52% en saldo frente a un 25,62% en capital, es decir, 11 puntos de sufrimiento que una cita solo del saldo esconde. La brecha es una propiedad de cómo sostiene las posiciones el EA — la ejecución de chrysalis deja constancia del motivo con toda claridad: el EA puede sostener hasta siete posiciones dentro del mismo movimiento. Y hay un segundo eje: MetaTrader publica las definiciones Maximal y Relative, y 16 de nuestras ejecuciones registran el par Maximal mientras 5 registran el par Relative. Cita la línea de capital, y di de qué definición salió.
¿Una tasa de acierto alta significa que el EA es bueno?
No, y nuestro propio conjunto es el contraejemplo. La tasa de acierto de los 23 informes publicados correlaciona con el factor de beneficio a 0,37, lo que deja sin explicar la mayor parte de la variación. nautical gana el 30,80% de sus operaciones y aun así devuelve un factor de beneficio de 1,22; zerqon gana el 78,26% y marca 1,43. El caso más claro es lo que le pasó a zerqon después: en las 21 operaciones desde que se publicó siguió ganando el 76,19% de las veces y sacó un factor de beneficio de 0,72, perdiendo 61,47 USD. Una tasa de acierto te dice la forma de la distribución de operaciones, no su signo.
¿Me puedo fiar de un backtest hecho con los datos de otra persona?
Trátalo como una afirmación sobre su histórico de precios, no sobre el EA. Tenemos un EA medido de las dos maneras, con el modelo de ticks fijo: tidewell-slack publica 303 operaciones con un factor de beneficio de 1,35 y un drawdown del 9,92% sobre histórico M1 de Exness, y el mismo EA sobre el mismo periodo con histórico de Dukascopy produjo 351 operaciones a 1,13 con un drawdown del 18,18% — un suspenso bajo el mismo filtro. Pasar esa ejecución de Dukascopy de ticks generados a ticks reales la movió después 0,02, hasta 1,11. El histórico movió el veredicto; el modelo de ticks no. Pregunta de qué histórico de precios salió un informe antes de preguntar cualquier otra cosa.