라이브 전환 전에 AI 트레이딩 에이전트를 백테스트하는 법
에이전틱 전략을 국면별로 백테스트하는 방법, 정말로 중요한 리포트 수치, 그리고 LLM 기반 백테스트가 스스로를 과대평가하는 이유.

평이한 언어로 된 프롬프트로 만든 에이전트는, 여러분의 전략을 정확히 되짚어 말하는 순간 이미 검증된 것처럼 느껴집니다. 그렇지 않습니다. 되짚기는 이해이고, 백테스트는 증거입니다. 어떤 에이전트든 실제 자본에 손대기 전에, 그 정확한 규칙이 수년간의 실제 시장 역사를 거치며 어떻게 행동했을지 알아야 합니다. 그리고 AI 트레이딩 에이전트를 잘 백테스트하려면 세 가지가 필요합니다. 재현할 수 있을 만큼 촘촘하게 확정된 규칙, 의미가 있을 만큼 가혹한 검증 기간, 그리고 리포트를 팬이 아니라 비평가로서 읽는 규율입니다. 이 가이드는 이 세 가지 모두와, LLM 기반 전략 특유의 한 가지 실패 유형을 다룹니다.
기계가 재현할 수 있을 만큼 규칙을 확정하라
백테스트는 여러분의 로직을 과거 데이터에 대고 캔들 하나하나씩 재현합니다. 이는 에이전트가 내리는 모든 결정이 그 순간에 존재하던 데이터로부터 계산 가능할 때에만 작동합니다. "일봉 RSI(14)가 30 아래로 마감하고 가격이 200일 이동평균 위에 있을 때 매수"는 완벽하게 재현됩니다. "뉴스가 과했다고 느껴질 때 매수"는 재현되지 않는데, "느껴진다"는 것은 어떤 캔들에도 들어 있지 않기 때문입니다.
그러므로 첫 번째 과제는 에이전트가 되짚은 조건들을 완전한 명세로 바꾸는 것입니다. 유용한 시험이 있습니다. 과거 가격과 여러분의 규칙이 담긴 스프레드시트가, 남는 판단 없이 모든 진입, 모든 청산, 모든 포지션 크기를 결정할 수 있는가? 규칙 하나가 해석을 필요로 한다면, 백테스트 엔진은 그것을 어떻게든 해석할 것이고, 그 해석이 여러분의 동의 없이 여러분의 전략이 됩니다.
조용한 파라미터들도 살피십시오. 슬리피지와 수수료 가정, 주문 유형(시장가 주문은 체결되지만 지정가 주문은 때로 체결되지 않습니다), 그리고 주식의 경우 장 마감 시간 밖의 신호에 무슨 일이 일어나는지 말이죠. 이런 엔진들이 일반적으로 어떻게 작동하는지 처음이라면, 백테스팅 소프트웨어 가이드가 기초를 다룹니다. 이 글은 에이전트에게 무엇이 다른가에 초점을 맞춥니다. 그리고 아직 전략의 진입, 청산, 크기, 무효화를 정의하지 않았다면 그것부터 하십시오. 그것이 AI 트레이딩 에이전트 만들기의 두 번째 단계입니다.
시장 국면 전반에 걸쳐 AI 트레이딩 에이전트를 백테스트하는 법
최근 과거로만 검증한 전략은 그 최근 과거가 계속된다는 데 거는 베팅입니다. 해법은 의도적입니다. 서로 다른 실패 유형을 압박하는 검증 구간을 고르고, 에이전트가 그 대부분을 견뎌 내도록 요구하는 것이죠. 지난 10년의 네 가지 국면이 많은 영역을 아우릅니다.
| 기간 | 어떤 시기였나 | 무엇을 압박하나 |
|---|---|---|
| 2018 | 갈려 내려가는 약세장 (암호화폐 약 80% 하락, 주식의 4분기 급락) | 청산 규율, DCA 인내력, 천 번의 작은 상처로 인한 죽음 |
| 2020년 2~3월 | 수직 폭락 후 V자 반등 | 갭 움직임과 슬리피지 하의 손절, 재진입할지 겁먹은 채 머물지 |
| 2021 | 지속적인 상승 랠리 | 공매도와 평균 회귀 규칙이 추세와 맞서 싸우는지, 성급한 익절 |
| 2022 | 금리 상승 드로다운, 주식과 암호화폐 동반 하락 | 상관관계 가정, 추세 필터, 드로다운 상한 |
에이전트의 규칙을 하나의 긴 평균이 아니라 각 구간별로 따로 돌리십시오. 저점 매수 규칙은 2020년과 2021년에 빛나다가 2022년에 그 모두를 되돌려줄 수 있는데, 하나의 종합 수치는 그 이야기를 감춥니다. 네 국면 모두에서 수익을 요구하는 것이 아닙니다. 어느 국면이 에이전트에게 상처를 주는지, 그리고 손상이 복리로 불어나기 전에 무효화 규칙이 발동하는지를 미리 알기를 요구하는 것입니다.
여기서 도구가 실질적으로 중요해집니다. Obside에서는 백테스팅 엔진이 슬리피지 가정을 내장한 채 수년간의 과거 데이터를 몇 분 만에 재현하므로, 네 구간을 검증하는 일은 주말 프로젝트가 아니라 점심 전에 끝내는 네 번의 실행이 됩니다. 어떤 엔진을 쓰든 원칙은 그대로입니다. 평균이 아니라 국면입니다.
리포트를 적처럼 읽어라
백테스트 리포트는 여러분 자신의 희망이 쓴 판매 문구입니다. 각 수치가 무엇을 말해 줄 수 있고 무엇을 말해 줄 수 없는지에 따라 읽으십시오.
Sharpe 비율은 변동성 단위당 수익을 측정합니다. 대략 0.5에서 1.5 사이가 대부분의 개인 투자자 전략에서 정직한 구간입니다. 백테스트에서 3을 넘는 Sharpe는 발견이라기보다 버그, 편향, 혹은 과최적화인 경우가 더 많습니다.
최대 드로다운은 고점에서 저점까지의 가장 깊은 손실입니다. 이를 여러분이 진정으로 견뎌 낼 수 있는 수준과 비교하고, 그다음 라이브는 더 나쁠 것이라고 가정하십시오. 역사적 최악의 경우는 천장이 아니라 바닥이기 때문입니다.
승률은 홀로는 아무 의미가 없습니다. 작은 이익과 드문 재앙적 손실이 뒤섞인 90% 승률은, 다가오는 롤러 앞에서 동전을 줍는 전략을 묘사합니다. 감탄하기 전에 평균 손익비와 짝지어 보십시오.
거래 횟수는 여러분의 표본 크기입니다. 약 30건 미만이면 일화에 불과합니다. 10건 미만이면 그저 이야기일 뿐입니다.
노출도는 그 수익을 얻기 위해 자본이 시장에 얼마나 오래 머물렀는지를 알려 주는데, 이는 자산 곡선이 보여 주지 않는 위험입니다.
그런 다음 스트레스 변형을 한 번 돌리십시오. 슬리피지와 수수료 가정을 두 배로 늘려 다시 실행하는 것입니다. 자주 거래하거나 유동성이 얇은 자산을 거래하는 전략은 이 한 번의 시험에서 우위가 증발하는 것을 볼 수 있습니다. 작은 파라미터 변화(RSI 30 대 32, 손절 4% 대 5%)가 결과를 무너뜨린다면, 여러분은 커브 피팅을 마주하고 있을 가능성이 큽니다. 이 실패 계열 전체는 백테스트 과최적화 가이드에서 낱낱이 해부합니다.
LLM 단서: 모델이 이미 결말을 아는 경우
에이전틱 전략은 고전적인 봇에는 결코 없던 실패 유형을 들여옵니다. 만약 대규모 언어 모델이 백테스트 루프 안에서 결정(자산 선택, 진입 타이밍, 뉴스 가중)을 내린다면, 그 학습 데이터에는 여러분이 검증하고 있는 바로 그 역사가 담겨 있을 수 있습니다. 모델은 2021년을 예측하는 것이 아니라 기억하고 있는 것입니다.
이는 가정이 아닙니다. LLM 기반 투자 전략에 관한 연구는 백테스트가 암기와 미래 참조로 부풀려진다는 것을 발견했습니다. 학습 데이터가 검증 구간과 겹치는 모델은 종목, 날짜, 가격 움직임을 떠올릴 수 있으며, 성과는 표본 밖에서 흔히 저하됩니다("Can LLM-based Financial Investing Strategies Outperform the Market?", arXiv:2505.07078, 2025). 후속의 메모리 통제 벤치마크는 암기된 시장 역사를 제대로 배제하면 LLM 트레이딩 에이전트의 겉보기 실력이 급격히 떨어진다는 것을 보였습니다(arXiv:2605.28359, 2026). 이 분야의 한 서베이도 여러 연구 전반에서 같은 패턴을 지적합니다. 짧은 검증 구간, 작은 유니버스, 미래 참조 위험이 그것입니다(arXiv:2408.06361, 2024).
두 가지 실질적 방어책이 있습니다. 첫째, LLM이 거래를 결정한다면, 그 학습 컷오프 이후의 검증 구간만 신뢰하십시오. 그러면 대개 수년이 아니라 수개월의 데이터가 남습니다. 둘째, 대부분의 개인 투자 용도에는 이편이 더 낫습니다. LLM을 재현 루프에서 완전히 빼내는 것입니다. LLM이 여러분의 전략을 한 번 결정론적 규칙으로 번역하게 하고, 그다음 그 규칙을 고전적인 방식으로 백테스트하십시오. Obside는 바로 이렇게 만들어졌습니다. 코파일럿은 여러분의 언어를 해석하지만, 백테스트는 고정된 조건을 과거 캔들에 대고 재현하므로, 답을 기억할 모델이 루프 안에 없습니다.
통과 기준: 합격한 백테스트란 어떤 모습인가
다음 단계로 넘어가기 전에 "합격"이 무엇을 뜻하는지 적어 두고, 리포트를 그 기준에 대고 냉정하게 점검하십시오. 합리적인 기준선은 이렇습니다.
- 네 국면 중 최소 셋을 견뎌 낸다. 수익이 나지 않은 곳에서도 손실이 무효화 규칙 안에 머물렀다는 뜻입니다.
- 최대 드로다운이 검증 전에 여러분이 감내 가능하다고 선언한 수치 이하다.
- 전체 검증에 걸쳐 최소 30건의 거래로, 의미를 갖기에 충분하다.
- 비용 가정을 두 배로 늘린 뒤에도 여전히 플러스다.
- 이웃한 파라미터 값들이 비슷한 결과를 낸다. 하나의 마법 같은 봉우리가 아니라 고원(plateau)이다.
- 최악의 연속 손실을 평이한 말로 설명할 수 있다. 어떤 시장 상황이 그것을 일으켰고 전략이 여전히 건전한 이유가 무엇인지 말이죠.
한 기준에서 미달하면 재설계 대상이 있는 것이고, 세 기준에서 미달하면 찾아야 할 다른 전략이 있는 것입니다. 그리고 전부 합격했더라도 여전히 라이브 전환의 허가는 아닙니다. 백테스트는 라이브 데이터에서의 의도 번역, 실행 타이밍, 실제 드로다운을 지켜보는 여러분 자신의 행동을 검증할 수 없습니다. 그것이 다음 단계가 존재하는 이유이며, 같은 에이전트 정의가 변경 없이 그리로 옮겨 가야 합니다. 그 사례와 체크리스트는 AI 에이전트 페이퍼 트레이딩 가이드에 있습니다.
여기서 어디로 갈 것인가
에이전트를 백테스트하는 일은 훌륭한 수치를 찾는 것이라기보다 정보를 값싸게 사들이는 일입니다. 어느 국면이 여러분의 규칙을 무너뜨리는지, 최악의 달이 어떤 모습인지, 비용이 우위를 갉아먹는지 말이죠. 이 발견들은 하나같이 백테스트에서는 비용이 들지 않지만 라이브에서는 실제 돈이 듭니다. 규칙을 확정하고, 네 국면을 돌리고, 리포트를 적처럼 읽고, 어떤 LLM도 재현 루프에 얼씬거리지 못하게 하십시오. 수년을 몇 분에 재현하고, 슬리피지를 내장하고, 똑같은 그 에이전트를 한 단계로 페이퍼 트레이딩까지 승격시키는 엔진을 원한다면, 다음 백테스트를 Obside에서 돌려 보십시오.
본 콘텐츠는 교육 목적으로만 제공됩니다. 투자 자문이 아닙니다. 트레이딩에는 원금 손실을 포함한 위험이 따릅니다.
FAQ
최소한 약세장 하나, 폭락 하나, 강한 랠리 하나를 포함할 만큼 멀리까지입니다. 대부분의 전략에는 5년 이상을 뜻합니다. 길이보다 다양성이 더 중요합니다. 2020년부터 2022년까지를 아우르는 3년이, 꾸준한 강세장 8년보다 더 많은 것을 가르칩니다. 더 빠른 전략이라면 표본 크기도 확인하십시오. 통계가 의미를 갖기 전 30건 이상이 합리적인 바닥입니다.