트레이딩 속의 LLM: 할 수 있는 것과 없는 것
대규모 언어 모델이 트레이더에게 진정으로 도움이 되는 지점, 자신 있게 실패하는 지점, 그리고 연구가 말하는 LLM 백테스트의 자기 미화. 기술적으로 정직한 가이드.

몇 주에 한 번씩 어떤 논문이나 제품이 대규모 언어 모델이 시장을 이겼다고 주장합니다. 그 주장은 보통 받는 것보다 더 냉정한 시선을 받을 자격이 있습니다. LLM 트레이딩이 어색한 교차점에 앉아 있기 때문입니다. 언어 모델은 트레이딩에 인접한 어떤 일에는 진정으로 탁월하고 다른 부분에는 진정으로 형편없는데, 마케팅은 어느 쪽이 어느 쪽인지 좀처럼 알려 주지 않습니다. 이 글은 그 경계를 정확히 긋습니다. LLM이 잘하는 것, 실패하는 지점, 그 백테스트가 자기를 미화하는 이유, 그리고 텍스트 예측기에 계좌를 걸지 않으면서 이점을 얻는 아키텍처.
LLM이 무엇이며, 그것이 왜 호가창 앞에서 중요한가
LLM은 다음 토큰 예측기입니다. 텍스트가 주어지면, 통계적으로 뒤따를 법한 텍스트를 만들어 내되, 도움이 되도록 훈련으로 다듬어져 있습니다. 그 단 하나의 사실이 트레이딩에서의 강점과 실패 모드를 모두 설명합니다.
언어에 대한 예측은 LLM을 언어 과업에 뛰어나게 만듭니다. 요약, 표현 간 번역, 산문에서 구조 추출, 훈련 데이터에 나타나는 추론 패턴 모방. 금융은 정확히 이런 종류의 자료에 빠져 있습니다. 공시, 실적 발표록, 중앙은행 성명, 뉴스 와이어. 예전에는 소화하는 데 사람의 시간이 필요했던 비정형 텍스트입니다.
하지만 다음 토큰 예측 안에는 장부가 없습니다. 모델은 계산기가 하듯 $41,000의 2.7%를 계산하지 않습니다. 맥락상 그럴듯해 보이는 숫자를 만들어 냅니다. 보정된 확률 감각도 없고, 별도로 연결하지 않는 한 실시간 시장 피드도 없으며, 틀렸다는 개념도 없고 오직 그럴 법하지 않다는 개념만 있습니다. 출력이 요약일 때는 이 중 무엇도 중요하지 않습니다. 출력이 주문일 때는 이 모든 것이 중요합니다.
LLM 트레이딩 도구가 진정으로 도움이 되는 지점
네 가지 일이 두드러지며, 하나의 속성을 공유합니다. LLM이 언어를 다루는 동안 다른 무언가가 결과를 다룬다는 것입니다.
기계 속도로 뉴스와 공시 파싱하기. LLM은 FOMC 성명을 발표 몇 초 뒤에 읽고 직전 성명과 대조할 수 있습니다. 어느 문장이 바뀌었는지, 인플레이션에 관한 표현이 강경해졌는지 완화되었는지. 200페이지짜리 연차 보고서를 "가이던스 하향, 투입 비용에 기인한 마진 압박, 자사주 매입 중단"으로 바꿀 수 있습니다. 인간도 이것을 잘하지만, LLM은 수백 개 문서에 걸쳐 몇 초 만에 합니다.
의도를 규칙으로 번역하기. "상승 추세에서 약세를 사고 싶다"는 실행 가능하지 않습니다. LLM은 그 번역을 제안하는 데 능합니다. 200일 이동평균 위 가격, RSI(14) 35 아래, 고정된 포지션 규모, 정의된 청산. 인간은 번역이 의도와 맞는지 판단하고, 기계는 초안 작성을 다룹니다.
포지션과 국면 설명하기. 이번 주 포트폴리오가 왜 4% 잃었느냐고 물으면, 실제 포지션 데이터와 가격 이력에 접근하는 LLM은 읽기 쉬운 요인 분해를 만들어 낼 수 있습니다. 어떤 종목이 그것을 이끌었고, 무엇이 상관되었고, 어떤 뉴스가 겹쳤는지. 이것은 금융의 모자를 쓴 요약이며, 모델의 역량 한복판에 있습니다.
전략 로직 비평하기. 여러분의 시스템을 LLM에 설명하고 무엇이 그것을 깨뜨리느냐고 물으면, 종종 쓸모 있는 목록을 얻습니다. 무효화 규칙 없음, 수수료 가정 없음, 좀처럼 발동하지 않는 진입 조건. 일반 챗봇도 이 정도는 할 수 있고, 그래서 저희는 ChatGPT를 유용한 조수이자 형편없는 트레이더로 취급합니다. 그 구분은 목적 특화 시스템에도 이어집니다.
LLM이 실패하는, 그것도 자신 있게 실패하는 지점
산술. 진입 $43,150, 스탑 $41,900으로 $27,400 계좌의 1%를 리스크로 잡는 포지션 규모를 모델에 물으면 정답을 얻을 수도 있습니다. 리스크 $274 대 단위당 $1,250이니 대략 0.22 단위. 하지만 틀린 숫자를 담은 유창한 문단을 얻을 수도 있고, 두 경우를 구분할 신호는 없습니다. 계산기의 오류는 드물고 요란합니다. LLM의 오류는 이따금이고 조용합니다. 조용한 오류가 트레이딩에서 비싼 종류입니다.
보정. 트레이딩은 확률적 의사 결정이며, LLM은 보정된 확률을 만들어 내지 않습니다. "이 돌파가 이어질 확률은 70%"라고 말하는 모델은 빈도를 측정하는 것이 아니라 그럴듯한 문장을 생성하는 것입니다. 지어낸 확신에 따라 행동하는 것은 확신 없이 행동하는 것보다 나쁩니다. 정보처럼 느껴지기 때문입니다.
가격 예측. 다음 토큰 훈련의 어떤 것도 수익률 예측에 우위를 주지 않습니다. 77개의 LLM 트레이딩 연구를 검토한 감사(arXiv:2605.19337, 2026)는 지속적 알파의 증거가 여전히 빈약하며, 이 시스템의 실질적 가치가 종목 선정이 아니라 규율 있는 실행, 감시, 리서치 보조에 있다고 결론지었습니다. 그 발견은 메커니즘과 맞아떨어집니다. 모델은 텍스트의 패턴을 알아보는데, 가격은 텍스트가 아닙니다.
날조된 사실. LLM은 환각을 일으키고, 금융이 그것을 자극합니다. 빽빽한 숫자, 비슷한 엔티티 이름, 날짜에 민감한 주장. 2024년부터 2025년까지의 벤치마크는 안전장치 없이 던진 금융 질문의 상당 비율에서 환각을 측정했습니다. 그 실패 모드와 아키텍처 수준의 해법은 별도의 다룸을 받을 자격이 있으며, 트레이딩에서의 AI 환각에서 다룹니다.
백테스트 신기루: LLM 결과가 자기를 미화하는 이유
연구 문헌에는, 어떤 LLM 전략의 실적을 믿기 전에 이해해 둘 만한 재현성 문제가 있습니다.
LLM 트레이딩 에이전트에 관한 2024년 서베이(arXiv:2408.06361)는 발표된 대부분의 시스템이 우수한 백테스트 성과를 보고한다고 지적한 뒤, 그 패턴 뒤의 패턴을 짚었습니다. 짧은 테스트 구간, 작은 종목 유니버스, 그리고 이 분야 전반에 걸친 룩어헤드 리스크. 인상적인 숫자, 약한 실험 설계.
그다음 더 날카로운 진단이 나왔습니다. "Can LLM-based Financial Investing Strategies Outperform the Market?"(arXiv:2505.07078, 2025)는 LLM 백테스트가 암기로 부풀려진다는 것을 보였습니다. 훈련 데이터가 백테스트 기간을 포함하는 모델은 티커, 날짜, 가격 움직임을 사실상 기억할 수 있습니다. 그것은 2021년을 예측하는 것이 아니라 2021년을 회상하는 것입니다. 전략이 모델의 지식 컷오프를 지나 표본 밖에서 평가되면 성과가 종종 저하됩니다.
2026년의 메모리 통제 벤치마크(arXiv:2605.28359)가 그것을 확인했습니다. 암기된 시장 이력이 예측에 새어 들지 못하도록 평가를 설계하면, 겉보기 실력이 급격히 떨어집니다.
실전 시험은 간단합니다. 모델이 훈련한 기간에 대해 백테스트된 LLM 전략은 기본적으로 의심하십시오. 훈련 컷오프 이후의 결과나, 암기 통제 평가를 요구하세요. 이것은 고전적 퀀트 죄악의 에이전트 시대 사촌이며, 고전적 방어책이 여전히 적용됩니다. 백테스트 과최적화에서 다룹니다.
작동하는 아키텍처: 위에는 언어, 아래에는 결정론
위의 모든 것에서 나오는 정직한 결론은 "LLM을 피하라"가 아닙니다. 분업입니다. 언어 모델은 언어를 하게 하세요. 결과가 따르는 모든 것은 결정론적 엔진이 하게 하세요.
잘 만들어진 시스템에서 LLM은 여러분의 지시를 해석하고, 규칙 초안을 작성하고, 결과를 설명하고, 뉴스를 요약합니다. 규칙 자체는, 일단 승인되면, 평범한 결정론적 로직으로 돌아갑니다. 시장 데이터에서 계산된 지표 값, 정확히 비교되는 임계값, 즉흥적일 수 없는 산술로 산정된 주문. LLM은 제안하고, 엔진은 처리합니다. 모델이 해석 중에 환각을 일으켜도, 여러분은 승인 단계에서 그것을 잡습니다. 시스템이 무엇이든 실행되기 전에 이해한 내용을 여러분에게 보여 주기 때문입니다. 틀린 문장은 교정되고, 결코 틀린 주문이 되지 않습니다.
이것이 Obside가 경계를 긋는 방식입니다. 코파일럿은 LLM이며, 그 일은 언어에서 끝납니다. "일봉 RSI(14)가 30 아래로 마감하면 SOL을 사고, 55 위로 되돌리면 팔고, 거래당 1%를 리스크로" 입력하면, 코파일럿이 그것을 감시 조건과 사이징 규칙으로 다시 진술해 여러분의 승인을 받습니다. 거기서부터 결정론적 엔진이 넘겨받습니다. 백테스트는 정확한 지표 계산으로 과거 캔들을 재생하고, 페이퍼 트레이딩은 같은 로직을 실시간 데이터에서 돌리며, 라이브 실행은 실행 시점에 점검되는 여러분의 리스크 한도로 모든 주문 규모를 수치로 계산합니다. LLM은 결코 산술을 하지 않고 결코 주문을 건드리지 않습니다.
그 분리는 백테스트의 의미도 바꿉니다. 시험 대상이 모델의 날마다의 판단이 아니라 결정론적 규칙이므로, 새어 들 암기된 이력이 없습니다. 규칙은 테스트 구간이 어떤 훈련 코퍼스 안이든 밖이든 동일하게 작동합니다. 여러분은 회상이 아니라 로직을 검증하는 것입니다. 이 조각들이 어떻게 완전한 인지-추론-행동 시스템으로 조합되는지는 그 나름의 주제이며, AI 트레이딩 에이전트 완전 해설에서 다룹니다.
여기서 어디로 갈 것인가
LLM을 돈을 건드릴 자격이 없는 뛰어난 애널리스트로 취급하세요. 그것을 써서 더 빨리 읽고, 의도를 정확한 규칙으로 번역하고, 여러분 자신의 로직을 심문하세요. 세 가지 일은 그것에 거부하세요. 숫자 계산, 확률 추정, 가격 예측. 그리고 모델이 암기했을 수 있는 백테스트에서 나온 어떤 성과 주장이든 할인하세요. 연구는 그 점에서 분명합니다.
이 분업이 이미 갖춰진 것을 원한다면, Obside가 그것을 기본으로 적용합니다. 언어는 코파일럿이 다루고, 계산과 실행은 결정론적 엔진이 다루며, 여러분이 재진술된 규칙을 승인하고 그것이 페이퍼에서 작동하는 것을 지켜보기 전에는 아무것도 라이브로 가지 않습니다.
본 콘텐츠는 교육 목적으로만 제공됩니다. 투자 자문이 아닙니다. 트레이딩에는 원금 손실을 포함한 위험이 따릅니다.
FAQ
그것을 뒷받침하는 신뢰할 만한 증거는 없습니다. 77개의 LLM 트레이딩 연구를 검토한 2026년 감사(arXiv:2605.19337)는 지속적 알파의 증거가 여전히 빈약하다고 밝혔고, 암기를 통제한 연구들은 겉보기 예측 실력이 급격히 떨어짐을 보입니다. LLM은 텍스트의 패턴을 알아봅니다. 가격은 텍스트가 아닙니다. 트레이딩에서 입증된 가치는 규율 있는 실행 지원, 리서치 보조, 의도를 규칙으로 번역하는 것이지, 수익률 예측이 아닙니다.