courses
통계적 차익거래(statistical arbitrage, 흔히 stat arb로 줄여 부름)는 유가증권 간의 통계적 관계를 활용해 잠재적 매매 기회를 찾는 정량 트레이딩 전략군입니다. 핵심은 개별 종목의 상승이나 하락을 단독으로 예측하는 것이 아닙니다. 역사적으로 연동되어 온 두 유가증권이 기대되는 관계에서 일시적으로 벗어날 때 상대적 오定가를 포착하고, 다시 수렴할 것에 베팅하는 것입니다.
먼저 분명히 할 점이 있습니다. 통계적 차익거래는 무위험 차익거래가 아닙니다. 기회는 확률적이며, 전략을 지탱하는 관계가 완전히 붕괴될 수도 있습니다. 저는 BlueCrest에서 아시아 자본시장 포지션을 운용하며 이를 직접 목격했습니다. 서류상으로는 통계적으로 탄탄해 보이던 거래가 거시 국면이 바뀌는 순간 와해될 수 있습니다.
이 글에서는 페어 트레이딩과 평균회귀를 통해 stat arb가 어떻게 작동하는지, 상관관계보다 공적분이 왜 더 중요한지, 그리고 실무에서 마주치는 실제 위험이 무엇인지 살펴봅니다.
통계적 차익거래란 무엇인가?
통계적 차익거래는 과거 및 실시간 데이터를 사용해 유가증권 간의 통계적 관계를 식별합니다. 그 관계가 기대 상태에서 벗어나면, 트레이더는 상쇄되는 롱·숏 포지션을 취합니다. 상대적으로 저평가된 종목을 매수하고 상대적으로 고평가된 종목을 공매도한 뒤, 관계가 정상화되기를 기다립니다.
롱/숏 구조는 광의의 시장 변동 노출을 줄여 줍니다. 시장이 5% 하락하더라도 양쪽 레그가 대체로 비슷하게 영향을 받기 때문에, 손익은 시장 방향이 아니라 두 유가증권 사이의 상대적 움직임에서 발생합니다.
통계적 차익거래의 작동 방식
일반적인 워크플로우는 다음과 같습니다. 연관된 유가증권을 식별하고, 그들의 역사적 관계를 모델링하며, 현재 스프레드가 역사적 규범에서 벗어났는지 감지합니다. 그런 다음 상쇄되는 롱·숏 포지션을 열고, 수렴하거나 청산 조건이 트리거될 때까지 기다립니다.
간단한 예를 들어보죠. 뚜렷한 펀더멘털 이유 없이 펩시가 갑자기 코카콜라 대비 이례적으로 큰 할인에 거래된다면, stat arb 전략은 펩시를 매수하고 코카콜라를 공매도하여 스프레드가 평균으로 되돌아갈 것을 기대합니다. 수익은 특정 종목의 방향이 아니라 그 스프레드가 좁혀지는 데서 나옵니다.
페어 트레이딩: 간단한 통계적 차익거래 예시
이 기본 워크플로우를念頭에 두고 보면, 페어 트레이딩이 가장 직관적인 구현입니다. 역사적으로 연관된 두 유가증권을 선택하고, 두 가격 간 스프레드를 구성한 뒤, 그 스프레드가 과거 행동에서 이례적으로 멀어질 때 거래합니다. 싼 쪽을 매수하고 비싼 쪽을 공매도하며, 스프레드가 수렴하면 청산합니다.
강조할 점이 있습니다. 상관관계만으로는 안정적이고 거래 가능한 관계를 확립할 수 없습니다. 두 종목이 높은 상관을 보이더라도 영구적으로 괴리될 수 있습니다. 다음 섹션이 바로 그 내용을 다룹니다.

주가 A와 주가 B(상단) 및 그 스프레드(하단). 주요 되돌림 지점에 진입/청산 신호가 표시되어 있습니다. 이미지: 작성자.
통계적 차익거래에서의 평균회귀
페어 트레이딩이 (잘) 작동하는 이유는 평균회귀 때문입니다. 역사적 평균에서 벗어난 스프레드는 결국 되돌아오려는 경향이 있습니다. 핵심 척도는 z-점수입니다. (현재 스프레드 − 이동 평균) / 표준편차로 계산합니다. z-점수 +2는 스프레드가 역사적 규범보다 표준편차 두 배만큼 넓다는 뜻으로, 일부 전략에서는 이를 숏 신호로 봅니다.
z-점수의 장점은 신호를 표준화한다는 점입니다. “이 스프레드가 넓은가?”가 아니라 “이 스프레드가 평소 행동 대비 이례적으로 넓은가?”를 묻게 해줍니다. 평균회귀 전략이 실제로 답하려는 질문이 바로 이것입니다.
통계적 차익거래에서 공적분과 상관관계
평균회귀는 매매 논리를 제공하지만, 불편한 질문을 동반합니다. 스프레드가 정말 되돌아올지, 아니면 영구적으로 벌어질지 어떻게 알 수 있을까요? 여기서 상관관계와 공적분이 갈립니다. 이 부분은 중요합니다.
상관관계
상관관계는 두 변수 간 선형 관계의 강도를 측정합니다. 상관계수 0.9를 보이는 두 종목도 페어 트레이딩 대상으로는 부적합할 수 있습니다. 상관관계는 두 종목 간 스프레드가 안정적이거나 평균회귀적이라는 사실을 보장하지 않기 때문입니다.
공적분
공적분은 비정상 시계열들 사이의 장기 균형 관계를 설명합니다. 두 가격 시계열의 어떤 선형 결합이 정상성을 가져 평균을 중심으로 변동하고 드리프트하지 않는다면, 그 두 시계열은 공적분되어 있다고 합니다. 실제로 필요한 성질이 바로 이것입니다.
두 종목이 수년간 함께 상승하다가 영구적으로 괴리될 수도 있습니다. 높은 상관관계이지만 공적분은 없고, 신뢰할 수 있는 거래도 없는 셈이죠. Engle–Granger 검정이나 Johansen 절차로 공적분을 테스트하면 스프레드가 되돌아온다는 가정에 더 방어 가능한 근거를 제공합니다. 참고로 PCA는 여기서 다른 이야기이며, 이 글에서는 다루지 않겠습니다.
통계적 차익거래 전략 구축 방법
이론을 이해하는 것과 이를 작동하는 전략으로 옮기는 것은 별개입니다. 직관에서 현실적인 정량 워크플로우로 옮기려면 다섯 단계를 거쳐야 하며, 어느 하나라도 건너뛰면 서류상으론 훌륭하지만 실전에서 무너지는 전략이 되기 쉽습니다.
- 경제적 논리에서 출발: 동일 섹터, 공유된 공급망, 유사한 매출 동인 등. 순수히 과거 상관관계만으로 스크리닝하고 펀더멘털 근거가 없으면 허위 관계를 만들어냅니다.
- 스프레드 자체에 대해 확장 딕키–풀러(ADF) 검정으로 관계를 테스트하세요. 비정상이라면 되돌림이 아니라 드리프트하고 있는 것입니다.
- 1:1 가격 가정보다 헤지 비율로 스프레드를 구성하세요. 회귀로 데이터에서 추정한 헤지 비율은 한 종목당 다른 종목을 몇 단위 보유할지 결정합니다. 이를 잘못 잡으면 페어가 실제로 시장 중립이 아닙니다.
- z-점수 임계값을 중심으로 진입·청산 규칙 정의하세요. ±2.0에서 진입, 0으로 되돌아갈 때 청산, ±3.0에서 손절. 스프레드가 ±3을 넘어서 계속 움직인다면 더 좋은 진입점이 아니라 대개 관계가 붕괴되는 신호입니다. 최대 보유 기간도 중요합니다. 설정한 기간 내에 스프레드가 되돌지 않으면, 영원히 오지 않을 수도 있는 되돌림을 기다리기보다 포지션을 청산하세요.
- 달러 중립으로 포지션 사이징하고, 현실적인 거래 비용을 반영해 과거 데이터로 백테스트한 뒤, 실거래 성과는 백테스트보다 낮게 나올 것(높게가 아님)을 예상하세요.
통계적 차익거래 전략의 고도화
단순한 페어 트레이딩은 입문일 뿐 상한선이 아닙니다. 핵심 메커니즘에 익숙해지면 접근법은 보통 두 방향으로 확장됩니다.
멀티애셋 통계적 차익거래와 팩터 모델
멀티애셋 접근은 개별 페어가 아니라 종목 바스켓 간의 관계를 모델링합니다. 팩터 기반 접근은 공통 시장·섹터 팩터로 체계적 수익을 제거한 뒤, 잔여 오정가를 거래합니다. PCA는 이를 수백 종목으로 확장합니다. 공통 변동의 주된 원천을 식별하고, 그 구성요소로 설명되지 않는 수익을 거래하는 방식입니다.
기저의 베팅은 동일합니다(잔차 오정가는 되돌아온다). 다만 그것을 찾는 통계적 틀이 다릅니다. 더 이상 두 시계열이 공적분되는지 테스트하지 않습니다. 전체 횡단면 수익을 분해하고, 남은 노이즈가 일시적이라고 베팅합니다.
머신러닝 접근
ML은 관계 탐색, 신호 생성, 국면 탐지 도구로 편입되었습니다. 수익을 자동으로 높여주지는 않으며 고유한 모델 리스크를 수반합니다. 전략의 기반은 여전히 평균회귀입니다. ML은 같은 신호를 더 복잡한 방법으로 찾는 수단일 뿐입니다.
통계적 차익거래의 위험과 한계
더 정교한 전략이 근본적 위험을 없애주지는 않습니다. 대개 위험을 더 늦게, 너무 늦게야 보이게 만들 뿐입니다. 어떤 stat arb 전략을 운용하기 전에 이해할 가치가 있는 실패 양상은 다음과 같습니다.
관계 붕괴
전략의 기반이 된 역사적 관계는 과거의 기술일 뿐입니다. 업계 통합, 규제 변화, 기업 비즈니스 모델 전환 등은 관계를 영구적으로 바꿀 수 있습니다. 그런 경우 스프레드는 되돌아오지 않고 계속 반대로 움직입니다.
모델 리스크와 거래 비용
모든 stat arb 전략은 통계적 가정 위에 서 있습니다. 스프레드가 실제로 정상성이 없거나, 헤지 비율을 잘못 추정했거나, 룩백 윈도우를 부적절하게 선택했다면, 모델은 오해를 부르는 신호를 냅니다. 모델이 맞더라도 거래 비용은 순식간에 수익을 잠식하며, 순진한 백테스트에는 드러나지 않는 경우가 많습니다.
비용 전에는 수익성 있어 보이던 전략이 비용 반영 후에는 비수익이 될 수 있습니다. 채권에서도 이런 장면을 보아 왔습니다. 이론상 거래는 깔끔하지만, 실제 거래는 그렇지 않습니다.
체결 마찰과 과밀 거래
공매도는 공짜가 아닙니다. 대차 비용과 브로커의 매수 환매(buy-in) 위험은 현실의 비용입니다. 모델 가격과 실제 체결가의 슬리피지는 수백 건의 거래를 거치며 누적됩니다. 그리고 많은 펀드가 유사한 전략을 운용하면 서로의 행동에 노출됩니다.
2007년 8월 퀀트 붕괴는 바로 너무 많은 주식 stat arb 펀드가 동시에 청산에 나섰기 때문에 일어났고, 그 연쇄 반응은 해당 전략들이 근거로 삼았던 기저 관계와는 무관했습니다.
국면 전환
stat arb 모델은 특정 시장 환경(변동성 국면, 금리 사이클, 상관구조)에 맞춰 보정되어 있습니다. 그 환경이 바뀌면 모든 가정이 한꺼번에 이동합니다.
한두 페어의 문제가 아니라, 포트폴리오 전체가 문제를 일으킵니다. 전략이 기반한 통계적 특성이 더 이상 성립하지 않기 때문입니다. 저변동성 국면에서 정상적으로 보이던 스프레드 동학은 변동성이 급등하면 하룻밤 새 불안정해질 수 있으며, 역사적 룩백 윈도우는 이를 미리 경고하지 못합니다.
백테스트 과최적화
가장 교묘한 위험입니다. 충분한 매개변수와 과거 데이터가 있으면 거의 어떤 과거 구간이든 전략을 맞춰 넣을 수 있고, 실거래에서는 급격히 성과가 저하됩니다. 최소한의 안전장치는 아웃오브샘플 테스트이며, 이것조차 항상 충분하지는 않습니다.
통계적 차익거래와 유사 전략 비교
stat arb는 여러 인접 전략과 자주 혼동됩니다.
통계적 차익거래 vs. 전통적 차익거래
전통적 차익거래는 동일 자산이 두 거래소에서 다른 가격에 거래되는 등, 거의 기계적인 가격 괴리를 공략합니다. 충분히 빠르게 체결하면 이익은 거의 확실합니다. 반면 통계적 차익거래는 확률적 수렴에 베팅합니다. 위험 프로필이 전혀 다릅니다.
통계적 차익거래 vs. 페어 트레이딩
페어 트레이딩은 통계적 차익거래의 한 유형이지, 이 분야 전체의 동의어가 아닙니다. 용어가 혼용되지만, stat arb는 멀티팩터 모델, PCA 기반 전략, 대규모 포트폴리오 전반의 머신러닝 접근까지 포괄합니다. 대부분은 페어 트레이딩에서 시작합니다.
통계적 차익거래 vs. 알고리즘 트레이딩
알고리즘 트레이딩은 모든 자동화된 실행 전략을 아우르는 더 넓은 범주입니다. 통계적 차익거래는 그 안의 특정 계열입니다. 초고빈도 마켓메이킹과 추세추종도 알고리즘 전략이지만, stat arb는 아닙니다.
결론
통계적 차익거래의 본질은 관계가 지속된다는 가정에 대한 베팅입니다. 역사적으로 함께 움직여 온 두 유가증권을 찾아, 괴리가 생기기를 기다린 다음, 그 격차가 좁혀질 것에 포지션을 잡습니다. 수학은 그 직관을 형식화하지만, 수학이 버티라고 말할 때 시장이 달아나라고 말하더라도, 결국 당신을 붙들어 두는 것은 그 직관입니다.
stat arb를 진정 어렵게 만드는 것은 통계가 아닙니다. 당신이 거래하는 관계를 다른 모든 이들도 찾아낸다는 점입니다. 잘 작동하면 자금이 몰립니다. 자금이 너무 많이 몰리면, 2007년이 보여준 것처럼 점진적으로 혹은 한순간에 작동을 멈춥니다.
통계적 기초, 정상성 테스트, 시계열 모델링에 대해서는 Time Series Analysis in Python 강좌가 적합한 다음 단계입니다. 백테스트와 정량 워크플로우는 Financial Trading in Python 강좌에서 전략 구현과 평가를 실무 관점에서 다룹니다.
Vinod Chugani는 도쿄에서 JPMorgan의 최연소 헤지펀드 세일즈 데스크 책임자로 커리어를 시작했으며, 이후 리먼 브라더스에서 개인 판매 실적 기록을 세웠고, 이어서 30개국에 걸친 전자제품 유통 사업을 구축하여 매출을 SG$1억을 넘어 성장시킨 뒤 데이터 분야로 방향을 틀었습니다. 듀크대학교 경제학 졸업생이자 NYC Data Science Academy 출신인 그는 Maven의 Hugo Bowne-Anderson가 진행한 Building AI Applications 과정에서 100명+ 지원자 중 세 명뿐인 장학생 가운데 한 명이었습니다. 현재는 DataCamp, KDnuggets, Machine Learning Mastery, Statology에 통계부터 에이전트형 AI까지 폭넓은 주제로 글을 기고하고 있으며, NYC Data Science Academy에서 데이터 전문가들을 멘토링하고 있습니다. 지금까지 1,000회가 넘는 일대일 멘토링 세션을 진행했습니다.
FAQs
통계적 차익거래는 정말 무위험인가요?
아닙니다. 이름과 달리 통계적 차익거래에는 실질적인 위험이 있습니다. 전통적 차익거래는 보장된 가격 괴리를 공략합니다. stat arb는 확률적 수렴에 베팅합니다. 과거 패턴에 비춰 스프레드의 되돌림이 기대되지만, 보장은 없습니다. 관계는 붕괴될 수 있고, 모델은 틀릴 수 있으며, 거래 비용이 겉보기 수익을 없앨 수 있습니다.
페어 트레이딩과 통계적 차익거래의 차이는 무엇인가요?
페어 트레이딩은 통계적 차익거래의 한 형태로, 서로 연관된 두 유가증권을 서로에 대해 거래합니다. 통계적 차익거래는 더 넓은 범주로, 멀티애셋 바스켓 전략, 팩터 모델 접근, 대규모 포트폴리오 전반의 머신러닝 기반 신호까지 포함합니다. 페어 트레이딩은 가장 접근하기 쉬운 입문형일 뿐입니다.
왜 페어 트레이딩에서는 상관관계보다 공적분이 더 중요하나요?
상관관계는 두 가격 시계열이 함께 움직이는지를 알려줍니다. 공적분은 그 사이에 안정적이고 평균회귀적인 관계가 존재하는지를 알려줍니다. 상관관계가 매우 높아도 두 종목은 영구적으로 괴리될 수 있습니다. 이는 높은 상관관계이지만 공적분이 없는 상태로, 거래 가능한 스프레드가 없다는 뜻입니다. 스프레드가 되돌아온다는 가정을 실제로 지지하는 것은 공적분입니다.
z-점수란 무엇이며 stat arb에서 어떻게 사용하나요?
z-점수는 현재 스프레드가 롤링 역사적 평균에서 표준편차 몇 배 떨어져 있는지를 측정합니다. z-점수 +2는 스프레드가 이례적으로 넓다는 의미입니다. 트레이더는 진입 임계값(예: z-점수 ±2 초과)과 청산 목표(z-점수가 0을 향해 되돌아올 때)를 정해 포지션의 개시와 종료 시점을 규정합니다.
헤지 비율이란 무엇이며 왜 중요한가요?
헤지 비율은 한 종목 대비 다른 종목을 몇 단위 거래할지를 결정합니다. 1:1 비율은 두 종목의 가격 민감도가 동일하다는 가정이므로 거의 맞지 않습니다. 역사적 데이터(보통 회귀)를 통해 비율을 추정하면 롱/숏 페어의 균형을 제대로 맞출 수 있어, 스프레드가 단순한 가격 수준의 산물이 아니라 진정한 상대가치 신호를 반영합니다.
거래 비용은 통계적 차익거래 전략에 어떤 영향을 미치나요?
매우 큽니다. stat arb는 z-점수가 임계값을 넘나들 때 빈번히 거래하므로, 스프레드(호가 차), 커미션, 슬리피지가 빠르게 누적됩니다. 백테스트상 수익성이 있어 보이는 전략도 현실적 비용을 적용하면 손실로 바뀌기 쉽습니다. 백테스트 전략이 실전에 살아남지 못하는 가장 흔한 이유 중 하나입니다.
"퀀트 퀘이크"란 무엇이며 통계적 차익거래와 어떤 관련이 있나요?
2007년 8월, 유사한 주식 stat arb 전략을 운용하던 다수의 퀀트 헤지펀드가 동시에 큰 손실을 겪었습니다. 일부 펀드가 환매 대응을 위해 포지션을 매도하자, 동일 전략을 운용하던 다른 펀드들의 가격이 불리하게 움직이며 연쇄 반응이 촉발되었습니다. 이는 과밀 거래 위험의 대표적 사례로, 너무 많은 참여자가 같은 전략을 운용할 때 서로의 행동에 노출된다는 점을 보여줍니다.
개인 투자자도 현실적으로 통계적 차익거래 전략을 운용할 수 있나요?
실제로는 어렵습니다. 기관의 stat arb는 낮은 거래 비용, 직접 시장 접근, 빠른 실행, 강력한 리스크 관리 인프라의 이점을 누립니다. 개인 투자자는 더 높은 비용, 느린 실행, 공매도 제약에 직면합니다. 그럼에도 개념적 틀(공적분, 평균회귀, 스프레드 구성)은 충분히 배울 가치가 있으며, 특히 퀀트 펀드의 작동 방식을 이해하고자 할 때 큰 도움이 됩니다.
