跳至内容

统计套利:量化交易策略如何运作

了解什么是统计套利,量化交易者如何识别临时定价关系,以及配对交易与均值回归等策略在实践中的运作方式。
更新 2026年9月21日  · 9分钟

用 AI 探索

ChatGPTClaudePerplexity

统计套利(stat arb)是一类量化交易策略,利用证券之间的统计关系来识别潜在交易机会。其核心并不是孤立地预测某只股票涨跌,而是识别相对错价:当两只具有历史联系的证券短暂偏离预期关系时,押注它们将重新收敛。

先厘清一点:统计套利并非无风险套利。机会是概率性的,支撑策略的关系也可能完全失效。我在 BlueCrest 管理亚洲区资本市场头寸时就亲眼见过:一笔在纸面上看起来统计上可靠的交易,一旦宏观格局转变,可能瞬间崩塌。

本文将介绍统计套利如何通过配对交易与均值回归发挥作用、为何协整比相关性更重要,以及在实践中真实的风险是什么样子。

什么是统计套利?

统计套利利用历史和实时数据来识别证券之间的统计关系。当这些关系偏离预期状态时,交易员会建立对冲的多空头寸:买入相对被低估的证券,卖空相对被高估的证券,然后等待关系恢复常态。

多/空结构的作用在于降低对大盘波动的敞口。如果市场下跌 5%,两条腿会大致同向受影响,因此盈亏来自两只证券之间的相对变动,而不是市场方向。

统计套利如何运作

一般流程:识别相关证券,建模其历史关系,检测当前价差何时偏离历史常态,建立相互对冲的多空头寸,然后等待收敛或触发退出条件。

一个简单例子:若百事突然较可口可乐出现异常大的折价,且没有明显基本面原因,统计套利策略会买入百事、卖空可口可乐,预期价差回归。利润来自该价差收窄,而非个股朝某一方向单独波动。

配对交易:一个简单的统计套利示例

在上述基本流程下,配对交易是最直观的实践方式。选择两只具有历史关联的证券,构造它们价格之间的价差,当该价差相对历史行为异常偏离时进行交易:买入便宜的一只,卖空贵的一只,若价差收敛则平仓。

值得强调:仅有相关性并不能建立稳定、可交易的关系。两只股票即使高度相关,也仍可能永久性背离。下一节正是讨论这一点。

协整的股票价格

股票 A 与股票 B 的价格(上)及其价差(下),在关键回归点标注了入场与出场信号。图片作者自制。

统计套利中的均值回归

配对交易之所以有效(在其有效的情况下),是因为均值回归:偏离历史均值的价差最终倾向于回归。关键指标是z 分数:(当前价差-移动均值)/ 标准差。z 分数为 +2 表示价差高于历史常态两个标准差,一种不寻常读数,有些策略将其视为做空信号。

z 分数的价值在于标准化信号。与其问“这个价差是否很宽?”,不如问“相对于其通常行为,这个价差是否异常宽?”这才是均值回归策略真正试图回答的问题。

统计套利中的协整与相关性

均值回归给出了交易逻辑,但也引出一个不太舒服的问题:如何判断价差真的会回归,而不是永久性背离?这正是相关性与协整分道扬镳之处。值得重视:

相关性

相关性衡量两个变量之间线性关系的强度。两只股票相关性可达 0.9,却仍是糟糕的配对交易,因为相关性并不说明二者价差是否稳定或具备均值回归特性。

协整

协整描述非平稳时间序列之间的长期均衡关系。若两条价格序列的某个线性组合是平稳的,即围绕稳定均值波动而非漂移,那么它们就是协整的。这才是您真正需要的属性。

两只股票可能多年共同上行,随后永久性分化。高相关、无协整、无可靠交易。使用 Engle-Granger 检验或 Johansen 程序测试协整,可为“价差会回归”的假设提供更可辩护的依据。需要注意的是,PCA在这里是另一回事,本文不展开。

如何构建统计套利策略

理解原理是一回事,把它转化为可运行的策略是另一回事。从直觉走向可落地的量化流程包含五个步骤,跳过任何一步往往会得到纸面漂亮、实盘崩塌的策略。

  1. 从经济逻辑出发:相同板块、共享供应商、类似收入驱动因素。仅依赖历史相关性筛选、而缺乏基本面依据,容易得到伪关系。
  2. 对价差本身做增强型 Dickey-Fuller(ADF)检验。若不平稳,说明在漂移,而非均值回归。
  3. 用对冲比率构造价差,而非简单 1:1 价格假设。通过回归等方法用数据估计对冲比率,以确定两只证券的持仓比例。若估错,配对就不是真正的市场中性。
  4. 围绕 z 分数阈值定义入场与出场规则。在 ±2.0 入场,当价差回归至 0 附近时退出,在 ±3.0 止损。继续越过 ±3 的价差通常意味着关系正在瓦解,而非更好的入场点。最大持仓期同样重要:若在设定窗口内价差未回归,应了结仓位,而不是无限期等待可能永远不来的回归。
  5. 按美元中性进行头寸规模控制,在历史数据上进行包含真实交易成本的回测,并预期实盘表现将低于回测(而非高于)。

统计套利策略如何走向高级化

简单的配对交易只是入门而非天花板。当您熟悉核心机制后,方法通常会向两个方向扩展。

多资产统计套利与因子模型

多资产方法建模的是一篮子证券之间的关系,而非单独的配对。基于因子的办法通过通用的市场或行业因子剥离系统性收益,然后交易剩余的相对错价。PCA 则将这一思路扩展到数百只资产:识别共同波动的主要来源,然后交易那些主成分未能解释的收益。

其底层押注相同(剩余错价会回归),但发现错价的统计框架不同。您不再测试两条时间序列是否协整,而是分解整个截面收益,并押注剩余噪声是暂时的。

机器学习方法

机器学习已被用于关系发现、信号生成与状态识别。它并不会自动提升回报,且会引入自身的模型风险。策略仍然依赖均值回归;机器学习只是寻找同一信号的更复杂方式。

统计套利的风险与限制

更复杂的策略并不能消除底层风险,往往只是让这些风险更难察觉,直到为时已晚。以下是运行任何统计套利策略前值得理解的失效模式。

关系可能失效

支撑您策略的历史关系只是对过去的描述。行业整合、监管变动、公司业务模式转型:任何因素都可能永久性改变这种关系。一旦发生,价差不会回归,而是持续朝不利方向发展。

模型风险与交易成本

每个统计套利策略都建立在统计假设之上。若价差并非真正平稳、对冲比率估计有误、回看窗口选择不当,模型就会产生误导性信号。即便模型正确,交易成本也会以初级回测难以体现的方式侵蚀收益。

看似扣除成本前盈利的策略,扣除后可能即告亏损。在利率类资产中我也见过这种情况:理论交易很干净,实际交易并非如此。

执行摩擦与拥挤交易

做空不是免费的。证券借贷费用与被券商回补的风险都会带来真实成本。模型价与实际成交价之间的滑点在数百笔交易中会不断累积。而当许多基金运行相似策略时,它们会彼此暴露。

2007 年 8 月的量化崩盘正是因为过多权益统计套利基金同时去杠杆,随之而来的连锁反应与这些策略所基于的底层关系无关。

市场状态切换

统计套利模型是针对特定市场环境(波动率状态、利率周期、相关性结构)校准的。一旦环境变化,所有假设将同时移动。

这不是一对配对失效的问题;而是整个投资组合失灵,因为其所依赖的统计属性不再成立。低波动状态下看似平稳的价差动态,一旦波动上升,可能在一夜之间变得不稳定,而历史回看窗口无法提前预警。

回测过拟合

最阴险的风险。参数足够多、历史数据足够长,几乎可以把策略拟合到任意过去时期,但上线后表现会急剧劣化。样本外测试是最低限度的保护,且即便如此也未必足够。

统计套利与相关交易策略的比较

统计套利常与若干相邻策略混为一谈。

统计套利 vs. 传统套利

传统套利利用几乎机械性的价差:同一资产在两家交易所价格不同。若能足够快地执行,利润几近确定。统计套利则押注概率性的收敛,风险画像完全不同。

统计套利 vs. 配对交易

配对交易是统计套利的一种,而非该领域的同义词。两者常被混用,但统计套利涵盖多因子模型、基于 PCA 的策略,以及覆盖大型组合的机器学习方法。配对交易只是多数人的起点。

统计套利 vs. 算法交易

算法交易是更广泛的范畴,指任何自动化执行策略。统计套利是其中的一个具体家族。高频做市与趋势跟随也属于算法交易,但都不是统计套利。

结论

统计套利的本质,是押注关系的延续。您寻找两只历史上同向移动的证券,等待它们分化,并布局于价差收敛。数学将这种直觉形式化,但当数学让您持有而市场让您撤退时,恰恰是这种直觉让您保持诚实。

统计套利真正困难的地方不在统计学,而在于您所交易的关系也在与所有发现相同关系的人竞争。它们有效时会吸引资金。当吸引的资金过多时,它们就会失效,有时是逐渐失效,有时是一瞬间,正如 2007 年所示。

关于统计基础、平稳性检验与时间序列建模,Time Series Analysis in Python 课程是合适的下一步。关于回测与量化工作流,Financial Trading in Python 课程涵盖了策略的实务实现与评估。 


Vinod Chugani's photo
Author
Vinod Chugani
LinkedIn

Vinod Chugani 的职业生涯始于东京,曾任摩根大通最年轻的对冲基金销售台负责人,随后在雷曼兄弟创下个人销售纪录,之后又打造了覆盖 30 个国家的电子分销业务,营收突破 1 亿新元,随后转向数据领域。他毕业于杜克大学经济学专业,亦为 NYC Data Science Academy 校友,并在 100 多名申请者中成为Hugo Bowne-Anderson 在 Maven 开设的 “Building AI Applications” 课程的三位奖学金获得者之一。目前,他为 DataCamp、KDnuggets、Machine Learning Mastery 和 Statology 撰稿,内容涵盖从统计学到代理式 AI 等主题,并在 NYC Data Science Academy 指导数据从业者,已完成超过 1,000 场一对一辅导。

 

FAQs

统计套利真的无风险吗?

不会。尽管名字里有“套利”,统计套利是有真实风险的。传统套利利用的是确定性的价差;统计套利押注的是概率性的收敛。价差被期望基于历史模式而回归,但没有保证。关系会失效,模型可能出错,交易成本也可能抹去表面上的利润。

配对交易与统计套利有什么区别?

配对交易是统计套利的一种具体形式:将两只相关证券相互对冲交易。统计套利是更宽泛的范畴,涵盖多资产篮子策略、因子模型方法,以及覆盖大型投资组合的机器学习信号。配对交易只是最易上手的入口。

为何在配对交易中,协整比相关性更重要?

相关性告诉您两条价格序列是否同向变动;协整则告诉您二者之间是否存在稳定、可均值回归的关系。两只高度相关的股票仍可能永久性背离——这是高相关、无协整,也就意味着没有可交易的价差。协整才是真正支撑“价差会回归”这一假设的依据。

什么是 z 分数?它在统计套利中如何使用?

z 分数衡量当前价差相对于其滚动历史均值相差了多少个标准差。z 分数为 +2 意味着价差异常宽。交易者会设置入场阈值(例如 z 分数超出 ±2)与退出目标(z 分数回到 0 附近)来定义何时开仓和平仓。

什么是对冲比率?为何重要?

对冲比率决定两只证券的相对交易数量。1:1 的比率很少正确,因为它假设两只证券对价格变动的敏感度相同。通常通过回归基于历史数据估计该比率,才能让多空配对保持合理平衡,使价差反映真实的相对价值信号,而非价格水平的假象。

交易成本如何影响统计套利策略?

影响显著。统计套利在 z 分数越过阈值时会频繁交易,因此买卖价差、佣金与滑点会快速累积。一个在回测中看起来有利可图的策略,加入真实成本后很容易变得无利可图。这也是回测策略难以在实盘存活的最常见原因之一。

什么是“量化地震(quant quake)”?它与统计套利有何关系?

2007 年 8 月,许多运行相似权益统计套利策略的量化对冲基金同时遭遇剧烈亏损。当部分基金为满足赎回而抛售头寸时,这种压力将价格推向不利于其他采用相同策略基金的方向,触发连锁反应。这是“拥挤交易风险”的经典案例:当过多参与者运行相同策略时,他们会相互暴露于彼此的行为。

个人投资者能否现实地运行统计套利策略?

实践中并不容易。机构级统计套利受益于低交易成本、直接市场接入、快速执行与完善的风险管理基础设施。散户面临更高成本、更慢执行与卖空限制。尽管如此,其概念框架(协整、均值回归、价差构造)确实值得理解,尤其当您想了解量化基金如何运作时。

主题
数据科学

与 DataCamp 一起学习

Courses

Python 中的金融交易

4小时
21.6K
学习用Python实现自定义交易策略、回测并评估其表现!
查看详情Right Arrow
开始课程
查看更多Right Arrow