但这一步,往往是悬崖。
问题并不是 Transformer 能不能用于金融数据。它当然可以,市场上也确实有不少研究和工程系统在使用它。真正值得问的是:在样本有限、信号微弱、分布不断变化的金融市场里,Transformer 是否真的比 LSTM 更稳定、更容易复现,并且能在样本外转化为可交易的结果?
如果只看训练损失、单次回测曲线,答案很容易被写成“是”。如果把时间切分、交易成本、随机种子、滚动验证和策略容量都放进实验,答案通常就没有那么漂亮了。
主要判断:模型更大,不等于预测更好
在量化研究的世界里,模型的更迭有一种隐秘的节奏:每当一个新架构在某个公开榜单上冒头,整个社区都会陷入一种“是否被抛下”的悬浮感。这种感觉并不陌生——它几乎是晕轮效应在工程领域的一次复刻。我们在某个权威基准上看到一个亮眼的数字,便倾向于把同样的性能投射到自己的任务上。那个数字悄然成了判断一切的尺度。
但金融时序不是一个普通的预测数据集。这里的目标变量会变化,交易制度会变化,市场参与者也会根据公开规律调整行为。一个模型在固定测试集上找到的关系,可能在真正投入使用前就已经衰减。模型越有表达能力,越容易把短暂的相关性、数据处理中的细节,甚至切分方式造成的泄漏一起学进去。
因此,Transformer 与 LSTM 的比较,不能只回答“谁的指标更高”。至少要同时回答以下几个问题:
- 预测目标是绝对价格、收益率、价格差分,还是涨跌方向?
- 训练样本是否足以支撑更大的参数空间?
- 测试过程是否严格按照时间顺序进行?
- 模型的优势能否覆盖手续费、滑点和换手成本?
- 不同随机种子、不同时间窗口下,结果是否仍然接近?
- 当市场状态发生变化时,模型是否还有足够的稳定性?
如果这些问题没有被处理,所谓“Transformer 优于 LSTM”,很可能只是在特定数据切分上的结论,而不是一条可以迁移到交易系统的规律。
金融数据的“性格”:它为什么不配合架构
把 Transformer 搬进金融时序预测之前,有必要先理解金融数据本身的脾气。它不像电力消耗、交通流量那样具有相对清晰的周期,也不像语音信号那样藏有稳定的局部结构。它更像一阵风:你抓得到它的影子,却抓不到它始终不变的实体。
金融时间序列最显著的特征,是高噪声、非平稳与低信噪比叠加在一起。价格曲线里混杂着随机游走成分,宏观政策、突发事件、资金流向和交易者情绪层层作用,数值可以在很短时间内发生变化,但其中真正可重复利用的预测信号往往极其稀薄。
这会直接改变模型比较的逻辑。
在许多自然语言任务中,长距离依赖是非常重要的。句子前部的一个词,可能要到很远的位置才会完成语义。自注意力机制可以让模型同时查看多个位置,并为不同位置分配不同权重,这是 Transformer 的优势之一。
金融数据却不一定如此。一个较早的价格波动,未必会在很久之后留下稳定影响;一个遥远时间点的成交量,也未必比最近几个时间点更有预测价值。金融序列里的信息可能分散在局部波动、盘口变化、成交节奏和跨品种关系之中,而且其中相当一部分波动根本没有可利用的“语义”。
这意味着,金融预测需要的常常不是更宽的视野,而是更稳的过滤。
在金融时序里,复杂从来不是勋章,而是代价。
还有一个容易被忽略的问题:金融数据的样本数量并不等于样本信息量。即使拥有很长的历史行情,把相邻时间点切成大量训练窗口,也不能简单地认为得到了同等数量的独立样本。相邻窗口之间高度重叠,市场状态还可能长期处于相似环境。表面上数据很多,真正能够支撑模型泛化的有效信息却可能很少。
Transformer 擅长从大量样本中学习复杂关系,但金融场景经常给它的是另一种处境:特征不少,窗口不少,真正稳定的规律却不多。这正是大模型在回测中表现出色、上线后迅速失去优势的常见背景。
Transformer 的优势,究竟发生在哪里
Transformer 并不是没有适用场景。它相对于传统循环网络的优势,主要集中在几个方面。
首先是并行计算。LSTM 按照时间顺序处理序列,前一个时刻的隐藏状态会传给下一个时刻,这种递归结构符合时间逻辑,但限制了训练过程中的并行程度。Transformer 则可以在一个窗口内同时处理多个位置,训练阶段更容易利用现代硬件。
其次是长距离关系建模。对于较长的输入窗口,如果较远位置之间确实存在有用关系,自注意力可以直接建立连接,不必像 LSTM 那样依赖隐藏状态逐步传递。多变量金融数据里,如果目标与多个资产、多个时间尺度或多个事件之间存在关系,注意力机制也提供了更灵活的表达方式。
再次是多源数据融合。行情、成交量、盘口、新闻、财报或链上数据的结构并不相同。经过合适的编码后,Transformer 可以把不同来源的特征放入统一的序列框架中,再学习它们之间的交互关系。这类任务往往比单纯预测一条价格序列更能体现 Transformer 的价值。
但这些优势都有前提。
长窗口本身不等于长程依赖。把输入从几十步扩展到几百步,可能只是向模型提供了更多噪声。多源特征也不等于信息增量,重复指标、滞后指标和高度相关的变量会扩大输入维度,却不一定增加可交易信号。更快的并行训练,则不代表最终模型更容易部署,因为训练速度、推理延迟、显存占用和维护成本是不同的工程问题。
判断 Transformer 是否有价值,不能停留在架构的理论能力上,而要看它是否在目标任务中产生了稳定的增量。
自注意力的代价:复杂度、参数量与过拟合
抛开架构的浪漫叙事,还是得回到工程现实。标准 Transformer 的自注意力机制,其计算复杂度通常写作 O(L²),其中 L 是序列长度。序列长度增加时,注意力矩阵的计算和存储成本会明显上升。对于分钟级金融数据,如果回看窗口很长,训练时的显存压力、批次大小和实验速度都会受到影响。
这并不意味着 O(L²) 在所有任务里都不可接受。较短窗口、较小模型或经过优化的实现,完全可能满足研究需求。真正的问题是,很多实验会在输入窗口不够长时抱怨模型看不到长期信息,随后简单地把窗口扩大,却没有重新评估有效样本数、参数规模和过拟合风险。
复杂度之外,还有参数量问题。
金融数据的历史记录可以被保存很久,但市场规律并不会因为数据被保存下来就自动变得稳定。一个模型能够在训练集上拟合价格路径,并不说明它学到了未来可复用的机制。Transformer 的表达能力越强,越有可能识别出训练区间中的偶然组合关系。它可能学到某段行情的波动节奏,也可能把特定时期的成交结构当成普遍规律。
回测中的“漂亮”,经常来自以下几种因素叠加:
1. 训练集、验证集和测试集之间存在时间上的信息污染,尤其是经过滑动窗口切分后,相邻样本高度重叠。
2. 特征标准化或归一化使用了全量数据,未来区间的统计信息被提前带入训练过程。
3. 超参数根据测试区间反复调整,测试集实际上被当成了验证集。
4. 预测指标没有扣除交易成本,模型只是在预测层面略有优势,策略层面却无法覆盖换手。
5. 只展示表现最好的随机种子或时间段,忽略了实验结果的分散程度。
这些问题与模型类型无关,但复杂模型通常更容易放大它们的影响。
标准 Transformer 对位置编码、初始化方式和随机种子也可能比较敏感。自然语言任务中,大规模预训练和海量数据可以在一定程度上缓解这种不稳定;金融场景则往往缺少同等规模的通用预训练语料,模型需要在规模有限、分布变化明显的数据上直接学习。此时,同一份代码换一个随机种子,或者略微改变训练窗口,回测曲线就可能出现明显差异。
如果模型的优势只能在某一次训练中出现,而不能在多次重复实验和多个时间区间中复现,那么它更像是实验偶然性,而不是架构优势。
LSTM 为什么仍然有竞争力
LSTM 的优势并不在于它“更先进”,而在于它的结构限制有时反而适合金融数据。
LSTM 通过门控机制控制历史信息的保留和遗忘。它按照时间顺序读取输入,不会同时把整个窗口中的所有位置都暴露给相同程度的自由组合。对于噪声很强、局部变化比远距离关系更重要的序列,这种逐步积累的方式可能更稳健。
尤其是在收益率、价格差分或方向预测任务中,LSTM 往往是一个很难绕开的基线。它的模型规模相对容易控制,训练和推理成本较低,结果也更容易进行滚动验证。对于需要快速迭代的研究团队,一个可靠的 LSTM 基线不仅能提供性能参照,还能帮助判断新模型到底贡献了什么。
在针对高频限价订单簿数据的电子交易研究中,研究者曾比较 Transformer 与 LSTM 家族在不同预测任务上的表现。一个值得注意的现象是:Transformer 在预测绝对价格序列时可能展现出有限的边际优势;但当任务转向价格差分序列或走势方向预测时,LSTM 模型反而可能表现得更稳健,也更容易复现。
这里的关键不是“LSTM 永远更好”,而是预测目标改变后,模型所面对的问题也改变了。绝对价格通常带有较强的水平信息和趋势背景,长窗口可能帮助模型捕捉某些关系;差分和方向预测则更接近短期变化,噪声比例更高,模型的过滤能力和稳定性更加重要。
LSTM 的“慢半拍”在这种场景下未必是缺点。它没有一眼查看整个窗口,而是让信息沿时间方向逐步传递。对于真正有价值的局部结构,这种处理方式可能已经足够;对于纯噪声,它也不必为每一个位置建立过于灵活的关联。
| 比较维度 | 标准 Transformer | LSTM |
|---|---|---|
| 绝对价格序列预测 | 可能有有限优势,但依赖数据和切分方式 | 通常可作为稳定基线 |
| 价格差分预测 | 容易受到噪声和过拟合影响 | 对局部变化较稳健 |
| 走势方向预测 | 表达能力强,但需要严格正则化 | 结果通常更容易复现 |
| 长序列处理 | 可以直接建立远距离关系,但注意力成本较高 | 顺序处理,长窗口下可能出现信息衰减 |
| 训练方式 | 更适合并行计算 | 递归结构限制并行程度 |
| 参数规模 | 容易做大,调参空间较宽 | 相对容易控制 |
| 随机种子影响 | 可能较明显 | 通常相对温和,但并非没有影响 |
| 解释与排查 | 注意力权重不能直接等同于因果解释 | 隐状态同样难以完全解释,但结构更直观 |
| 工程部署 | 需要关注显存、延迟与窗口长度 | 轻量版本更容易落地 |
这张表不是要宣判 Transformer 的失败,而是提醒一个常被忽视的事实:在金融时序的若干任务上,LSTM 仍然是值得信赖的起点。把“哪一种更强”换成“哪一种在我的场景里更稳”,答案往往会清晰很多。
实证的诚实:别让单次回测替你做决定
关于时间序列模型的论文,最容易被误读的地方,是指标表格看起来比实验过程更有说服力。某个模型在均方误差、平均绝对误差或方向准确率上领先,并不意味着它一定能生成更好的交易策略。
预测任务与交易任务之间隔着一整条链路。模型输出需要经过信号转换、仓位控制、交易执行和风险约束,最后才会变成净收益。预测误差略有改善,可能并不会带来策略收益改善;相反,方向准确率没有明显提升的模型,也可能因为信号更平滑、换手更低而得到更好的净结果。
因此,Transformer 与 LSTM 的公平比较至少需要保持以下条件一致:
- 输入特征、目标定义和预测周期保持一致;
- 时间切分方式保持一致,不能让一个模型使用更有利的测试区间;
- 归一化、缺失值处理和特征构造都只能使用当时可获得的信息;
- 超参数搜索不能反复窥视最终测试集;
- 评价既要包含预测误差,也要观察换手、回撤、成本敏感性和不同阶段的稳定性;
- 需要重复训练,观察随机种子变化是否会改变结论。
滚动训练和走步验证尤其重要。金融市场的分布并不固定,用一段历史训练、在下一段时间验证,再向前滚动,虽然不能消除不确定性,却比随机打乱样本更接近真实使用环境。对于模型比较,重要的不是某个时间段里谁赢得最多,而是不同市场状态下谁更少出现失控。
还要区分“预测得准”和“交易得动”。一个模型可能在方向指标上略有优势,但信号变化频繁,最终带来很高的换手;另一个模型的预测指标普通,却能输出更稳定的仓位。对实际策略而言,后者并不一定更差。
时间顺序为什么会成为 Transformer 的问题
自注意力机制本身对输入位置具有一定的排列不变性。换句话说,如果没有额外的位置编码或时间结构约束,模型更容易把输入看成一组需要相互比较的元素,而不是一条具有方向性的时间序列。
这在普通集合建模中可能是优点,在金融时序中却需要格外谨慎。价格先上涨后下跌,与先下跌后上涨,统计量可能相近,但交易含义并不相同。一个事件发生在窗口开始位置还是结束位置,也可能决定它是否能够影响预测目标。
因此,Transformer 的位置编码不是装饰。选择绝对位置编码、相对位置编码,还是把时间间隔、交易时段、日期特征等加入输入,都会影响结果。对分钟级数据而言,交易时段、开收盘附近的流动性变化、隔夜间隔和节假日效应,也不一定能够被简单的位置编号充分表达。
这也是为什么不能把自然语言里的 Transformer 配置直接复制到金融数据上。文本中的“位置”与行情中的“时间”不是同一个概念。金融时间轴还包含不规则间隔、停牌、跨日跳跃和不同交易制度等问题。即使输入张量的形状完全一致,模型面对的信息结构也可能完全不同。
有研究指出,在某些长期时序预测基准上,简单线性模型可以击败当时的一些复杂 Transformer 变体。这类结果的价值不在于证明线性模型解决了一切,而在于提醒我们:如果复杂架构没有正确利用时间结构,它增加的表达能力就可能只是在拟合噪声。
PatchTST 与混合架构:给复杂模型留出呼吸空间
针对标准 Transformer 在长序列和金融噪声上的短板,研究者提出了许多改良路径。其中,PatchTST 是比较有代表性的一种思路。
PatchTST 不再把每一个时间点都直接当成独立的注意力位置,而是把长序列切分成若干局部片段,再让模型在片段之间建立关系。例如,一个较长的分钟级窗口可以被划分为多个长度相同的切片。这样做有两个直接收益:一是注意力计算不必在所有原始时间点之间两两展开,计算和显存压力会下降;二是每个切片包含一段局部变化,模型处理的单位不再是孤立的单点噪声。
切片并不是免费午餐。切片长度过短,模型仍然会被高频噪声牵着走;切片长度过长,局部变化可能被平均掉。不同品种、不同采样频率和不同交易目标,适合的切片尺度也不会相同。它需要通过时间滚动验证来选择,而不是照搬论文中的默认设置。
PatchTST 的意义,不是用一个新名字替代标准 Transformer,而是提供了一种更贴近实际的折中:保留注意力对较远片段建立关系的能力,同时限制模型直接处理每一个微小波动的负担。在某些长窗口任务中,这比把标准 Transformer 无限加深或加宽更有工程价值。
另一条路是混合架构。Transformer 擅长捕捉跨时间或跨变量的关系,LSTM 更擅长沿时间顺序积累局部信息,二者并不天然对立。可以让 LSTM 先完成局部动态编码,再交给注意力层处理较高层次的关系;也可以让 Transformer 提取多变量交互,随后用较轻量的循环模块进行时序聚合。
混合架构还包括更传统的堆叠方式,例如用 Transformer 生成特征,再交给树模型或线性模型完成最终预测。这样的组合未必优雅,却可能更容易调试。金融系统最怕的不是模型结构不够漂亮,而是出了问题之后没人能判断问题来自特征、标签、训练过程还是执行层。
不过,混合模型也很容易变成复杂度堆叠。两个模型串在一起,并不代表两个模型的优势会自动相加。每增加一层结构,就增加一组超参数、一种失效模式和一段需要验证的链路。混合架构只有在消融实验中显示出稳定增量时,才值得保留。
Informer、Autoformer 等 Transformer 变体同样需要进行金融场景再校准。它们中的一些设计原本更适合周期明显、趋势相对稳定的时序。金融数据并不总是满足这些假设,强行移植就可能出现“源数据集上领先,目标市场里失灵”的情况。架构名称不会自动携带适用性,任何模型都必须回到具体任务中重新验证。
任何架构移植,都必须经过金融场景的二次校准。
从数据处理开始,而不是从模型名称开始
很多模型比较从网络结构开始,这是顺序上的第一个误区。金融时序实验真正容易出问题的地方,往往发生在模型之前。
首先要明确预测对象。直接预测价格水平,模型可能主要学习到趋势和尺度信息;预测收益率或价格差分,任务会更接近短期变化;预测涨跌方向,则需要重新考虑类别不平衡、阈值和信号转换。不同目标不能只换一个输出层就认为它们是同一问题。
其次要处理时间对齐。输入窗口中的每一列特征,必须确认在预测时点是否已经可获得。新闻发布时间、财报披露时间、盘口快照、收盘价和日内指标,都可能存在细微但关键的时间差。一个看似合理的特征,只要带入了未来信息,模型类型再先进也没有意义。
再次是标准化。金融数据的分布会变化,使用全量数据计算均值和方差,会把未来区间的信息带入过去。更稳妥的做法是让标准化过程与训练窗口绑定,并在滚动过程中重新估计或采用明确的更新规则。这里的工程细节通常没有论文标题醒目,但对回测可信度的影响更大。
标签定义也会改变模型比较结果。例如,未来一个时间点的方向与未来一段区间的方向,不是同一个标签;预测价格变化的大小与预测是否超过交易成本,也不是同一个目标。若标签与实际策略执行之间存在距离,模型指标就很难代表策略价值。
在实践中,值得先固定以下几层,再讨论架构:
- 数据的时间戳和交易日历;
- 训练、验证、测试的滚动方式;
- 输入窗口和预测窗口;
- 目标变量与信号阈值;
- 特征标准化和缺失值处理;
- 交易成本、滑点和持仓约束;
- 重复实验与结果记录方式。
这些步骤听起来不如讨论注意力头数有吸引力,但它们决定了后续比较是否有意义。
选择之前的自问:我们究竟在预测什么
在决定下一次实验应该跑哪个模型之前,也许可以先问自己几个问题。
1. 试图预测的是绝对价格水平,还是价格的变化方向?前者可能更容易从较长窗口中获益,后者通常更依赖局部动态和噪声过滤。
2. 样本规模有多大?如果样本量并不充裕,复杂模型的过拟合风险会被放大。
3. 输入窗口真的包含可利用的远距离信息吗?如果只是为了“让模型看得更远”而扩大窗口,可能同时引入更多噪声。
4. 能承受多大的推理延迟?高频场景里,注意力计算、数据搬运和模型部署都可能成为瓶颈。
5. 对模型稳定性的要求有多高?如果每次重新训练都会改变信号方向,策略层面就很难维护。
6. 对解释性的需求有多大?注意力权重可以帮助排查输入关联,但不能简单等同于因果解释。
7. 目标是对冲风险、套利还是趋势跟随?不同目标对应不同的评价指标,也决定不同模型的相对价值。
8. 模型优势是否足以覆盖交易成本?如果优势只体现在很小的预测误差变化上,落地时很可能被执行摩擦吃掉。
这些问题没有标准答案,但它们会划出边界。当能够清晰地说出“目标是预测短期价格差分,样本量属于中等规模,推理延迟必须较低,策略还要承受较高的换手”时,模型选型就不再是焦虑下的赌注,而是边界内的工程判断。
| 任务特征 | 更值得优先尝试的方向 | 主要原因 |
|---|---|---|
| 长窗口且样本相对充足 | PatchTST 或经过约束的 Transformer | 通过切片降低注意力负担,保留片段间关系 |
| 短窗口、差分或收益率预测 | LSTM 及轻量循环模型 | 对局部变化进行顺序建模,结构相对可控 |
| 多源异构数据 | Transformer 与循环模型的混合 | 处理跨变量关系,同时保留局部时序信息 |
| 强调稳定复现 | LSTM、线性模型和小型树模型作为基线 | 参数更容易控制,结果更便于排查 |
| 极低延迟高频场景 | 轻量 LSTM、线性模型或专门的特征模型 | 降低推理、显存和部署复杂度 |
| 需要不断滚动更新 | 小型模型优先 | 训练速度快,重新校准的成本更低 |
| 市场状态变化明显 | 多模型或状态条件模型 | 避免把单一市场环境当成永久规律 |
表格里的“优先尝试”不是最终结论。真正合理的流程,往往是先用线性模型和 LSTM 建立可复现基线,再加入 Transformer,最后通过消融实验确认新增模块到底带来了什么。
如果 Transformer 只在加入某个特征、某个时间段或某个随机种子时领先,就需要继续追问,而不是立刻扩大模型。相反,如果它在多个滚动区间、多组种子和成本假设下都保持相近的优势,即使优势幅度不大,也可能具有工程价值。
评价指标之外,还要看策略的脆弱点
金融预测模型不能只用一个分数概括。均方误差适合观察数值误差,但可能掩盖方向上的变化;方向准确率看起来直观,却没有体现预测置信度和交易成本;相关系数可以衡量预测与实际变化的关系,却不等于可执行收益。
更值得关注的是结果的形状。
如果模型只在单边趋势行情中有效,到了震荡或快速反转阶段就完全失效,那么它可能学习到的是市场状态,而不是普适的预测关系。如果模型收益来自少数几个极端交易日,也要检查这些日期是否存在数据异常、执行不可得或标签定义上的特殊情况。如果模型换手明显高于基线,任何预测优势都必须经过成本敏感性分析。
还应观察模型输出,而不仅是最终收益。一个成熟的实验会记录预测值的分布、信号变化频率、不同置信度区间的命中情况,以及在不同波动环境下的表现。这样才能看出模型究竟是在大多数时候提供一点稳定帮助,还是偶尔押中几个大行情。
对于 Transformer,尤其要避免把注意力图当成完整解释。注意力权重可以说明模型在某次计算中更关注哪些位置,但它并不能证明这些位置是交易结果的真正原因。金融数据里的变量经常相关,模型可能通过多个替代路径得到相似输出。解释工具的价值在于辅助排查和稳定性分析,而不是替代因果验证。
LSTM 也并非天然可解释。隐藏状态同样难以直接翻译成交易逻辑。它的优势更多体现在结构简单、组件较少、调试路径相对清晰,而不是能够自动告诉研究者“为什么今天要买入”。
一个更稳妥的实验顺序
如果目标是比较 Transformer 和 LSTM,而不是展示某个复杂模型,那么实验顺序最好不要从最大模型开始。
第一步,可以先建立线性模型和简单持久性基线。它们的表现可能并不惊艳,但能告诉我们任务本身是否包含可检测的结构。如果简单方法已经接近复杂模型,那么继续增加层数的理由就需要更加充分。
第二步,使用规模受控的 LSTM。固定输入窗口、目标定义和训练流程,记录多个时间区间的结果。这里的重点不是把 LSTM 调到极致,而是建立一个稳定参照。
第三步,再加入标准 Transformer,并尽量保持参数规模、训练预算和输入信息相近。否则,一个更大的 Transformer 对比一个很小的 LSTM,结果很难说明问题。
第四步,进行消融。去掉位置编码、缩短窗口、减少注意力层、改变切片方式或替换输入特征,观察性能变化。只有这样,才能知道收益来自注意力机制、输入长度、参数数量,还是某个数据处理细节。
第五步,把预测结果放进实际的信号和执行流程中。扣除成本,加入仓位限制,观察不同阈值下的表现。对于量化交易来说,这一步不是附加项,而是模型评价的一部分。
第六步,进行滚动和重复实验。时间序列的测试集不应该被反复用于选择模型。可以保留一段完全不触碰的最终区间,等所有研究决策完成后再进行一次性检验。即使最终区间表现不理想,也比把它反复调成理想结果更诚实。
这种流程不保证找到最强模型,却能减少把偶然性误认为优势的概率。研究的价值不只在于找到一个更高的数字,也在于知道这个数字是否值得相信。
结语:把焦虑放回它的位置
Transformer 并不是金融时序的银弹,但它也不是一无是处。它适合处理某些长窗口、多变量和多源信息任务,也为时序建模提供了新的工具。只是,金融市场并不会因为模型结构更新就变得更可预测。
LSTM 也没有因为 Transformer 的出现而过时。对于短期变化、差分信号、低延迟部署和样本规模有限的任务,它依旧可以是非常有竞争力的选择。更重要的是,它常常是一个足够稳、足够快、足够容易排查的基线。
回到交易的本质,这从来不是一场关于“哪个模型最强”的竞赛,而是一场关于如何与不确定性相处的工程实践。算法选型只是其中一个切面。数据是否干净,标签是否可交易,验证是否严格,成本是否真实,结果能否复现,往往比模型名称更能决定最终结局。
如果一定要给出一个方向,那就是:先用 LSTM 或线性模型建立可信基线,再让 Transformer 证明自己。它需要在相同数据、相同时间切分、相同交易约束和多次重复实验中展现稳定增量,而不是凭借更复杂的结构获得一次漂亮回测。
当我们能够在新架构不断涌现时保持自己的节奏,在切换模型之前先问清楚究竟在预测什么,那么无论最后选择 LSTM、Transformer、PatchTST 还是混合架构,判断都会比“别人都在用”更可靠。
真正值得保留的,不是某个模型的光环,而是一套经得起时间推进和市场变化的研究方法。
