上周五到周日实验复盘:新 200 因子的模型路线收敛

时间范围:2026-07-03 至 2026-07-05;口径:严格 test.global_uic;生成日期:2026-07-06

结论 这三天的主线不是随机调参,而是在回答一个问题:新 200 因子为什么 MLP 强、GRU 弱,以及后续应该用什么模型继续提高上限。

证据 三天内统计到 336 个有限严格 test 结果,另有 16 个 nonfinite/NaN,主要来自 GRU+MLP residual 结构。

最终判断 新 200 因子主要是端点/极短历史信号;长 GRU 不适合;当前最优路线是 SwiGLU Transformer + sl4

一、研究地图

主线我想验证什么最后答案
数据/infra新 200 因子能不能全量训练,不再受采样和 shm 限制完成 full bundle 可用
MLP vs GRU是因子不好,还是 GRU 用法不好结论 MLP 0.3233,因子不坏;GRU sl68 只有 0.2958
GRU 排查GRU 是因为窗口、epoch、lr、gate 出问题吗边界 短 GRU 最好约 0.316,仍追不上 MLP/Transformer
Transformer 初探Transformer 能不能比 GRU 更适合新因子结论 plain sl8 到 0.3265
短窗口系统搜索历史到底该看多长结论 sl3/sl4 最强,sl6+ 开始不稳
followup2把短窗口结论做严谨复验结论 SwiGLU sl4 最好 0.331765654

二、三天时间线

周五 2026-07-03 构建 full 200 因子缓存;复刻旧 GRU;跑 MLP baseline;开始 GRU window 和 Transformer matrix。
周六 2026-07-04 集中排查 GRU:短窗口、训练长度、gate、residual;同时用 longgrid 验证 Transformer 是否更强。
周日 2026-07-05 把主线切到短窗口 Transformer,系统搜索 sl3/sl4/sl5/sl6/sl8,并确认 SwiGLU sl4 是当前最强方向。

三、周五:确认问题不是因子坏

实验为什么做怎么做结果结论
full 200 因子 bundle摆脱 sampled/dropout 数据限制构建 full train/val/test bundle后续实验都能复用完成 infra 可用
MLP baseline如果 MLP 也差,说明因子坏端点 MLP,seq_len=10.323299994结论 因子本身强
old GRU replay看旧 GRU 方法能否迁移plain GRU,sl68均值 0.295755,最好 0.300526失败 长 GRU 不适合
TTA smoke探索测试期统计量重校准120 因子 smokesmoke 出现 0.3919待验证 口径不同,不能直接当结论
阶段结论 新 200 因子没问题,主要问题是旧 GRU 长历史结构不适配。

四、周五到周六:排查 GRU 为什么弱

实验组验证假设具体做法最好 test UIC结论
GRU window matrixsl68 是否太长sl10/sl20,连续/隔步0.314111部分有效 缩短窗口有帮助
GRU followupepoch 是否不够sl1/sl2/sl10/sl20/sl40/sl80,4/16 epoch0.316190不足 仍追不上 MLP
GRU autofillgate/lr 是否能救gate on/off,lr 对照0.316273边界 短 GRU 上限约 0.316
trainlength controls长训练是否能救16 epoch,lr 对照0.315982否定 不是训练不够
sanity controls是否链路坏了gate off、1 layer、meanpool0.314865排除 链路基本没坏
GRU+MLP residualMLP 端点 + GRU 历史残差是否更好residual/gate fusion多组 NaN风险 结构不稳定
阶段结论 GRU 弱不是因为少调了一点参数,而是新 200 因子的有效信息更偏端点/极短历史,长历史会引入噪声。

五、周五到周六:转向 Transformer

实验组为什么做怎么做结果结论
Transformer matrix看 Transformer 是否比 GRU 更适合plain/SwiGLU/conv/rope,sl10/sl20/sl32/sl51/sl68plain sl10 最好 0.319816有希望 比 GRU 好,但窗口仍偏长
longgrid放大搜索,验证 Transformer 上限plain sl8/sl10/sl12,SwiGLU sl10/sl20plain sl8 0.326492;SwiGLU sl10 0.325583结论 Transformer 是正确方向
longgrid GRU 对照防止误判同时跑 GRU sl2/sl3/sl5/sl8/sl10GRU sl2/sl3 约 0.31排除 GRU 继续落后
阶段结论 模型主线从 GRU 转向 Transformer;接下来的核心问题变成窗口到底应该多短。

六、周六到周日:followup1,确认短窗口方向

实验组目的具体做法最好 test UIC结论
plain first sweep找 plain Transformer 窗口sl4/sl8/sl10/sl120.329746854结论 sl4 明显强
SwiGLU first sweep看门控 FFN 是否有用SwiGLU sl8/sl10/sl120.327406832待优化 结构好,但窗口偏长
followup1 extra补 sl6/sl8 小范围plain/SwiGLU 补跑0.329089225支持 短窗口继续占优
GRU 对照保留反证GRU sl1/sl2/fusion0.316493350排除 不作为主线

七、周日:followup2,系统短窗口搜索

实验组验证什么具体做法n平均 test UIC最好结论
sl4_lr_confirmplain sl4 是否稳定plain sl4,多 lr、多 seed24约 0.32910.330971结论 sl4 是稳定强基线
short_archlast-row/pooling/宽度是否有帮助plain sl4/sl5/sl6,lastrow/attn/d160/d22424约 0.324-0.3290.331208结论 last-row 有价值
window_edgesl3/sl5/sl6/sl7 边界plain 多窗口24被 sl6 拉低0.331263结论 sl3/sl4 强,sl6+ 不稳
swiglu_shortSwiGLU 短窗口是否最强SwiGLU sl4/sl6/sl8,h192/h224/h25624约 0.32920.331766结论 当前最强路线

周日最强结果

排名内容test UIC
1SwiGLU Transformer,sl4,h192,attn,lr=1.8e-40.331765654
2SwiGLU Transformer,sl4,h224,last,lr=1.5e-40.331390838
3plain Transformer,sl3,lr=2.5e-40.331262597
4plain Transformer,sl4,last-row fusion,lr=2.2e-40.331207812
5SwiGLU Transformer,sl4,h224,last,lr=1.5e-40.331059444

八、最终复盘

我在做的事情 这三天是在把模型路线从“旧 GRU 复刻”一步步推理到“短窗口 SwiGLU Transformer”。

已经证明 新 200 因子强,MLP 能到 0.3233;Transformer 能进一步到 0.3318

已经排除 长 GRU、sl68、GRU+MLP residual、sl6+ 长窗口,都不是当前主线。

还需验证 TTA/验证集统计量重校准可能有价值,但之前 smoke 口径不够严谨,不能作为主结论。

下一步 继续围绕 SwiGLU Transformer + sl4 + h192/h224 + lr=1.5e-4/1.8e-4 + dropout=0.05/0.08 + last/attn pooling 做多 seed 复验,把稳定均值最高的配置定为新 200 因子的主力模型。