上周五到周日实验复盘:新 200 因子的模型路线收敛
时间范围:2026-07-03 至 2026-07-05;口径:严格
test.global_uic;生成日期:2026-07-06结论 这三天的主线不是随机调参,而是在回答一个问题:新 200 因子为什么 MLP 强、GRU 弱,以及后续应该用什么模型继续提高上限。
证据 三天内统计到 336 个有限严格 test 结果,另有 16 个 nonfinite/NaN,主要来自 GRU+MLP residual 结构。
最终判断 新 200 因子主要是端点/极短历史信号;长 GRU 不适合;当前最优路线是 SwiGLU Transformer + sl4。
一、研究地图
| 主线 | 我想验证什么 | 最后答案 |
|---|---|---|
| 数据/infra | 新 200 因子能不能全量训练,不再受采样和 shm 限制 | 完成 full bundle 可用 |
| MLP vs GRU | 是因子不好,还是 GRU 用法不好 | 结论 MLP 0.3233,因子不坏;GRU sl68 只有 0.2958 |
| GRU 排查 | GRU 是因为窗口、epoch、lr、gate 出问题吗 | 边界 短 GRU 最好约 0.316,仍追不上 MLP/Transformer |
| Transformer 初探 | Transformer 能不能比 GRU 更适合新因子 | 结论 plain sl8 到 0.3265 |
| 短窗口系统搜索 | 历史到底该看多长 | 结论 sl3/sl4 最强,sl6+ 开始不稳 |
| followup2 | 把短窗口结论做严谨复验 | 结论 SwiGLU sl4 最好 0.331765654 |
二、三天时间线
周五 2026-07-03
构建 full 200 因子缓存;复刻旧 GRU;跑 MLP baseline;开始 GRU window 和 Transformer matrix。
周六 2026-07-04
集中排查 GRU:短窗口、训练长度、gate、residual;同时用 longgrid 验证 Transformer 是否更强。
周日 2026-07-05
把主线切到短窗口 Transformer,系统搜索 sl3/sl4/sl5/sl6/sl8,并确认 SwiGLU sl4 是当前最强方向。
三、周五:确认问题不是因子坏
| 实验 | 为什么做 | 怎么做 | 结果 | 结论 |
|---|---|---|---|---|
| full 200 因子 bundle | 摆脱 sampled/dropout 数据限制 | 构建 full train/val/test bundle | 后续实验都能复用 | 完成 infra 可用 |
| MLP baseline | 如果 MLP 也差,说明因子坏 | 端点 MLP,seq_len=1 | 0.323299994 | 结论 因子本身强 |
| old GRU replay | 看旧 GRU 方法能否迁移 | plain GRU,sl68 | 均值 0.295755,最好 0.300526 | 失败 长 GRU 不适合 |
| TTA smoke | 探索测试期统计量重校准 | 120 因子 smoke | smoke 出现 0.3919 | 待验证 口径不同,不能直接当结论 |
阶段结论 新 200 因子没问题,主要问题是旧 GRU 长历史结构不适配。
四、周五到周六:排查 GRU 为什么弱
| 实验组 | 验证假设 | 具体做法 | 最好 test UIC | 结论 |
|---|---|---|---|---|
| GRU window matrix | sl68 是否太长 | sl10/sl20,连续/隔步 | 0.314111 | 部分有效 缩短窗口有帮助 |
| GRU followup | epoch 是否不够 | sl1/sl2/sl10/sl20/sl40/sl80,4/16 epoch | 0.316190 | 不足 仍追不上 MLP |
| GRU autofill | gate/lr 是否能救 | gate on/off,lr 对照 | 0.316273 | 边界 短 GRU 上限约 0.316 |
| trainlength controls | 长训练是否能救 | 16 epoch,lr 对照 | 0.315982 | 否定 不是训练不够 |
| sanity controls | 是否链路坏了 | gate off、1 layer、meanpool | 0.314865 | 排除 链路基本没坏 |
| GRU+MLP residual | MLP 端点 + GRU 历史残差是否更好 | residual/gate fusion | 多组 NaN | 风险 结构不稳定 |
阶段结论 GRU 弱不是因为少调了一点参数,而是新 200 因子的有效信息更偏端点/极短历史,长历史会引入噪声。
五、周五到周六:转向 Transformer
| 实验组 | 为什么做 | 怎么做 | 结果 | 结论 |
|---|---|---|---|---|
| Transformer matrix | 看 Transformer 是否比 GRU 更适合 | plain/SwiGLU/conv/rope,sl10/sl20/sl32/sl51/sl68 | plain sl10 最好 0.319816 | 有希望 比 GRU 好,但窗口仍偏长 |
| longgrid | 放大搜索,验证 Transformer 上限 | plain sl8/sl10/sl12,SwiGLU sl10/sl20 | plain sl8 0.326492;SwiGLU sl10 0.325583 | 结论 Transformer 是正确方向 |
| longgrid GRU 对照 | 防止误判 | 同时跑 GRU sl2/sl3/sl5/sl8/sl10 | GRU sl2/sl3 约 0.31 | 排除 GRU 继续落后 |
阶段结论 模型主线从 GRU 转向 Transformer;接下来的核心问题变成窗口到底应该多短。
六、周六到周日:followup1,确认短窗口方向
| 实验组 | 目的 | 具体做法 | 最好 test UIC | 结论 |
|---|---|---|---|---|
| plain first sweep | 找 plain Transformer 窗口 | sl4/sl8/sl10/sl12 | 0.329746854 | 结论 sl4 明显强 |
| SwiGLU first sweep | 看门控 FFN 是否有用 | SwiGLU sl8/sl10/sl12 | 0.327406832 | 待优化 结构好,但窗口偏长 |
| followup1 extra | 补 sl6/sl8 小范围 | plain/SwiGLU 补跑 | 0.329089225 | 支持 短窗口继续占优 |
| GRU 对照 | 保留反证 | GRU sl1/sl2/fusion | 0.316493350 | 排除 不作为主线 |
七、周日:followup2,系统短窗口搜索
| 实验组 | 验证什么 | 具体做法 | n | 平均 test UIC | 最好 | 结论 |
|---|---|---|---|---|---|---|
| sl4_lr_confirm | plain sl4 是否稳定 | plain sl4,多 lr、多 seed | 24 | 约 0.3291 | 0.330971 | 结论 sl4 是稳定强基线 |
| short_arch | last-row/pooling/宽度是否有帮助 | plain sl4/sl5/sl6,lastrow/attn/d160/d224 | 24 | 约 0.324-0.329 | 0.331208 | 结论 last-row 有价值 |
| window_edge | sl3/sl5/sl6/sl7 边界 | plain 多窗口 | 24 | 被 sl6 拉低 | 0.331263 | 结论 sl3/sl4 强,sl6+ 不稳 |
| swiglu_short | SwiGLU 短窗口是否最强 | SwiGLU sl4/sl6/sl8,h192/h224/h256 | 24 | 约 0.3292 | 0.331766 | 结论 当前最强路线 |
周日最强结果
| 排名 | 内容 | test UIC |
|---|---|---|
| 1 | SwiGLU Transformer,sl4,h192,attn,lr=1.8e-4 | 0.331765654 |
| 2 | SwiGLU Transformer,sl4,h224,last,lr=1.5e-4 | 0.331390838 |
| 3 | plain Transformer,sl3,lr=2.5e-4 | 0.331262597 |
| 4 | plain Transformer,sl4,last-row fusion,lr=2.2e-4 | 0.331207812 |
| 5 | SwiGLU Transformer,sl4,h224,last,lr=1.5e-4 | 0.331059444 |
八、最终复盘
我在做的事情 这三天是在把模型路线从“旧 GRU 复刻”一步步推理到“短窗口 SwiGLU Transformer”。
已经证明 新 200 因子强,MLP 能到 0.3233;Transformer 能进一步到 0.3318。
已经排除 长 GRU、sl68、GRU+MLP residual、sl6+ 长窗口,都不是当前主线。
还需验证 TTA/验证集统计量重校准可能有价值,但之前 smoke 口径不够严谨,不能作为主结论。
下一步 继续围绕 SwiGLU Transformer + sl4 + h192/h224 + lr=1.5e-4/1.8e-4 + dropout=0.05/0.08 + last/attn pooling 做多 seed 复验,把稳定均值最高的配置定为新 200 因子的主力模型。