先量噪声底,再解释分数
同提示词、同模型连跑两次,F1 波动 0.0125,33 条里只有 24 条预测相同。
由此定下判据:1.3 个点以内的差异不作结论。
从一个垂类任务,到一套能证伪自己的评测
把「大模型能做的任务」交给一个能内嵌进产品的小模型。先建可信的度量,再谈训练收益—— 因为看不到噪声底,任何提升都只是感觉。
数据已整理完成,但发现科普不只是写作——它牵扯资料调研,以及对结论与规律本身的判断, 已超出一次 SFT 能承担的范围。
几十万字文本,30 步 QLoRA 冒烟流程完整跑通、适配器已保存。 但没有客观评测标准,只能靠人盯着看,训练无法自我迭代。
最终只取全流程最后一环:把已经写好的答案正文划成「必答关键词 / 补充语境」。 任务清晰、可量化、数据可获取,且能直接回灌到自己的产品。
这次收敛的标准不是「哪个任务更有意思」,而是「哪个任务能被客观度量,并且我真的会用」。