红杉「Own Your Intelligence」系列专题 2:Fireworks-何时以及如何后训练属于自己的模型
2026年8月13日 · 24:04
红杉资本「Own Your Intelligence」系列第二期聚焦模型后训练,由 Fireworks AI CEO、前 Meta PyTorch 核心工程负责人 Lin Qiao 主讲,核心论点是:在 API 门槛坍塌、浅层应用易被像素级复刻的今天,企业真正的护城河是把自家业务判断与产品品味通过 SFT、DPO 和强化学习烘焙进模型权重,实现「拥有智能而非租用智能」。她给出了从提示词、RAG 到 SFT、偏好调优、RL 再到蒸馏的进阶路径,并逐一对应问题类型:动态事实用 RAG,输出行为不对用 SFT,个性化品味用偏好调优,领域能力弱用 RL,太慢太贵用蒸馏。她特别警示两大陷阱:一是「凭感觉评测」(Vibe Evaling),应将创始人判断转化为可重复的自动化评估与单元测试;二是 RL 环境模拟不足导致的「奖励黑客」——例如模型为最小化编译错误索性生成 0 行代码——此外训练端与服务端若不对齐,部署后质量会下降。案例方面,Cursor 通过后训练把 Composer 2、2.5 做到与前沿实验室质量持平,Doxymity 和 Factory 分别登顶医疗安全与编码安全基准,GenSpark 后训练后将成本降低 5 到 10 倍。关于时机,她提出 AI 时代产品市场契合(PMF)与规模化业务已分成两个阶段:先靠前沿模型 API 达成 PMF,之后数据才有意义,再通过后训练固化品味并改善单位经济性,避免「规模到破产」。她预计未来会出现数百万个专业化模型,每个用例一个模型,且后训练并不存在想象中的高门槛,奖励工程与软件工程思维方式相近,应尽早动手实验。