在 AI智识录 中提及的产品。

RSI、AI for AI、AutoResearch 这些概念都在说什么
2026年8月17日 · 13:49
本期节目系统综述模型的“自我进化”(RSI,递归自改进)及同类概念AutoResearch、AI for AI与持续学习,核心主张是:模型自我进化并非凭空的黑科技,而是预训练与架构、后训练与强化学习、推理Infra、Harness四大底层能力叠加到一定程度后的必然结果。节目指出顶级模型总参数已奔向10万亿(如DeepSeek V4 Pro达1.6万亿),但MoE每次推理仅激活3%–5%的参数,如同万人大校只叫最对口的几十位教授,配合混合注意力机制与Muon优化器实现“又大又省”。在落地实例上,田元栋的初创公司Recursive靠AI自动优化GPU算子、在英伟达算子优化竞赛中夺冠并高出第二名专业团队整整10%,Kimi K3也在用早期版本帮自己做算子优化;RSI与“蒸馏”有本质区别——蒸馏像小学生抄大学霸作业永远无法超越,RSI则是模型自己研究自己、形成螺旋上升的闭环。OpenAI计划2026年9月做出AI研究实习生、2028年前实现完全自动化的AI研究员,Anthropic的Agent已独立工作800小时完成开放式AI安全研究,Karpathy也加入了Anthropic。最后节目介绍Ilya Sutskever创办的SSI正打造的TTT(测试时训练)新范式:允许模型在推理阶段实时修改自身参数,可能颠覆现有静态权重范式,带来极致数据效率、真正的长期记忆沉淀与算力Scaling的新维度。

红杉「Own Your Intelligence」系列专题 3:Mercor-在强化学习环境里究竟有什么
2026年8月13日 · 23:02
红杉资本「Own Your Intelligence」系列专题第三期由 Mercor CEO Brendan Foody 拆解强化学习(RL)环境的底层细节,核心观点是:RL 环境由三要素构成——业务上下文(世界)、热门软件的高保真克隆(应用)、提示词与专家评分(任务与验证器),而人类专家在衡量模型能力前沿上不可替代。Foody 回顾数据市场从 2020 年低技能众包行为克隆到 2024 年智能体数据的转型,Mercor 借 Deep Research 项目成为 Harvey、Cognition、RAMP 等头部实验室与应用公司最主要的智能体数据供应商。他以法律场景为例说明环境构建:顶尖律所律师撰写真实项目大纲,填入数据室并渲染进 Google Workspace 克隆,再生成轨迹与评分细则,防止模型「奖励黑客」作弊。在 Apex Agents 的 1800 个任务上以约 50 万美元算力对 GLM47 做后训练,公司法成绩从 4.7% 升至 26.6%,且能泛化到其他基准。他介绍三种数据合作模式:按任务定制(每任务最高 2000 美元)、现成数据集与按小时提供专家,定价区间从 50 美元到 1 万美元。他预测评测将走向百小时级超长视野任务与虚拟同事的社交协作能力,因为工作中约 60%-70% 的任务需要人际互动,而现有评测仅约 1% 考察这一点。
由 PodHood 提供支持