AI智识录 中关于 模型评估 的单集。

红杉「Own Your Intelligence」专题 5:LangChain CEO-何时自研 Harness
2026年8月14日 · 23:53
红杉资本「Own Your Intelligence」专题本期邀请 LangChain 联合创始人兼 CEO Harrison Chase 主讲,其核心主张是:智能体由 Harness(编排层)、Model 和 Context 三部分构成,是否自研 Harness 应取决于任务落在模型训练分布之内还是之外。他指出 Harness 的本质只是「LLM 在循环中调用工具」的简单架构,真正定制点在于各阶段插入中间件,如模型调用前对过长上下文自动摘要、包装工具调用做上下文卸载、派发子智能体。判断框架上,通用编码、文件编辑这类分布内任务用 Claude Code、Codex 等现成 Harness 即可,法律、金融等分布外任务须自建编排层;即便整体分布外,LangChain 的 Model Profiles 会按所选模型动态切换编辑文件等分布内动作的实现,因为 OpenAI 与 Anthropic 模型编辑文件的方式差异很大。在评测与可观测性上,他强调智能体出错更多源于进入上下文窗口的信息不对而非模型能力不足,行业正以开源评测运行器 Harbor 定义基准,并借 LangSmith 追踪轨迹、延迟与成本。数据飞轮的闭环是运行智能体、收集轨迹、整理反馈、实验修复:其 LangSmith Engine 在后台用编码智能体分析生产轨迹、建问题看板并自动修改提示词与 Harness 代码,团队还让 Engine 跑 Engine,用 Issue Bench 对比 Codex 与 Claude Code,并把 Codex 写脚本分析轨迹的经验 Codex 化回核心 Harness。他引用 Satya 的观点收尾:私有评测定义组织内部「好」的标准,拥有记忆与轨迹的所有权,AI 投资才能复利增值。

红杉「Own Your Intelligence」系列专题 4:Harvey 如何低成本搭建研究实验室
2026年8月13日 · 27:36
在红杉资本「Own Your Intelligence」系列分享中,法律AI独角兽Harvey联合创始人兼总裁Gabe Pereyra讲解了应用层公司如何在预算内搭建研究实验室:不与前沿实验室拼资金和算力,而是借力前沿生态(Frontier Ecosystem)竞争。面对律所客户极苛刻的保密要求,Harvey无法在真实客户数据上训练,于是让精通AI的顶尖律师——包括Gabe的弟弟Julio——以类似Vibe Coding的方式指导大模型,生成数千万Token级的高保真合成数据,并开源了LegalAgent Bench、合同数据集和尽调数据集,其中最大数据室含8000万Token,尽调集含超1000个用LLM做评委的单元测试。在后训练上,Harvey与Fireworks、Base 10、Trajectory等多家NeoLabs合作,把Kimi 3、GLM等开源基座模型后训练到特定任务可用的前沿水平,并主张在考虑后训练之前就建好覆盖60个国家的评测、监控与模型路由基础设施,让自研、开源、闭源模型走同一套生产流程。他还指出垂直产品的重心正从"赋能个人"转向"组织级AI生产力",帮助律所协调成千上万个客户项目、20到30人的跨所团队与资源分配。Gabe以《点球成金》作结:应用层若用有限预算靠这套打法获胜,就改变了游戏。

红杉「Own Your Intelligence」系列专题 3:Mercor-在强化学习环境里究竟有什么
2026年8月13日 · 23:02
红杉资本「Own Your Intelligence」系列专题第三期由 Mercor CEO Brendan Foody 拆解强化学习(RL)环境的底层细节,核心观点是:RL 环境由三要素构成——业务上下文(世界)、热门软件的高保真克隆(应用)、提示词与专家评分(任务与验证器),而人类专家在衡量模型能力前沿上不可替代。Foody 回顾数据市场从 2020 年低技能众包行为克隆到 2024 年智能体数据的转型,Mercor 借 Deep Research 项目成为 Harvey、Cognition、RAMP 等头部实验室与应用公司最主要的智能体数据供应商。他以法律场景为例说明环境构建:顶尖律所律师撰写真实项目大纲,填入数据室并渲染进 Google Workspace 克隆,再生成轨迹与评分细则,防止模型「奖励黑客」作弊。在 Apex Agents 的 1800 个任务上以约 50 万美元算力对 GLM47 做后训练,公司法成绩从 4.7% 升至 26.6%,且能泛化到其他基准。他介绍三种数据合作模式:按任务定制(每任务最高 2000 美元)、现成数据集与按小时提供专家,定价区间从 50 美元到 1 万美元。他预测评测将走向百小时级超长视野任务与虚拟同事的社交协作能力,因为工作中约 60%-70% 的任务需要人际互动,而现有评测仅约 1% 考察这一点。

汤道生x姚顺雨对谈:腾讯AI下半场
2026年6月5日 · 42:25
腾讯高级执行副总裁汤道生与腾讯首席AI科学家、ReAct架构提出者姚顺雨对谈,主张AI下半场的核心壁垒不再是模型本身,而是寻找值得解决的真实通用问题,以及对原始输入数据、真实用户行为和独家Context(上下文)的掌握。姚顺雨解释他因腾讯的产品矩阵、坦诚文化及'基于Trust而非Metric'的运转方式而加入,提出构建Foundation(基础模型)、产品、Frontier(前沿探索)三足均衡的组织。两人详述'Code Design'实践:反对刷榜、建立基于真实业务的Eval,腾讯曾派后训练最强骨干帮元宝做DeepSeek后训练以换取互信,模型与元宝、ima、WorkBuddy协同产生的聊天、搜索等能力可跨产品泛化反哺。谈及混元三Preview,姚顺雨称大模型没有算法秘密,重点在重建基础设施、丰富数据Taxonomy,将攻坚具备图灵完备性的代码智能体,并认为在中国打造高性价比中小模型的变现价值大于极限跑分提升一两个百分点。汤道生分享AI时代产品从'预设菜单'转向开放式交互,开发转向3-5人扁平小分队、高度容错试错,工程师从写代码转向架构设计与测试对齐。面对'腾讯AI慢了'的质疑,汤道生回应AI是没有尽头的马拉松,腾讯的多业态产品与真实场景将提供长跑底气。
由 PodHood 提供支持