在 AI智识录 中提及的产品。

红杉「Own Your Intelligence」系列专题 3:Mercor-在强化学习环境里究竟有什么
2026年8月13日 · 23:02
红杉资本「Own Your Intelligence」系列专题第三期由 Mercor CEO Brendan Foody 拆解强化学习(RL)环境的底层细节,核心观点是:RL 环境由三要素构成——业务上下文(世界)、热门软件的高保真克隆(应用)、提示词与专家评分(任务与验证器),而人类专家在衡量模型能力前沿上不可替代。Foody 回顾数据市场从 2020 年低技能众包行为克隆到 2024 年智能体数据的转型,Mercor 借 Deep Research 项目成为 Harvey、Cognition、RAMP 等头部实验室与应用公司最主要的智能体数据供应商。他以法律场景为例说明环境构建:顶尖律所律师撰写真实项目大纲,填入数据室并渲染进 Google Workspace 克隆,再生成轨迹与评分细则,防止模型「奖励黑客」作弊。在 Apex Agents 的 1800 个任务上以约 50 万美元算力对 GLM47 做后训练,公司法成绩从 4.7% 升至 26.6%,且能泛化到其他基准。他介绍三种数据合作模式:按任务定制(每任务最高 2000 美元)、现成数据集与按小时提供专家,定价区间从 50 美元到 1 万美元。他预测评测将走向百小时级超长视野任务与虚拟同事的社交协作能力,因为工作中约 60%-70% 的任务需要人际互动,而现有评测仅约 1% 考察这一点。

理查德·萨顿 WAIC 思想者论坛主题分享:强化学习的第一线—从经验培育超级智能
2026年7月19日 · 48:07
本期收录2024年图灵奖得主、现代强化学习奠基人理查德·萨顿(Richard Sutton)在2026年WAIC思想者论坛的主题演讲《强化学习的第一线:从经验培育超级智能》。萨顿重申“苦涩的教训”——短期把人类知识塞进AI总有成效,但长期突破永远来自计算规模、搜索与学习,主张让超级智能像婴儿一样从观察、动作与奖励信号构成的经验中自主生长,而非依赖人类预编码的知识。他系统提出OAK架构(选项与知识):智能体为每个奖励尊重的状态特征创建“特征达成子问题”,解决子问题产生选项(策略加终止决策),再为选项学习转移模型并用价值迭代实现规划,从而形成“新特征—新子问题—新选项”的开放式抽象循环;他强调所有知识都只是对大世界的极度近似,学习、规划与抽象必须在运行时间发生,而深度持续学习仍是最大瓶颈,还需以生成式测试而非梯度下降做元学习。在问答环节,他预测2030年有四分之一、2040年有二分之一的概率深层理解智能;直言大语言模型已有局限、其他方法有空间,并称自己与Yann LeCun的JEPA是“兄弟”,分歧交由时间验证;他主张AI应像婴儿一样拥有自己的目标和奖励信号而非讨好人类评分,认为人类不应随意决定AI生死,AI为善应包括所有智能存在。

【彩蛋】这是一期主播的个人自述😄
2026年3月23日 · 37:31
主播Ray在《AI智识录》开播近半年、做了近60期节目后首次以真人声音出镜,讲述做播客的初衷与心路历程,并为自己的创业产品YouNavi做推广。Ray曾任百度、蚂蚁金服、滴滴的产品经理,并在新势力车企负责企业AI平台,现全职创业。他回顾播客两个阶段:第一阶段精讲经典文献,如Richard Sutton的《苦涩的教训》、LeCun的蛋糕比喻、Sarah Hawker的硬件彩票、姚顺雨的《下半场》与ReAct、CoT、MoE、Scaling Law等;第二阶段引入李飞飞、吴恩达等时效性访谈,其中智谱AGI Next闭门峰会圆桌(林俊扬、姚顺雨、唐杰等)成为唯一播放量破万的一期。他坦言坚持逐字还原原文而非AI双人对谈,以避免AI注意力机制漏掉高价值细节,未来将让文稿更口语化、内容更多元。节目后半段附上他在十字路口开放麦的10分钟现场音频,分享OpenClaw对Agent应用创业的启发:不应只做套壳或让Agent干批量生成小红书、PPT等“杂活”,而要把SOTA模型的智能用在分析与决策上。YouNavi可一键整合腾讯会议、飞书、钉钉及录音卡的上下文与本地文件夹,以agentic文档检索做周报、路演复盘等决策分析,邀请码为wizlog,官网younavi.me。

腾讯姚顺雨、Qwen林俊旸、智谱唐杰的AGI-Next圆桌对话, 2026
2026年1月12日 · 1:15:01
腾讯姚顺雨、阿里千问(Qwen)林俊旸、智谱唐杰与杨强在AGI-Next闭门峰会圆桌中,围绕AI模型公司的分化、下一个范式、Agent战略与中国AI的胜算展开讨论。姚顺雨认为to C与to B已明显分化:to B场景智能越高生产力越高,用户愿为Opus这类最强模型付溢价,而to C的bottleneck不是更强的模型而是额外的context与环境,腾讯因此聚焦把微信聊天记录等真实场景数据用好;他判断OpenAI仍最可能率先立起新范式,但创新基因已被商业化削弱,并指出自主学习已在发生,更像渐变而非突变。林俊旸称分化是自然形成,主张"模型及产品",认为RL compute尚未scale充分,AI训AI很快实现,个性化与主动学习是关键方向,而evaluation怎么做是最大技术挑战,并给"三到五年后全球最领先AI公司是中国团队"打出below 20%的概率,同时提出穷则生变、软硬结合是中国机会。唐杰复盘智谱在DeepSeek终结上一仗后把所有精力押注coding的决策,提出用"intelligence efficiency"衡量获得智能的效率,预测2026年必现新范式,并给出Agent成功的三个维度:价值、cost与时间窗。杨强强调学术界应补上工业界没解决的基础问题(智能上界、持续学习、睡眠式清理噪音),描绘Agent从人定目标到模型内生的四阶段,看好联邦学习与通用大模型协作,并认为中国to C会百花齐放、to B可借鉴Palantir的本体加FDE方法论。
由 PodHood 提供支持