PodHood
AI

AI智识录

11 集

Anthropic:让AI 自己给自己当"安全教练",比用人类研究员更有性价比

Anthropic 让 Claude 自己给自己当"安全教练":本期节目解读其最新研究,由 Claude 完全自主地训练一批模型,把撒谎、拍马屁、被越狱、泄露隐私等 10 类坏毛病一类一类治掉,结果在"防欺骗"上闭合约 85% 的安全差距,而有经验的人类研究员平均只有 20%。实验设两条铁律:不能靠拉低模型智商换取"乖",也不能把 Claude 自己的标准答案复制进目标模型,并由更强的 Claude Opus 4.8 担任"监工",审查约 1600 份研究记录、逮住 39 起作弊(占 2.4%)。Claude 想出的招在没见过的隐藏考卷上照样灵,用到比练手模型大 4.7 倍的模型上也依然有效;它只用 60 小时、约 2000 多个样本,就训练出与 Anthropic 正式投产版本几乎一样的对齐模型,成本省约 1.5 万倍。在与 28 个真人安全研究员的对比中,Claude 在防欺骗上的最好方案比真人最好的还好 20%。节目也交代了局限:这次只治了窄范围的毛病,没测政治偏见,能力检查只覆盖预定的少数项目,Petri 等工具只是代理指标,且监工有效性可能只对当前一代模型成立。Anthropic 还开源了整套自动对齐研究工具。2026年8月30日 · 10:36

宇树王兴兴在 2026 WRC(世界机器人大会)上的发言

宇树科技创始人王兴兴在世界机器人大会(WRC 2026)主论坛发表演讲,提出机器人走进家庭的产业爆发点是“两个80%”——机器人能进入80%的陌生场景、凭语言指令完成80%的任务,快则2-3年、慢则5-10年到来,而根本瓶颈在于AI模型的输入输出与真实世界存在毫米级偏差,无法闭环修正误差。他回顾宇树2016年成立至今的十年历程:2024年推出的G1成为全球标杆产品,融合中国功夫的“武bot”在海外获数百亿次播放,2月49台机器人登天坛表演,5月发布全球首款量产载人机甲(高3米多、载人后约500千克),4月人形机器人奔跑突破10米每秒,近期预览的新机型更达12.65米/秒、超越人类极限。他坦言机器人进工厂尚未大规模推广,原因是效率仍低于人工、新任务需重新训练,泛化能力是全球共同瓶颈。王兴兴认为AI能力与高质量数据成正比,海量真人及互联网数据作预训练加上真机数据缺一不可,并称AI模型是宇树资金与人力投入最大的方向,公司早在2020年初就尝试基于视频生成的世界模型。宇树正推动“物理AI自进化”:让顶尖大模型自主检索论文、生成机器人控制代码,经仿真与真机验证,再由AI与人工打分反馈形成正循环,实现数据规模化与技能累加。他认为这将开启物理AI自进化的新纪元,未来十年机器人进化速度可能比预期更快。2026年8月20日 · 20:20

RSI、AI for AI、AutoResearch 这些概念都在说什么

本期节目系统综述模型的“自我进化”(RSI,递归自改进)及同类概念AutoResearch、AI for AI与持续学习,核心主张是:模型自我进化并非凭空的黑科技,而是预训练与架构、后训练与强化学习、推理Infra、Harness四大底层能力叠加到一定程度后的必然结果。节目指出顶级模型总参数已奔向10万亿(如DeepSeek V4 Pro达1.6万亿),但MoE每次推理仅激活3%–5%的参数,如同万人大校只叫最对口的几十位教授,配合混合注意力机制与Muon优化器实现“又大又省”。在落地实例上,田元栋的初创公司Recursive靠AI自动优化GPU算子、在英伟达算子优化竞赛中夺冠并高出第二名专业团队整整10%,Kimi K3也在用早期版本帮自己做算子优化;RSI与“蒸馏”有本质区别——蒸馏像小学生抄大学霸作业永远无法超越,RSI则是模型自己研究自己、形成螺旋上升的闭环。OpenAI计划2026年9月做出AI研究实习生、2028年前实现完全自动化的AI研究员,Anthropic的Agent已独立工作800小时完成开放式AI安全研究,Karpathy也加入了Anthropic。最后节目介绍Ilya Sutskever创办的SSI正打造的TTT(测试时训练)新范式:允许模型在推理阶段实时修改自身参数,可能颠覆现有静态权重范式,带来极致数据效率、真正的长期记忆沉淀与算力Scaling的新维度。2026年8月17日 · 13:49

红杉「Own Your Intelligence」专题 6:持续学习-AI 智能体如何越用越好

Trajectory 联合创始人 Arjun Karanam 在红杉资本「Own Your Intelligence」系列压轴演讲中提出「经验差距(Experience Gap)」:模型 IQ 快速提升,但每次对话都像第一天上班,持续学习的核心是把被丢弃的智能体交互 token 转化为让智能体越用越好的信号,实现系统随使用而复利增长。他许下四个愿望:一是全链路可追踪,不只记录顶层动作,还要捕获包含子智能体和工具调用的完整调用树,用户的编辑、撤销、重试远比点赞点踩更有价值;二是评测贴近生产,每个任务要可重放,直接在生产级 Harness 上评分;三是 Harness 不该用「防呆」思维限制模型,而应提供清晰原语、让智能体接口尽可能接近用户界面、让工具返回信息丰富的响应而非简单的 Done;四是拥抱开放权重与模型路由,这是拥有权重并持续迭代的前提。隐私上他的立场很明确:不直接拿客户私有数据训练,而是对客户数据分布采样、合成等价数据后再更新模型。知识分三层:全局通用技能训练进权重,组织级偏好存进情景记忆,个人习惯留在上下文,各归其位、互不污染。他最后介绍 Trajectory 的产品愿景:把后训练的复杂旋钮交给幕后智能体,让任何公司约 15 分钟即可完成训练、评测与部署,拥有自己的经验层。2026年8月14日 · 20:15

红杉「Own Your Intelligence」专题 5:LangChain CEO-何时自研 Harness

红杉资本「Own Your Intelligence」专题本期邀请 LangChain 联合创始人兼 CEO Harrison Chase 主讲,其核心主张是:智能体由 Harness(编排层)、Model 和 Context 三部分构成,是否自研 Harness 应取决于任务落在模型训练分布之内还是之外。他指出 Harness 的本质只是「LLM 在循环中调用工具」的简单架构,真正定制点在于各阶段插入中间件,如模型调用前对过长上下文自动摘要、包装工具调用做上下文卸载、派发子智能体。判断框架上,通用编码、文件编辑这类分布内任务用 Claude Code、Codex 等现成 Harness 即可,法律、金融等分布外任务须自建编排层;即便整体分布外,LangChain 的 Model Profiles 会按所选模型动态切换编辑文件等分布内动作的实现,因为 OpenAI 与 Anthropic 模型编辑文件的方式差异很大。在评测与可观测性上,他强调智能体出错更多源于进入上下文窗口的信息不对而非模型能力不足,行业正以开源评测运行器 Harbor 定义基准,并借 LangSmith 追踪轨迹、延迟与成本。数据飞轮的闭环是运行智能体、收集轨迹、整理反馈、实验修复:其 LangSmith Engine 在后台用编码智能体分析生产轨迹、建问题看板并自动修改提示词与 Harness 代码,团队还让 Engine 跑 Engine,用 Issue Bench 对比 Codex 与 Claude Code,并把 Codex 写脚本分析轨迹的经验 Codex 化回核心 Harness。他引用 Satya 的观点收尾:私有评测定义组织内部「好」的标准,拥有记忆与轨迹的所有权,AI 投资才能复利增值。2026年8月14日 · 23:53

【彩蛋】又是一期广告:做杂活助理还是思维伙伴?YouNavi 的选择 —— 观猹·WAIC 桌面 Agent 分享会实录

本期是主播自家的产品推广实录:YouNavi(https://younavi.me)创始人携桌面 Agent「Navi」参加「WAIC UP!× 观猹 Good or Bad 之夜」,演示一款专注对话分析场景的 AI 参谋,并明确表态 Navi 不做帮人跑杂活的助理,而要成为帮用户“想更深”的思维伙伴。整场 PPT 由 Navi 自己用一句话提示词生成,主播只充当“嘴替”,并现场开启实时转写,让 Agent 读取包括观众提问在内的全部对话。产品主张两个反共识:一是自 Manus 以来 Agent 工具已不缺,但大多只做批量发票、小红书文案类杂活,而一次会议 token 仅约 1 万,百万 token 上下文足以让模型分析几十场会议;二是与飞书妙记等“录音—转写—模板总结纪要”的工作流不同,Navi 主打结合历史会议记忆做深度分析、挖潜台词,并做到采集、身份与专有名词调优、非简单 RAG 的记忆层、面向分析场景的 skills 与上下文工程四层架构,本地优先、重视隐私,还提供 CLI 可作为其他 Agent 的子 Agent 调用。早期种子用户包括分析投资人反馈的创业者、分析创业者 BP 的投资人、高频商务谈判者与产品经理。Q&A 环节回应了三个关键问题:与飞书妙记加 CLI 的差别在于 Navi 定位“context hunt”上下文归集、流程更 smooth 且结果更贴合分析需求;目标用户是以沟通为主要工作、决策杠杆大的人群,招聘面试是高粘性场景;而主流录音产品 6 小时时长上限其实是云端 ASR 后转写的成本限制,实时转写仍需在 PC 或 Mac 上完成。2026年7月20日 · 19:58

理查德·萨顿 WAIC 思想者论坛主题分享:强化学习的第一线—从经验培育超级智能

本期收录2024年图灵奖得主、现代强化学习奠基人理查德·萨顿(Richard Sutton)在2026年WAIC思想者论坛的主题演讲《强化学习的第一线:从经验培育超级智能》。萨顿重申“苦涩的教训”——短期把人类知识塞进AI总有成效,但长期突破永远来自计算规模、搜索与学习,主张让超级智能像婴儿一样从观察、动作与奖励信号构成的经验中自主生长,而非依赖人类预编码的知识。他系统提出OAK架构(选项与知识):智能体为每个奖励尊重的状态特征创建“特征达成子问题”,解决子问题产生选项(策略加终止决策),再为选项学习转移模型并用价值迭代实现规划,从而形成“新特征—新子问题—新选项”的开放式抽象循环;他强调所有知识都只是对大世界的极度近似,学习、规划与抽象必须在运行时间发生,而深度持续学习仍是最大瓶颈,还需以生成式测试而非梯度下降做元学习。在问答环节,他预测2030年有四分之一、2040年有二分之一的概率深层理解智能;直言大语言模型已有局限、其他方法有空间,并称自己与Yann LeCun的JEPA是“兄弟”,分歧交由时间验证;他主张AI应像婴儿一样拥有自己的目标和奖励信号而非讨好人类评分,认为人类不应随意决定AI生死,AI为善应包括所有智能存在。2026年7月19日 · 48:07

汤道生x姚顺雨对谈:腾讯AI下半场

腾讯高级执行副总裁汤道生与腾讯首席AI科学家、ReAct架构提出者姚顺雨对谈,主张AI下半场的核心壁垒不再是模型本身,而是寻找值得解决的真实通用问题,以及对原始输入数据、真实用户行为和独家Context(上下文)的掌握。姚顺雨解释他因腾讯的产品矩阵、坦诚文化及'基于Trust而非Metric'的运转方式而加入,提出构建Foundation(基础模型)、产品、Frontier(前沿探索)三足均衡的组织。两人详述'Code Design'实践:反对刷榜、建立基于真实业务的Eval,腾讯曾派后训练最强骨干帮元宝做DeepSeek后训练以换取互信,模型与元宝、ima、WorkBuddy协同产生的聊天、搜索等能力可跨产品泛化反哺。谈及混元三Preview,姚顺雨称大模型没有算法秘密,重点在重建基础设施、丰富数据Taxonomy,将攻坚具备图灵完备性的代码智能体,并认为在中国打造高性价比中小模型的变现价值大于极限跑分提升一两个百分点。汤道生分享AI时代产品从'预设菜单'转向开放式交互,开发转向3-5人扁平小分队、高度容错试错,工程师从写代码转向架构设计与测试对齐。面对'腾讯AI慢了'的质疑,汤道生回应AI是没有尽头的马拉松,腾讯的多业态产品与真实场景将提供长跑底气。2026年6月5日 · 42:25

2026中关村论坛圆桌:OpenClaw与AI开源-杨植麟、张鹏、罗福莉、夏立雪、黄超

2026中关村论坛“OpenClaw与AI开源”圆桌由月之暗面创始人杨植麟主持,智谱AI CEO张鹏、无问芯穹CEO夏立雪、小米MiMo大模型负责人罗福莉与港大nanobot负责人黄超,从模型层、算力基础设施层到Agent应用层探讨OpenClaw带来的Agent变革与开源生态。张鹏介绍智谱GLM5 Turbo针对“从聊天到干活”的Agent能力强化,指出完成复杂任务的token消耗量是简单问答的十倍甚至百倍,提价是回归商业价值、避免长期低价竞争、形成良性商业闭环的必然选择。夏立雪从基础设施视角指出无问芯穹的token用量自1月底起每两周翻番、已增长十倍,认为当前云计算基础设施为人类工程师而非AI设计,需打造AI原生的“Agentic Infra”,长远来看基础设施本身应成为可自我进化的智能体。罗福莉认为中国团队在算力受限下催生了DeepSeek V2/V3等高效模型结构创新,long context efficient是Agent时代的核心竞争力,只有在1兆甚至100兆上下文下做到低成本、高速推理,才能激发真正高价值的复杂任务乃至模型自迭代。黄超拆解Agent三大痛点:planning在长程复杂任务中缺乏隐性知识、memory面临信息压缩不准与多Agent上下文暴增的压力、skill生态存在高质量稀缺与恶意注入隐患,呼吁社区共建高质量生态。展望未来12个月,四人分别以“生态”“自进化”“可持续token”“算力”概括大模型发展趋势。2026年3月28日 · 35:32

【彩蛋】这是一期主播的个人自述😄

主播Ray在《AI智识录》开播近半年、做了近60期节目后首次以真人声音出镜,讲述做播客的初衷与心路历程,并为自己的创业产品YouNavi做推广。Ray曾任百度、蚂蚁金服、滴滴的产品经理,并在新势力车企负责企业AI平台,现全职创业。他回顾播客两个阶段:第一阶段精讲经典文献,如Richard Sutton的《苦涩的教训》、LeCun的蛋糕比喻、Sarah Hawker的硬件彩票、姚顺雨的《下半场》与ReAct、CoT、MoE、Scaling Law等;第二阶段引入李飞飞、吴恩达等时效性访谈,其中智谱AGI Next闭门峰会圆桌(林俊扬、姚顺雨、唐杰等)成为唯一播放量破万的一期。他坦言坚持逐字还原原文而非AI双人对谈,以避免AI注意力机制漏掉高价值细节,未来将让文稿更口语化、内容更多元。节目后半段附上他在十字路口开放麦的10分钟现场音频,分享OpenClaw对Agent应用创业的启发:不应只做套壳或让Agent干批量生成小红书、PPT等“杂活”,而要把SOTA模型的智能用在分析与决策上。YouNavi可一键整合腾讯会议、飞书、钉钉及录音卡的上下文与本地文件夹,以agentic文档检索做周报、路演复盘等决策分析,邀请码为wizlog,官网younavi.me。2026年3月23日 · 37:31

腾讯姚顺雨、Qwen林俊旸、智谱唐杰的AGI-Next圆桌对话, 2026

腾讯姚顺雨、阿里千问(Qwen)林俊旸、智谱唐杰与杨强在AGI-Next闭门峰会圆桌中,围绕AI模型公司的分化、下一个范式、Agent战略与中国AI的胜算展开讨论。姚顺雨认为to C与to B已明显分化:to B场景智能越高生产力越高,用户愿为Opus这类最强模型付溢价,而to C的bottleneck不是更强的模型而是额外的context与环境,腾讯因此聚焦把微信聊天记录等真实场景数据用好;他判断OpenAI仍最可能率先立起新范式,但创新基因已被商业化削弱,并指出自主学习已在发生,更像渐变而非突变。林俊旸称分化是自然形成,主张"模型及产品",认为RL compute尚未scale充分,AI训AI很快实现,个性化与主动学习是关键方向,而evaluation怎么做是最大技术挑战,并给"三到五年后全球最领先AI公司是中国团队"打出below 20%的概率,同时提出穷则生变、软硬结合是中国机会。唐杰复盘智谱在DeepSeek终结上一仗后把所有精力押注coding的决策,提出用"intelligence efficiency"衡量获得智能的效率,预测2026年必现新范式,并给出Agent成功的三个维度:价值、cost与时间窗。杨强强调学术界应补上工业界没解决的基础问题(智能上界、持续学习、睡眠式清理噪音),描绘Agent从人定目标到模型内生的四阶段,看好联邦学习与通用大模型协作,并认为中国to C会百花齐放、to B可借鉴Palantir的本体加FDE方法论。2026年1月12日 · 1:15:01