OpenAI 联合创始人 John Schulman(约翰·舒尔曼):ChatGPT 本可提前数年诞生,RL 研究远未结束撰文:Techub News 整理
导语
2025 年 12 月,OpenAI 联合创始人、首席科学家 John Schulman(约翰·舒尔曼)做客 Cursor 播客,进行了一场长达 51 分钟的深度对话。作为强化学习(RL)领域的奠基人之一,以及从 OpenAI 早期一路走来的核心人物,John Schulman(约翰·舒尔曼)的视角极具历史纵深感和行业洞察力。他目前也是新兴 AI 公司 Thinking Machines 的联合创始人。本次对话不仅回顾了 OpenAI 那段“草莽”岁月中的成败得失,更对当前 AI 研究的前沿问题、机构管理哲学以及技术未来走向,给出了坦诚而富有启发性的回答。
摘要
凭借后见之明,一个由少数精英组成的团队,完全有可能在 2018 或 2019 年就打造出 ChatGPT 3.5 级别的模型。
OpenAI 早期项目“Universe”是一个“死胡同”,但其追求通用 RL 智能体的核心理念“超前了可能十年”。
价值函数在当前的 LLM 强化学习(如 RLHF)中作用有限,但未来可能会“卷土重来”。
理想的 AI 研究管理者没有固定模式,需根据团队目标、成员经验和研究阶段,在“深度技术参与”和“放手赋能”之间灵活切换。
AGI 时间线预测充满不确定性,工程师的乐观估计通常需要乘以 2-3 倍的“现实系数”,但 AI 加速自身发展又可能带来意外突破。
ChatGPT 的“时空穿越”:少数精英与提前数年
访谈从一个有趣的假设开始:如果让 OpenAI 创始团队带着今天的全部知识回到 2015-2016 年,他们能以多快的速度“速通”ChatGPT?John Schulman(约翰·舒尔曼)给出了一个惊人的答案:“你完全可以用少得多的计算资源做到这一点。”他提到像 nanoGPT 这样的项目已经证明了这种可能性。关键在于,通过更巧妙的技巧,尤其是更好的“训练后”(post-training)方法,如精细的微调和巧妙构建的数据集,可以有效“放大”计算能力,让一个规模小得多的模型达到相当好的效果。
当被追问具体需要多少人、多少 GPU 以及在何时能完成时,John Schulman(约翰·舒尔曼)估算道:“如果你有几位才华横溢的人,带着充分的后见之明工作一年左右……我认为你可以在 2018 或 2019 年,用几个人就做出达到 GPT-3.5 水平的东西。”他补充说,这还建立在可以利用他人已有的预训练数据集和网络爬取成果的基础上。他甚至畅想未来可能会出现更极端的“演示场景版 ChatGPT”,即一个文件就能完成从网络爬取到全天训练的全过程。
OpenAI 的“草莽”岁月:死胡同与必要的弯路
如今市值巨大的 OpenAI,在早期却是一个“非正式”甚至有点“杂牌军”气质的团队。John Schulman(约翰·舒尔曼)证实了这一点,形容早期更像一个学术小组,研究人员根据个人兴趣主导项目,通常是一到三人合作,产出论文或博客文章。同时,他们也怀有进行大型工程项目的抱负,并深受 DeepMind 如 AlphaGo 等项目工作方式的影响。
然而,并非所有项目都通向成功。他重点提到了一个早期“死胡同”项目——Universe。该项目旨在汇集大量不同的 RL 环境(如各种电子游戏、网页导航任务),构建一个庞大的数据集,通过联合训练得到一个通用的、强大的 RL 智能体。“有趣的是,我认为这是一个根本上正确的想法,但就是太早了,可能早了十年。”John Schulman(约翰·舒尔曼)总结道。当时系统笨重,模型从零开始训练,泛化能力差,最终未能成功。团队后来转向更聚焦的环境(如模拟视频游戏集),才取得了更好的进展。像机器人项目也曾是公司的“死胡同”,但从长远看,它们锻炼了团队执行大型工程和科研项目的能力。
在谈到早期的大型工程项目时,John Schulman(约翰·舒尔曼)提到了 Dota 项目,这是 OpenAI 早期首个真正成功的大型计算密集型项目,涉及复杂的系统工作,包括如何接入 Dota 环境、构建训练系统以及进行大规模并行和异步 RL 训练。
管理科研“特种部队”:没有标准答案的难题
随着 AI 科研日益成为大团队协作的“大科学”,研究管理者的角色变得至关重要。John Schulman(约翰·舒尔曼)认为这是一个“棘手的问题”,因为成功的管理模式多种多样,且领域本身在快速变化。
他观察到两种有效模式:一种是深度参与型,管理者亲自动手写大量代码,审阅所有下属的代码,提供详细的技术反馈;另一种是赋能放手型,管理者更像一个“共鸣板”,提供职业建议,保持团队积极性和动力,让成员自由探索。
“没有一种模式适合所有情况。”John Schulman(约翰·舒尔曼)分析道,如果团队从事探索性研究,且成员经验丰富,那么放手模式更合适;如果目标明确,或者团队成员经验尚浅,需要执行具体任务,那么深度参与、提供更多技术监督的模式可能更有效。
关于研究机构的文化溯源,John Schulman(约翰·舒尔曼)表示,OpenAI 可能更多借鉴了成员们之前工作过的地方(如谷歌、DeepMind)的经验,而非刻意研究历史上的成功实验室(如贝尔实验室、施乐帕克)。早期 OpenAI 更像“和平时期”,允许更多探索性工作;而近年新成立的许多公司则更多处于“追赶模式”,先复制当前技术前沿,这可能导致探索性研究“肌肉”锻炼不足。
强化学习的现在与未来:价值函数会卷土重来吗?
作为 RL 专家,John Schulman(约翰·舒尔曼)对当前 RL 在 LLM 领域的应用现状和未来方向进行了剖析。
他首先解释了为什么价值函数(Value Functions)在当前流行的 RLHF 等任务中不那么受欢迎:“它们似乎帮助不大。”价值函数的主要作用是方差缩减,但在当前任务集上,效果并不明显。他坦言不清楚具体原因,但预计价值函数未来会在某个时刻“卷土重来”。
对于持续学习(Continual Learning)这一挑战,John Schulman(约翰·舒尔曼)认为它包含多种类型(如运动学习、情景记忆、程序性记忆)。他预计上下文学习(in-context learning)和长上下文能力会持续改进,而像 LoRA 这样的参数微调技术将在此基础上发挥作用,尤其适用于需要大量容量和知识吸收的记忆类型。但他也指出,如果模型规模持续扩大,即使方法论不变,各项指标也会持续改善;当然,新方法可能会带来更优的缩放定律,加速持续学习。
关于 RL 研究的未来,John Schulman(约翰·舒尔曼)认为许多想法会经历“时尚轮回”,有些想法出现得过早未能兑现承诺,但之后可能再度流行。他特别提到离线 RL(Offline RL) 和仿真到现实(Sim-to-Real) 是很有趣的方向。当前 LLM 领域的 RL 某种程度上类似于 Sim-to-Real,即在多样化的模拟环境中进行大规模 RL 以求泛化到现实世界。他认为这项技术在机器人领域依然有效,并预计未来 LLM 领域也会重新重视从真实部署中学习。
AGI 预测与行业变迁:从“怪人”聚集到工程能力优先
对于炙手可热的 AGI 时间线预测,John Schulman(约翰·舒尔曼)表现出审慎的态度。他认同工程师和研究者在预估项目时间上存在系统性低估的倾向,通常需要乘以 2-3 倍的系数才能接近现实。参考自动驾驶技术的发展历程,他认为 AGI 可能比一些乐观预测来得更晚。
“另一方面,AI 加速自身发展的正反馈循环也可能颠覆直觉。”他补充道,考虑到这一因素,一些较短的预测时间线也颇具说服力。因此,他并不愿做出非常自信的预测,认为其中存在大量不确定性,例如人类理解进展的瓶颈等。
回顾 AI 领域人才构成的变化,John Schulman(约翰·舒尔曼)认为早期从业者“可能更奇怪一些”,因为当时 AI 的重要性不像今天这样是“传统智慧”,吸引了更多非传统职业路径和风险承受能力更高的人。如今,更多遵循常规职业路径、风险承受能力相对较低的人进入这个领域。同时,由于竞争激烈,入行门槛也水涨船高。
更重要的是,工程技能的重要性如今已超过以往。因为扩展现有简单想法并良好执行就能带来大量收益,且领域更加成熟,研究者通常是在他人代码库和基础设施上构建,而非从零开始。因此,拥有软件工程背景的人现在更具优势。
Thinking Machines 的蓝图:Tinker 与未来展望
在访谈的最后部分,John Schulman(约翰·舒尔曼)谈到了他目前联合创立的公司 Thinking Machines 及其推出的产品 Tinker。
Tinker 被描述为一个低层级微调 API,提供了一小组用于训练和采样的底层原语,让用户能够表达几乎任何想要的训练后算法,而无需担心 GPU、加速器或复杂的分布式系统问题。它类似于 OpenAI 和 Anthropic 提供的采样 API,但专注于训练环节。John Schulman(约翰·舒尔曼)希望未来的初创公司能够直接基于 Tinker 构建复杂定制模型,而无需自研基础设施。
目前,Tinker 主要面向对 ML 有深入了解、希望使用这些底层原语的资深用户。但团队计划不断改进,增加更多功能(如多模态输入输出),并构建更多工具和高级组件,使其未来变得更加用户友好,成为一个“全栈”解决方案。
关于 Thinking Machines 的未来,John Schulman(约翰·舒尔曼)透露,明年将看到公司自有模型的相关发布,同时 Tinker 平台也将持续增强。[DEX报告] MIRROR暴涨3551%……quq交易量达3.9亿美元位居首位当日,在去中心化交易所(DEX)中最受关注的交易对是苹果(Apple/SOL)、游戏驿站(GME/SOL)和自嗨锅(ZSWAP/WBNB)。
根据6日Dex Screener的数据,趋势排名第一的交易对是苹果(Apple/SOL),交易价格为0.002905美元,24小时涨幅达258%。
排名第二的是游戏驿站(GME/SOL),上涨1506%,交易价格为0.0005138美元。排名第三的是自嗨锅(ZSWAP/WBNB),上涨35.59%,报0.001935美元。
涨幅榜(Gainers)与跌幅榜(Losers)_交易量10万美元,流动性25万美元以上
涨幅最大的交易对是Mirror(MIRROR/WETH),24小时上涨3551%。其次是RogueAI(RogueAI/WETH),上涨480%;PayAI(PAYAI/SOL)上涨260%。
另一方面,跌幅最大的交易对是Monster(MON/USDT),24小时下跌-54.71%。紧随其后的是Flork(FLORK/WETH),下跌-30.76%;Terminus(TERMINUS/WETH),下跌-30.63%,呈现疲软走势。
交易量 TOP 3
Quark(quq/USDT) – 3.907亿美元
WETH(WETH/USDC) – 1.345亿美元
cbBTC(cbBTC/WETH) – 9840万美元
交易笔数 TOP 3
Longinus(LGNS/DAI) – 1,258,516笔
bite(bite/SOL) – 496,407笔
Loudy(Loudy/SOL) – 99,918笔
最近24小时内,整个DEX的总交易量约为185.7亿美元,总交易笔数为38,359,715笔。
[编者注] 去中心化交易所(DEX)是一种无需中介、可实现个人对个人(P2P)直接交易的区块链加密货币交易所。它基于智能合约和链上数据交易,确保了运营透明度。只需连接钱包,无需存入资金即可进行交易,因此用户对资产的掌控权、匿名性和自由度较高。在Meme币热潮中,DEX因其支持快速上币而更加活跃。DEX报告基于Dex Screener的数据,整理了趋势交易对、涨跌品种、交易量、交易笔数以及按交易钱包数排名的顶部品种。
MIRROR 2025 影视文化产业与 RWA 跨界融合高端论坛在京举行,共创文娱资产数字化新生态2025 年 10 月 21 日,由全球领先的文娱 RWA 平台 Mirror.fan,北京乾行世纪文化咨询有限公司共同主办的「MIRROR 2025 影视文化产业与 RWA 跨界融合高端论坛」在北京东城区禄米仓新视听产业园成功举办。本次论坛汇聚行业领军人物、专家学者与投资机构代表,围绕影视文娱资产数字化、区块链技术赋能、产业生态共建等议题展开深入探讨,为推动文化金融创新、构建标准化行业体系凝聚共识。
参加圆桌论坛的 Mirror.fanCEO 王厣豪,乾行金融私董会发起人李思霖, 国影控股有限公司总经理王国伟,北京桦天律师事务所律师华谊兄弟独立董事杨涛, 大唐辉煌传媒制作有限公司创始人,中国电视剧制作产业协会副会长王辉,金色财经 CEO 王瑜琨,以及亚洲经济贸易中心金融部部长,香港汇生国际金融集团董事总经理,领骏资本创始管理合伙人,美国 Forbstco International. COO ,中传文创投资有限公司文旅中心主任等 60 位重磅嘉宾亲临现场,同时有超过百位全球的精英嘉宾线上同步参与,共同探讨虚实经济融合下的产业新机遇。
Mirror.fan 作为本次论坛的发起方与核心推动者,展示了其在文娱资产数字化领域的领先实践与战略布局。平台 CEO 王厣豪在主题发言中指出,RWA 技术为影视、音乐、漫画等高价值无形资产提供了标准化、可分割、高流动性的数字化载体,不仅有效破解行业长期存在的融资难、收益分配不透明、资产流动性不足等痛点,更通过区块链不可篡改、全程可溯的技术特性,构建起创作者与投资者之间的可信桥梁。他强调,Mirror.fan 以「经典 IP 焕新+原创孵化」双轮驱动,致力于打造「创作—投资—消费—衍生」全周期共赢生态。影视 IP 确权认证与价值锚定后,实现全球 7*24 小时流通,吸引全球资本参与。RWA 不仅能实现影视 IP 的全球化传播,更能通过资产数字化打破地域壁垒,让中国影视文娱内容借助金融工具走向国际市场。投资者在 Mirror.fan 平台上通过购买代币,分享版权,广告等获得多元收益,还可以使用消费代币观看作品,购买衍生品,或者参与作品的二创和衍生品开发等平台建设,这不仅仅是资金的汇集,更是智慧和资源的凝聚。
Mirror.fan 创始人王厣豪发表演讲
在圆桌论坛环节,与会嘉宾围绕「技术赋能·资产活化·生态共生」三大主题展开深度对话。大家一致认为,RWA 远不只是技术应用的升级,更是文娱产业生产关系的深刻变革。通过资产代币化、智能合约自动分账、全球全天候交易等机制,RWA 正在重塑内容创作、投资参与和消费互动的方式,这场变革远是一场关乎权力、所有权和利益分配的根本性范式转移——是从 Web 2 的「平台拥有」到 Web3 的「用户拥有」的产权革命。
其中,金色财经 CEO 王瑜琨指出:去年,加密行业中出现了一些短剧,随着资金来源的扩大,行业可以容纳更多的娱乐产业 IP 加入其中。合规非常重要,目前,我们也有别的项目在做 RWA 探索,在一定程度上可以做到合规。在 Web3 与文娱行业结合方面确实存在痛点:Web3 的金融属性很强,文娱的专业性很强,因此,两个行业相重合的人才非常少。对于我们而言,如何弥合专业人才的鸿沟是要继续探索的问题。
金色财经 CEO 王瑜琨
国影控股有限公司总经理,原中国电影基金会副主席中国电影网 CEO 王国伟指出:从好莱坞的发展经验来看:我们一定要抓住文化龙头,不仅要关注融资问题,还要关注如何能集智,让成千上万人都能参与其中。大 IP 中潜藏着民族文化、民族精神。
国影控股有限公司总经理,原中国电影基金会副主席,中国电影网 CEO 王国伟
北京桦天律师事务所律师,华谊兄弟传媒股份有限公司独立董事杨涛指出:目前的文娱与 RWA 相结合之后的合规问题尚需讨论。在文娱行业中,要关注的不止是钱,还有观众的感受。文娱是非标资产,随着与 Web3 的结合,也许会通过落地实践总结出新的行业标准。
北京桦天律师事务所律师,华谊兄弟传媒股份有限公司独立董事杨涛
大唐辉煌传媒有限公司创始人,中国电视剧制作产业协会副会长王辉指出:融资的问题一直困扰着文娱行业,Web3 能为融资赋能将利好文娱行业。如果能够做好合规,将进一步帮助中国的文娱产业更好的发展,文娱行业的 RWA 合规应该是比较容易做到的。
大唐辉煌传媒有限公司创始人,中国电视剧制作产业协会副会长王辉发言
论坛在热烈共识中落下帷幕。与会代表认为,文娱 RWA 有望成为文化强国战略的重要支点,推动产业与金融深度融合,激活数万亿市场潜力。未来,Mirror.fan 将持续联合乾行金融私董会等合作伙伴,共建「资本+产业+技术+合规」四位一体的服务生态,助力中国文娱产业在全球数字化浪潮中把握先机、实现高质量发展。
参会嘉宾合影留念
Camp Network携手Black Mirror推出200万$MIRROR独家空投,TrailHeads持有者率先体验Web3沉浸式世界近日,去中心化社交与社区平台 Camp Network 宣布与沉浸式 Web3 项目 Black Mirror 达成战略合作,将共同推出面向 Camp 社区的独家空投活动。根据官方信息,Black Mirror 已为 TrailHeads 持有者 在 Phase 1 中预留 2,000,000 枚 $MIRROR 代币,用于奖励社区的活跃贡献与长期支持。
Black Mirror 是一个基于“声誉信号”机制的 Web3 沉浸式体验平台,通过识别用户在链上与社区中的贡献度,赋予其在虚拟世界中的身份与权益。本次合作意味着 Camp 社区成员将能够率先解锁这一全新体验,并在早期阶段获得实际收益。
作为一个专注于支持 AI 代理与用户自有 IP 生态的公链,Camp Network 构建了独特的 Autonomous IP Layer,使用户能够将音乐、图片、视频甚至个人数据等多种形式的知识产权进行链上确权、代币化,并用于 AI 训练、创作再混合及收益分配。Camp 的底层架构优先支持免 Gas 的 IP 注册与版税结算,同时提供适配 AI 代理工作流与自动化授权的隔离执行环境。开发者还可基于 Camp 启动独立的应用链,拥有独立的区块空间与计算资源,从而获得灵活性与可扩展性,满足高性能任务的需求。
符合条件的 TrailHeads 持有者可通过官方注册页面完成登记,锁定空投额度。据悉,注册后用户不仅能领取 $MIRROR,还将获得未来 Black Mirror 生态中的多重交互与福利机会。
业内观察人士指出,此次合作不仅是 Camp Network 对社区成员的回馈,更是其推动跨项目协作、增强社区赋能能力的重要一步。作为一个致力于构建开放、活跃和高参与度 Web3 社区的网络,Camp Network 通过与 Black Mirror 的合作,将进一步拓展成员的互动场景与价值获取途径,推动社区在链上和链下的深度融合。
随着空投活动的开启,Camp 社区与 Black Mirror 的结合有望吸引更多用户关注和参与,为双方未来的联合运营与生态发展奠定坚实基础。撰文:Techub News 整理 导语 2025 年 12 月,OpenAI 联合创始人、首席科学家 John Schulman(约翰·舒尔曼)做客 Cursor 播客,进行了一场长达 51 分钟的深度对话。作为强化学习(RL)领域的奠基人之一,以及从 OpenAI 早期一路走来的核心人物,John Schulman(约翰·舒尔曼)的视角极具历史纵深感和行业洞察力。他目前也是新兴 AI 公司 Thinking Machines 的联合创始人。本次对话不仅回顾了 OpenAI 那段“草莽”岁月中的成败得失,更对当前 AI 研究的前沿问题、机构管理哲学以及技术未来走向,给出了坦诚而富有启发性的回答。 摘要 凭借后见之明,一个由少数精英组成的团队,完全有可能在 2018 或 2019 年就打造出 ChatGPT 3.5 级别的模型。 OpenAI 早期项目“Universe”是一个“死胡同”,但其追求通用 RL 智能体的核心理念“超前了可能十年”。 价值函数在当前的 LLM 强化学习(如 RLHF)中作用有限,但未来可能会“卷土重来”。 理想的 AI 研究管理者没有固定模式,需根据团队目标、成员经验和研究阶段,在“深度技术参与”和“放手赋能”之间灵活切换。 AGI 时间线预测充满不确定性,工程师的乐观估计通常需要乘以 2-3 倍的“现实系数”,但 AI 加速自身发展又可能带来意外突破。 ChatGPT 的“时空穿越”:少数精英与提前数年 访谈从一个有趣的假设开始:如果让 OpenAI 创始团队带着今天的全部知识回到 2015-2016 年,他们能以多快的速度“速通”ChatGPT?John Schulman(约翰·舒尔曼)给出了一个惊人的答案:“你完全可以用少得多的计算资源做到这一点。”他提到像 nanoGPT 这样的项目已经证明了这种可能性。关键在于,通过更巧妙的技巧,尤其是更好的“训练后”(post-training)方法,如精细的微调和巧妙构建的数据集,可以有效“放大”计算能力,让一个规模小得多的模型达到相当好的效果。 当被追问具体需要多少人、多少 GPU 以及在何时能完成时,John Schulman(约翰·舒尔曼)估算道:“如果你有几位才华横溢的人,带着充分的后见之明工作一年左右……我认为你可以在 2018 或 2019 年,用几个人就做出达到 GPT-3.5 水平的东西。”他补充说,这还建立在可以利用他人已有的预训练数据集和网络爬取成果的基础上。他甚至畅想未来可能会出现更极端的“演示场景版 ChatGPT”,即一个文件就能完成从网络爬取到全天训练的全过程。 OpenAI 的“草莽”岁月:死胡同与必要的弯路 如今市值巨大的 OpenAI,在早期却是一个“非正式”甚至有点“杂牌军”气质的团队。John Schulman(约翰·舒尔曼)证实了这一点,形容早期更像一个学术小组,研究人员根据个人兴趣主导项目,通常是一到三人合作,产出论文或博客文章。同时,他们也怀有进行大型工程项目的抱负,并深受 DeepMind 如 AlphaGo 等项目工作方式的影响。 然而,并非所有项目都通向成功。他重点提到了一个早期“死胡同”项目——Universe。该项目旨在汇集大量不同的 RL 环境(如各种电子游戏、网页导航任务),构建一个庞大的数据集,通过联合训练得到一个通用的、强大的 RL 智能体。“有趣的是,我认为这是一个根本上正确的想法,但就是太早了,可能早了十年。”John Schulman(约翰·舒尔曼)总结道。当时系统笨重,模型从零开始训练,泛化能力差,最终未能成功。团队后来转向更聚焦的环境(如模拟视频游戏集),才取得了更好的进展。像机器人项目也曾是公司的“死胡同”,但从长远看,它们锻炼了团队执行大型工程和科研项目的能力。 在谈到早期的大型工程项目时,John Schulman(约翰·舒尔曼)提到了 Dota 项目,这是 OpenAI 早期首个真正成功的大型计算密集型项目,涉及复杂的系统工作,包括如何接入 Dota 环境、构建训练系统以及进行大规模并行和异步 RL 训练。 管理科研“特种部队”:没有标准答案的难题 随着 AI 科研日益成为大团队协作的“大科学”,研究管理者的角色变得至关重要。John Schulman(约翰·舒尔曼)认为这是一个“棘手的问题”,因为成功的管理模式多种多样,且领域本身在快速变化。 他观察到两种有效模式:一种是深度参与型,管理者亲自动手写大量代码,审阅所有下属的代码,提供详细的技术反馈;另一种是赋能放手型,管理者更像一个“共鸣板”,提供职业建议,保持团队积极性和动力,让成员自由探索。 “没有一种模式适合所有情况。”John Schulman(约翰·舒尔曼)分析道,如果团队从事探索性研究,且成员经验丰富,那么放手模式更合适;如果目标明确,或者团队成员经验尚浅,需要执行具体任务,那么深度参与、提供更多技术监督的模式可能更有效。 关于研究机构的文化溯源,John Schulman(约翰·舒尔曼)表示,OpenAI 可能更多借鉴了成员们之前工作过的地方(如谷歌、DeepMind)的经验,而非刻意研究历史上的成功实验室(如贝尔实验室、施乐帕克)。早期 OpenAI 更像“和平时期”,允许更多探索性工作;而近年新成立的许多公司则更多处于“追赶模式”,先复制当前技术前沿,这可能导致探索性研究“肌肉”锻炼不足。 强化学习的现在与未来:价值函数会卷土重来吗? 作为 RL 专家,John Schulman(约翰·舒尔曼)对当前 RL 在 LLM 领域的应用现状和未来方向进行了剖析。 他首先解释了为什么价值函数(Value Functions)在当前流行的 RLHF 等任务中不那么受欢迎:“它们似乎帮助不大。”价值函数的主要作用是方差缩减,但在当前任务集上,效果并不明显。他坦言不清楚具体原因,但预计价值函数未来会在某个时刻“卷土重来”。 对于持续学习(Continual Learning)这一挑战,John Schulman(约翰·舒尔曼)认为它包含多种类型(如运动学习、情景记忆、程序性记忆)。他预计上下文学习(in-context learning)和长上下文能力会持续改进,而像 LoRA 这样的参数微调技术将在此基础上发挥作用,尤其适用于需要大量容量和知识吸收的记忆类型。但他也指出,如果模型规模持续扩大,即使方法论不变,各项指标也会持续改善;当然,新方法可能会带来更优的缩放定律,加速持续学习。 关于 RL 研究的未来,John Schulman(约翰·舒尔曼)认为许多想法会经历“时尚轮回”,有些想法出现得过早未能兑现承诺,但之后可能再度流行。他特别提到离线 RL(Offline RL) 和仿真到现实(Sim-to-Real) 是很有趣的方向。当前 LLM 领域的 RL 某种程度上类似于 Sim-to-Real,即在多样化的模拟环境中进行大规模 RL 以求泛化到现实世界。他认为这项技术在机器人领域依然有效,并预计未来 LLM 领域也会重新重视从真实部署中学习。 AGI 预测与行业变迁:从“怪人”聚集到工程能力优先 对于炙手可热的 AGI 时间线预测,John Schulman(约翰·舒尔曼)表现出审慎的态度。他认同工程师和研究者在预估项目时间上存在系统性低估的倾向,通常需要乘以 2-3 倍的系数才能接近现实。参考自动驾驶技术的发展历程,他认为 AGI 可能比一些乐观预测来得更晚。 “另一方面,AI 加速自身发展的正反馈循环也可能颠覆直觉。”他补充道,考虑到这一因素,一些较短的预测时间线也颇具说服力。因此,他并不愿做出非常自信的预测,认为其中存在大量不确定性,例如人类理解进展的瓶颈等。 回顾 AI 领域人才构成的变化,John Schulman(约翰·舒尔曼)认为早期从业者“可能更奇怪一些”,因为当时 AI 的重要性不像今天这样是“传统智慧”,吸引了更多非传统职业路径和风险承受能力更高的人。如今,更多遵循常规职业路径、风险承受能力相对较低的人进入这个领域。同时,由于竞争激烈,入行门槛也水涨船高。 更重要的是,工程技能的重要性如今已超过以往。因为扩展现有简单想法并良好执行就能带来大量收益,且领域更加成熟,研究者通常是在他人代码库和基础设施上构建,而非从零开始。因此,拥有软件工程背景的人现在更具优势。 Thinking Machines 的蓝图:Tinker 与未来展望 在访谈的最后部分,John Schulman(约翰·舒尔曼)谈到了他目前联合创立的公司 Thinking Machines 及其推出的产品 Tinker。 Tinker 被描述为一个低层级微调 API,提供了一小组用于训练和采样的底层原语,让用户能够表达几乎任何想要的训练后算法,而无需担心 GPU、加速器或复杂的分布式系统问题。它类似于 OpenAI 和 Anthropic 提供的采样 API,但专注于训练环节。John Schulman(约翰·舒尔曼)希望未来的初创公司能够直接基于 Tinker 构建复杂定制模型,而无需自研基础设施。 目前,Tinker 主要面向对 ML 有深入了解、希望使用这些底层原语的资深用户。但团队计划不断改进,增加更多功能(如多模态输入输出),并构建更多工具和高级组件,使其未来变得更加用户友好,成为一个“全栈”解决方案。 关于 Thinking Machines 的未来,John Schulman(约翰·舒尔曼)透露,明年将看到公司自有模型的相关发布,同时 Tinker 平台也将持续增强。
