呸9月底之前,市场可能都会是震荡的节奏了。
按表韭投顾主理人国联民生证券制作的温度计显示,截至上周五,A股温度跌破70度,全球温度计也创近期新低了,市场的冷清大家体感上应该也感觉得出来,今天成交额1.64万亿,环比上周五又少了200亿,创年内第二低了(仅次于4月7日)。
不过,这种带着一丝性冷淡风格的区间反而是我比较安之若素的——真要是5-6月那种烈火烹油的行情,天天提示风险,也跟个小丑一样;而要是再来一次7月的大跌,我自己的账户也得大出血,可能就按摩不动了;所以,当下这种行情正好,把耐不住寂寞骂骂咧咧的资金慢慢洗出去,然后给那些具备耐心的投资者留足播种的空间,因为总体判断上,对后市不悲观,大盘指数估值仍然合理,回撤幅度也可控——还是此前说的,从主要经济体的大盘指数来看,A股的安全边际几乎是最好的。
对大类资产的深度跟踪,以及温度计,我在星球里也制作了一个专栏,截至目前,已经完成了全球市场、A股核心资产、红利、黄金、固收+,这五类资产的深度解读,以及温度计框架,我把合集放在文末,适合真正想“知其然,且知其所以然”地做好资产配置的个人投资者,以及需要分析框架的理财经理朋友们,确保都是大白话版本。
有需要的,看文末。
......
说回今天的市场。
1、今天全球AI板块一起下跌,下图截至15点,包括了A股的双创50、港股的半导体、美股的纳指100期货,以及日韩的4家AI龙头企业。
今晚看了一眼,美股开盘,费城半导体低开5个多点。
起因是,全球目前最强大模型企业Anthropic的创始人,Dario,发了一篇名为《We Must Pace the Frontier》的文章(中英版全文,以及具体解读,看周末的星球帖子),呼吁放缓前沿AI大模型的研发,强化监管,并继续对东大进行算力限制。
短期看,这压低了市场对AI资本开支与估值的预期,利空芯片及算力产业链,A股这边光模块里的中际和新X盛,都跌了5-6个点。
2、Dario的这篇文章,我们可以把它比作学校里的一种场景——高二到高三的暑假期间,由于Dario自己天赋异禀,且靠家里砸钱,提前完成了高三的课程,然后开始呼吁:
第一,大家高三的时候别卷了,卷过头了对大家身体都不好啊;
第二,以后晚上8点都得熄灯啊,为了防止有人偷偷卷,学校必须管起来,要么直接拉电闸,要么安排老师巡逻;
第三,那个三年二班的东大最危险啊,即使关了灯,他可能还在被窝里拿手电筒照着刷卷啊,必须把他的手电筒给没收了,顺便把他的计算器也给收了,让他打算盘做题(其长期呼吁全球芯片产业禁止对华出口)。
3、作为反华分子,Dario当然可以用小肚鸡肠来形容。
好在,咱们不用亲自骂他,直接有嘴替了——David Sacks,号称AI沙皇,之前被川宝命名为白宫的AI和加密货币政策的最高负责人,他说的话,基本就代表政府方面的态度。
他昨天洋洋洒洒写了一篇回怼Dario的文章,很长,核心思想用大白话总结如下:
第一,前沿AI不就是你和OpenAI说了算?真怕AI失控,你们自己先停啊,没人拦着,发文矫情个啥?
第二,你们不是在等监管,而是想用“AI要出事”倒逼政府出手;
第三,按你Dario的意思,最好吧,这个限制AI发展的监管规则还由你们来定对不对?然后政府发布,帮你们挡住后来者,你们直接垄断完了闷声发大财?
第四,你嘴上说拯救人类,实际不就是在“借刀杀人”?挟天子之令,给自己修护城河?
一言以蔽之,David Sacks的意思就是:
呸。
你一撅屁股劳资就知道你想拉什么屎。
4、当然,这事对我们来说,还需要有三点清晰的认知。
第一,AI的核心是什么?是军事霸权,Dario一直说,谁先掌握最强的AI,谁就可能获得全球军事的支配权(所以他言必谈意识形态),因此,AI的竞争不可能停止,David Sacks也说,你Dario这说些毛用都没有,因为东大根本不可能按你说的这个来。
第二,如果一个资深的黑子,认为你是最大的威胁,那么,说明你真的挺强的,这就是咱们东大AI这块目前的真实竞争力。
第三,大模型本身是比较差的商业模式,你看,即使是龙头的大模型,也焦虑的不行,天天防着别人弯道超车。
5、具体来看国内的市场。
有两个热点可以关注,一则关于回购,一则关于掏兜。
先说宁王的回购。
上周五盘后,宁王公告,启动了第一笔的回购。
下图,帮大家贴一下,宁王是7月24日宣布200-400亿的回购并注销的,但迟迟没有动静,此后,截至上周五,股价在宣布回购后累计下跌了13%,创年内新低,且由高点回撤了接近30%,这才第一次回购2亿元。
今天,宁王涨超2%,算是对冲了一点光模块龙头的大跌。
6、另外一个热点,则是智谱继续掏兜。
本周末,智谱公告,进行上市以来的第二次配售,且同步发行可转债,累计金额近50亿美刀。
下图,直接看几个标志性时点:
今年1月初,IPO,募资50亿(以下都是港币);
6月初,纳入恒科;
7月初,首次配售,募资300多亿,摊薄股份4%以上;
短短2个月后,再次融资,其中股票配售150多亿,转债200多亿。
这业务真的太烧钱了。
今天,智谱再跌9cm,高位累计回撤-76%。
我看了一眼,一季度末,持股智谱并买到前十大的基金公司只有3家、产品3只;截至二季度末,基金公司变成了21家,产品变成了46只——截至目前,二季度加仓的,全被埋了。
7、对了,类似的情况,再提示一个风险。
本周四,国产GPU的另外一个龙头,沐X股份,会迎来上市后的首次较大规模解禁。
此前首次大规模解禁的摩尔,解禁以来累计跌-33%,可以参考下,不过,市场可能已经注意到了这个风险,摩尔解禁开始,沐X同步跌了-28%左右了。
8、最后,本周的核心,还是超级央行周,分别是:
周四凌晨2点,美联储宣布利率决议,目前加息预期接近90%;
周四19点,轮到英国央行,大概率利率不变;
周五上午,日本央行,大概率加息25bps,概率接近100%。
扶稳坐好,今晚报道称沙特的东西向输油管道大部分区域将停运数周,油价继续飙,等待大类资产波动率放大的区间吧。
......
就聊这么多。
Monad Metropolis 杭州站 9.19丨当 AI Agent 开始花钱,新的机会在哪里?从现金到卡,从卡到手机,从柜台转账到自动扣款,支付的形态改过很多次。但有一件事一直没变过:最后按下付款的,始终是人。
Agent 是第一次例外。
它可以自己买 API、自己租算力、自己向另一个 Agent 结一笔账。而围绕"人"设计了几十年的那一整套东西——身份、授权、额度、风控、争议——第一次要面对一个不是人的付款主体。
于是三个很朴素的问题,突然都没有了标准答案:它凭什么代表你付钱?额度谁定?付错了找谁?
9 月 19 日,我们把这几个问题带到杭州。
Monad Metropolis 杭州站
📅 时间:9 月 19 日 13:30
📍 地点:杭州(报名后查看详细地址)
🎫 报名:https://luma.com/metropolis-hangzhou-sep-2026
这次杭州站围绕 AI 应用场景 × Agentic Payment × 下一代科技金融 展开。我们不想讲太远的概念,更想把几个具体问题聊透:
Agent Payment 现在到底发展到哪一步了?
哪些场景已经真的能落地,哪些还停在 Demo?
对创业者和 Builder 来说,现在还有哪些位置值得卡?
现场会有正在一线 Build 的团队、投资人,和从 AI、支付、Crypto、金融科技不同方向过来的人。
嘉宾
苏帅|杭州市开源人工智能基金会 秘书长
Jeff|Chief Architect @ Agentonomy
Larry|Investment Director @ Enlight Capital
Will|Co-founder @ Money in Motion
Yiwen|Product Lead @ Newrails
Herbie|Partner @ Hack VC
Monad Foundation 也会到现场,介绍正在进行的 Metropolis 全球黑客松,以及 Monad 生态目前开放给 Builder 的资源。
议程
13:30|签到 & Networking
14:00|开场致辞
14:30|Metropolis 黑客松介绍
15:20|分享:从「会思考」到「会交易」——Agent Payment 的可信闭环
15:30|Panel:关于智能体经济你不知道的事
16:15|茶歇 & Networking
16:30|Builder Demo / 黑客松项目展示
17:30|自由交流
不只是来听,也可以把项目带过来
这次特意留出了 Builder Demo 的时间。
如果你正在参加 Metropolis,或者最近刚好在做 AI Agent、Payment、Trading、Fintech、Crypto Consumer 相关的产品,都可以把项目带到现场。哪怕只是个很早期的 Demo 也没关系——现场展示,听 Builder 和 Mentor 的反馈,也可以直接和投资人、生态团队、潜在合作方聊。
线上聊一个星期,有时候不如现场 Demo 五分钟。
Metropolis 全球黑客松进行中
Metropolis 是 Monad 的年度旗舰黑客松,为期 6 周、线上优先、面向全球 Builder 开放(2026 年 9 月 1 日 – 10 月 13 日),总奖金与资源超过 $250,000。
四大赛道:
💻 链上金融与交易
围绕高速结算环境下的新型资产原语、市场与交易基础设施展开探索。
包括预测市场、Exotic Options、RWA、参数化保险,以及更多利用高性能链上环境实现的新型金融产品。
💵 消费产品与支付
探索真正面向消费者的链上产品体验,让 Crypto 能力逐渐融入产品本身,而不是成为用户使用产品的门槛。
包括社交支付、可编程礼物、工资流支付、微型保险等方向。
这里关注的不只是金融机制,更是用户真正愿意使用的产品体验。
🌐 社交、注意力与文化
探索开放社交图谱、Feed 算法、注意力市场、TCG、生成艺术,以及更多围绕社交关系、社区与数字文化产生的新型应用。
当价值、注意力和社交关系都可以在链上重新组合,新的产品形态也将随之出现。
🔄 信任、身份与 AI 基础设施
面向 AI-native Internet,探索下一代信任与身份基础设施。
方向包括 Proof of Personhood、Content Passports、Data Lockers、Cross-app AI Memory 等。
Builder 也可以围绕 Monad 的 P256 / WebAuthn、ERC-8004、Encrypted Mempools 等能力进行探索,构建能够被其他应用与开发者进一步使用的基础设施。
全场总冠军 $30,000,另设多个 Bounties 与 Credits。
线上黑客松与线下活动独立进行,可以只参加其中一个,也可以两边都参加。
monad.xyz/metropolis
Metropolis 不只是一次黑客松。
在接下来的 6 周里,来自全球的 Builder 将围绕 Finance、Payments、Social、AI、Identity 等不同方向,共同探索一个更重要的问题:
What becomes possible on Monad?
新的市场、新的消费产品、新的社交体验,以及面向 AI-native Internet 的基础设施,都可能从一个新的 Idea 开始。
Metropolis is live. Build What’s Next on Monad.Bolt 推出 Forge 开放模型实验室拟建万亿参数模型Techub News 消息,AI 应用构建器 Bolt 推出 Forge 开放模型实验室,Pro 用户分享匿名数据可在 10 月 14 日前获 50 倍用量提升,数据将用于训练万亿参数开放权重模型。
Forge 目前基于 GLM 5.3 Flash 等开源模型运行,性能与顶尖付费模型差距约 9%。双方已签署数据处理协议,首个万亿参数模型训练预计 10 月启动,输出成果将面向公众发布。(CryptoBriefing)
那个拍出神作《牌子》的AI导演,带着他的巅峰之作回来了。这个正在威尼斯排队准备走红毯,同时斩获了两项AI影像大奖的小伙。
可能很多人都听过他的名字。
DiDi_OK。
前几天,DiDi_OK发了他用Seedance 2.5做的最新作品《Candy》,中文名叫《糖果》,我在看到之后,惊为天人。
直接转发,推荐所有人逐帧学习。
虽然在AI影视圈,DiDi_OK这个名字几乎已经家喻户晓了。
但是可能还是有很多朋友不知道这个名字,但没关系,你大概率也看过他之前的作品。
比如《箭头》、《网站》、《垃圾站》等等等等,而数据最好的,则是在今年2月,那个刷屏的《牌子》。
这个片子,光在B站上,就有2000万的播放,全网更是接近亿级。
我到现在还记得,我第一次看到牌子的那个晚上,在循环了6、7遍之后,我脑子里产生的那个念头:
“明明都是人类,为什么在DiDi_OK面前,我就宛如一个只会流口水的废物,这个人的脑子和审美,到底是怎么长的。”
不夸张的说,这是真实的感慨,DiDi_OK自那之后,也成为了我心中,没有争议的AI影像第一人。
而这次的《糖果》,更是DiDi_OK在这个主持人平行宇宙系列中,把技术和创意,拉到最高潮的巅峰之作。
如果没看过的,可以先看一遍,相信我,你一定会,惊为天人。
不像现在很多烂大街的油腻无比的AI作品,《糖果》依然有很强的Di味。
有一些高维规则的展开,有一些SCP的感觉,又有一些黑镜的意味。
甚至还有刘慈欣的影子。
当然,还有极强的叙事节奏、镜头语言还有他的审美。
所以这次《糖果》发布后,我觉得,是一个机会了。
我想找他聊聊,跟他做一个小小的专访,聊聊他的一切。
因为他人在国外,这几天又在威尼斯电影节领奖,所以我们还是有一些时差的,在碰了两天之后,我们终于约上了。
访谈那天,北京上午10点半。
他人在黑山,那边凌晨4点半,他起了个大早,因为6点多还要出发去山里。。。
我们痛快的聊了快2个小时,问了很多我想知道的问题,聊完之后,我觉得,我一定要把这些东西写出来,也给大家分享一下。
那接下来,我们,开始吧。
一. 他迎来了AI的时代
DiDi_OK,是一个非常有趣的人。
现在长期在伦敦,在WPP Production工作。
WPP是全球最大的广告与营销传播集团之一,大家耳熟能详的奥美,其实就是WPP的子公司...
而WPP Production是WPP旗下最核心的制作团队。
所以在AI出现以前,DiDi_OK就一直在做动画、3D和游戏相关的工作了。
他的本硕都是动画。
后来进入WPP,也先从动画做起。
他去英国的故事也特别有意思。
他那时候,还在国内跟朋友开工作室挣钱,反正就是拍些广告啥的。
他做着做着,然后就突然觉得,这事没意思。。。
有一天下午,他们甚至还在外面拍广告。
他突然问朋友:要不出国吧?
朋友问他:去哪?
他说:要不然英国吧?
去英国的原因也究极离谱,
因为他们以前拍完片,半夜会一起看影视飓风,Tim也是DiDi_OK的赛博偶像。
然后呢,Tim以前在英国。。。
那不如就英国吧= =
然后他真的回家学了半年英语,申请伦敦艺术大学。
他妈一开始甚至没帮他报,因为觉得这死孩子绝对考不上。
最后他自己还是偷偷报的,结果,还真考上了。。。
几年以后。
这个当年拍完广告半夜看影视飓风的小伙,受Tim邀请,坐到了影视飓风的AI课程里,给大家分享自己的创作心得。
你看,世界总是一个奇妙的圆,人生有时候也真的特别像一个写得有点俗的剧本。
在AI之前,他其实就已经开始在创作了。
2021年,他在伦敦艺术大学做过一部《Moth》。
而且那个时候,就很有Di味了。
一个被雾笼罩的封闭世界,中央有一座巨塔。
所有人都觉得那里绝不能碰,可主角却像飞蛾扑火一样,一定要上去。
哪怕真相让人失望,哪怕会死。
也想看一眼,世界真正的样子。
他脑子里,关于科技、关于未知世界、关于文明的东西,实在是太多了。
但是在过去,卡住他的,是那个时代的生产力。
传统动画的工作流程实在是太长了,几乎不可能有一个人独立制作一个影片的可能。
流程一多,人就多了一些,每多一个人,你脑子中的想法,变成语言传达出去,就会损耗一点。
而再经历建模、绑定、动画、后期等等等等的流程,那就是损耗损耗再损耗。
到最后,你脑海中的那个idea,那个会让自己兴奋会让自己起皮疙瘩的创意的东西,落在最终屏幕上的时候,可能连一半也不剩下了。
所以,他这些年,因为损耗,也一直在研究一个东西,用他的话说,那个东西叫:
力道。
怎么让自己脑海中的创意和感觉,尽可能最低损耗的传达给观众。
而终于,他等来了他的时代。
AI,来了。
二. 《糖果》:坏人会爆炸
如果让我介绍《糖果》。
我可能会认真解释半天:
这是一个关于一级文明、外星规则、暴力、秩序、人性和科技发展的科幻故事。
但是呢,我让DiDi_OK解释,他自己想了想,只用了十个字左右:
“坏人会爆炸,好人就没事。”
极其的朴素,但又精准。
这个故事一开始,人类能源使用能力抵达一级文明的门槛了。
然后土星的一颗卫星,叫“潘”。跑到了地球附近。
接着,全世界开始发生一件特别离谱的事。
只要一个人准备伤害别人。
砰,就炸了。
这个爆炸,不会变成血肉,会变成:
一大堆糖果。
一开始,大家都懵了。
外星人?新型武器?上帝?
后来慢慢发现,这个规则只专门针对:
暴力。
DiDi_OK给它设定的底层判断标准也非常的中国味。
就是四个字,起心动念。
这个片子上线之后,我看了4遍,我当时问了他一个我看的时候,感觉非常矛盾的一个话题,这好像,明明是一个反暴力的故事。
可大家看的最大的爽点,却是看坏人被另一个更强大的力量给干掉。
那这件事,本身就不暴力吗?
DiDi_OK当时就笑了,说你看到了精髓,而且,这其实就是他故意的。
片子后来把反复违反规则的人送去月球。
看起来仿佛太好了,文明和平了。
可这件事情背后,却一样带着群体暴力。
所以他甚至花了很长时间设计片子里代表大众意见的女性发言人。
他想让她拥有一种特别容易被大众接受、信任的气质。
有点像《三体》里的程心。
因为这件事情本身就带着一种“所有人都觉得这一定是对的。”的危险。
DiDi自己也没有站在绝对非暴力那一边。
他觉得现实里常有一个很残酷的问题:
善良的人,往往就是被欺负的人。
所以从中世纪的西方骑士到中国的侠客。
人类几千年一直在幻想一件事:
正义最好拥有力量。
于是这个时候,《糖果》的内核变得不一样了。
一颗外星卫星拥有判断什么是恶的最终解释权,全人类因为恐惧惩罚而文明,然后大家集体同意,把不符合规则的人送去月球。
这到底算文明?还是秩序?又或是暴政?还是一个比我们现在稍微好一点的世界?
DiDi_OK没有答案。
这个问题,属于每一个观众。
三. AI的真正进步
访谈之前,我把《箭头》《牌子》《网站》《垃圾站》等等DiDi_OK的片子又重新全部拉了一遍。
其实有一个最明显的变化,就是《糖果》这部片子,因为用的Seedance 2.5,所以终于敢变慢了。
比如这个教科书级别的长镜头。
讲道理,以前DiDi_OK的片子还是经常会快切的,比如《箭头》和《牌子》,经常5秒就会换一个场景。
理由特别简单,AI影像行业里的大家,可能都猜到这个现实原因。
因为你不敢慢,因为模型能力,完全达不到。
过去的模型能力,是无法支持长镜头的细节不变的这种镜头叙事的。
于是呢,就只能不停用新的视觉刺激,把模型来不及暴露的问题给掩盖过去。
但是《糖果》里,第一次出现了大量安静的叙事。
比如这个镜头。
实验室里,一个年龄稍大的官员往前走。
旁边年轻研究员一路跟着,态度非常谄媚,期待被注意。
但是官员一直很冷,直到突然搭理了他一句。
那个年轻人的身体立刻微微再弯了一点,眼神亮一下。
这时候,你能看出来:
“诶,他听到我说话了。”
但DiDi说,这才是他觉得模型真正突破的地方。
表演。
以前他一直觉得AI表演过不了,那些表演的细节度不够,所以,一直会少这些叙事。
现在Seedance 2.5在他眼里,这个鸿沟已经正式跨过去了。
开头那个女孩吃糖的镜头也是。
他特别在乎女孩脸上那个小痘痘。
我甚至第一次看的时候,都没有注意。
但是对DiDi_OK来说。
这是一个极其重要的信息锚点。
因为这个极小的信息点,会让观众第一眼看到的时候,会觉得,这是一个真实存在的人。
当演员的脸本身可以提供信息的时候,导演才敢把镜头停在那里。
还有这个手指甲超近特写下,皮肤和指甲的质感。
还有这个超近景特写中,角色呈现出来的高精度皮肤微观细节,包括毛孔、细纹、皮脂光泽及受光变化;同时细微表演如眼神、呼吸、肌肉牵动与微表情均具备可信度。
而这一点,DiDi_OK说,这种细节度和精细度,只有Seedance 2.5才能达到。
他觉得,这个模型,至少给他省掉了60%的叙事成本。
这个词我特别喜欢。
大家天天聊AI降低多少制作成本。
他聊的,是叙事成本。
我觉得,真正改变叙事的,从来都不只是所谓的分辨率更高或者价格更便宜。
是我们过去你只能绕着模型的缺陷去讲我们的故事。
但现在,模型开始允许我们,按我们脑海中的想法去讲故事。
这才是,真正的进步。
四. Seedance 2.5改变的一切
对于Seedance 2.5这个模型,我们聊了很多。
DiDi_OK说,假如现在有人告诉他。
以后这辈子都不会再有新的视频模型。
只能永远用Seedance 2.5。
他觉得,也够了。
因为坦率的讲,从我的视角看,Seedance 2.0发布的时候,全网的反响远比这一次2.5大。
但那时候,DiDi_OK觉得,2.0还可以,确实震撼,但是好像没有那么大的变革。
直到这次Seedance 2.5。
可能很多人第一眼觉得,啊?不还是AI视频吗?跟2.0区别也不是很大啊。
但是DiDi_OK觉得,这反而是一次真正意义上的跨时代升级。
我问他:到底跨在哪?
他说了两个词。
高度定制化。
高精度的运动规律。
这两个词听起来特别技术。
尤其“运动规律”,实在是没有所谓的“电影感”“1080P”“一镜到底”听起来性感。
但观众的眼睛特别诚实。
比如一辆车拐弯,车身应该有侧倾,悬挂应该有压缩,刹车和加速应该产生不同的俯仰。
一颗糖从人体里面炸出去,它应该有质量,有初速度,撞到东西以后会反弹,几百颗糖之间还会互相碰撞,跟镜头的距离不同,虚实也不一样。
所谓运动规律,其实就是:这个世界到底符不符合我们从世界认知到的物理规律。
所以《糖果》里面那个最核心的“糖果爆炸”,其实也是AI能力的一次极限测试。
DiDi_OK说,现在Seedance 2.5出来的视觉,已经可以经得起慢放和暂停了。
他甚至故意设计那种让大家来暂停看看的镜头。
就比如警察局的这场戏,画面里面同时有很多人,DiDi_OK给后面一个黑人角色单独设计了一条故事线。
先挣脱、然后推桌子、拿起电视,再准备攻击警察,随后灯光闪烁,所有人的动作短暂停顿,特定的人同时炸成糖果。
DiDi_OK借助模型的能力,同时指挥十几个人的动作,每个人都有自己的故事线。
这就是DiDi所谓的第二个特点,定制化。
因为过去,我们用AI做一个怪兽啥的,其实真的都不算难。
难的东西往往都很日常,比如“让左边第三个人先往后看。然后拿起电视。右边警察继续保持现在动作。灯闪以后第二个人爆炸。”
AI真正进入工业生产以后,最需要的能力,恰恰是这种定制化。
DiDi_OK说,从画面上,他感觉,几乎没有什么是他想实现,但是实现不了的了。
比如一堆糖果组成马蒂斯的《舞蹈》。
微缩景观下的移轴动画。
等等等等。
因为模型能力的增强,运动规律和可定制化都变得极强,所以也带来了另一个变化,过去的工作流很多就有点跟不上版本了。
比如过去,为了一个镜头,可能要垫好几张图,来让模型理解。
所以,他说那时候,他有一个很明确的优先级:
参考图,大于提示词,大于模型选择。
甚至为了让模型完成它能力本身完成不了的动画和运镜效果,他会大量使用Blender来建模进行参考。
比如角色和表面之间的运动追踪,就像手机屏幕上的字,以前AI生不准。那就一个字一个字追,全是后期进行人工修复的。
基本就是能工智人。
本质上很简单,都是因为模型能力达不到,而DiDi_OK又不想降低自己的作品效果,就会用很多其他手法来进行弥补。
然后,就来到了《糖果》。
他说,这套逻辑明显开始反过来了。
参考图的重要性明显下降。
Prompt的重要性开始疯狂上升。
因为模型理解能力变强了。
很多过去必须先做好的关键帧才能做的动画,现在可以直接用嘴说了。
所有的传统辅助是一个没用,很多过去要额外做两个星期的后期,也消失了。
DiDi_OK说,这是他第一个,几乎百分百纯度的AI片子。
甚至他用上Seedance 2.5之前,他已经用2.0做了3分钟的《糖果》了,做了将近40%,在他用上2.5之后,毅然决然,全部推翻重来。
这也是这个AI时代非常操蛋的一点。
你的苦心经营的半年的技巧,还有很多所谓保持一致性的工作流,可能就会被一次模型发布直接吞噬。
DiDi_OK说,那些都属于小数点后面的技术,他现在也越来越没有兴趣了,真正决定你上限的,还是你的个人能力,还有模型本身的理解力。
当模型开始吞掉工作流。
创作者剩下来的,才是真正属于创作者的东西。
五. 创作到底是什么?
我问DiDi_OK:“你觉得AI真的能算创作吗?很多人说,不就是抽卡吗?创作在哪里呢?”
他给我讲了一个特别好的例子。
2023年,他参与过一个F1赛车宣传片,实拍加虚拟制作。
那时候,很多镜头可能要NG500多次。
一天光场地费,就是10万英镑。
赛车漂移过去,轮胎擦地,然后烟冒出来了,导演觉得,那个烟不好看,再来。
所有调度一切归位,然后再来一遍。
就这样,不断的Roll,不断的挑选。
直到导演觉得,这个第397次的烟最好,就用这个第397次的镜头。
所以,DiDi_OK说,创作,从来都不是生成多少次的事,也不是AI不AI的事,因为本质上,传统影视,也是抽来抽去的逻辑。
真正的创作,是那个“不要”。
为什么这个导演,要第397次呢?前面那396次,为什么都不要呢?
这个“不要”,才是审美,才是判断,才是经验,才是那个真正的。
创作。
只不过,在AI加持之下,抽卡的速度变得越来越快,质量越来越高,是以前的传统影视,远远不可企及的。
但是反常识的是,模型越来越强以后。
DiDi一点都没有更轻松,反而更痛苦了。
过去一颗8秒镜头,磨两三天就差不多了,因为你知道,模型就那样了,上限就在那,可以安慰自己,这不是自己的问题。
但现在,有了Seedance 2.5这种级别的模型,第三次就能给你一个特别牛逼的结果。
那说明,它能做。
这时候,压力就全部给到DiDi_OK的身上了。
为什么我调度不出来?
为什么没想到那个机位?
为什么还不够好?
以前两三天一个镜头,现在他甚至可能磨一个星期。
他说:
“模型是明显能做到的,但是我却做不出,那明显就是我自己的问题,我还是太菜了。”
AI时代,也是一个残酷的时代。
当表达成本越来越低的时候。
平庸也会越来越没有借口。
聊到最后。
我问了他一个特别大的问题:“你拍了这么多文明、规则、社会、人性的东西,那你自己心里最底层,还相信人类吗?”
他说:“如果聊人类本身,那我一定是一个极度的悲观主义者。”
他说自己有时候,会陷入很严重的存在主义危机。
当AI真的能帮你完成越来越多事情的时候。
你自己到底还剩什么?
他公司里的新人也经常问:
老师,以后应该学什么?
他也不知道。
然后,他说出了我觉得整个访谈里,我最动容的一句话:
“当AI能帮我做所有事情的时候,我到底,是否真的是一个有意思的人呢?”
没有答案,就像他的作品一样。
写在最后
访谈结束以后,我又把《糖果》看了一遍。
我突然觉得,这部片子更好懂了。
DiDi_OK明明说自己对人类这么悲观,可他的作品里,总是有一种特别奇怪的底色:
希望。
突然感觉,在他的身上,我看了三体里面一个角色,就是维德的影子。
他可能平时不是特别愿意跟人互动,甚至对人这个物种有时候有一些悲观判断,可到了最后,他跟维德一样。
不希望人类输。
我特别喜欢这个矛盾,因为很多伟大的创作者,很多时候就是这样。
他们创作。
很少因为觉得这个世界已经很好了,恰恰是觉得它还不够好。
所以才会创造另外一个世界。
那个让很多人,能跟他一起感受美好的。
美妙世界。特朗普在 CLARITY 法案投票前同意加密道德方案Techub News 消息,美国总统特朗普在 CLARITY 法案投票前,同意了一项更严格的加密道德方案中的大部分条款。
该方案旨在规范官员在数字资产领域的利益冲突行为,为法案表决创造更透明的环境。CLARITY 法案作为美国加密货币监管立法的重要组成部分,其投票进程受到行业广泛关注。(CoinDesk)Blockworks 发布第五批 B-1 文件,披露总数达 161 项Techub News 消息,Blockworks 发布第五批 B-1 文件,其代币透明度框架披露总数增至 161 项。该框架通过标准化代币经济及风险信息,为投资者提供类似 SEC 招股说明书的自愿披露参考。
该框架于 2025 年 6 月启动,即使发行方未参与也会基于公开数据编制基线记录。其 8 月推出的 RapidFile 工具可简化提交流程,该公司已与 SEC 及 CFTC 就透明度标准展开沟通。(CryptoBriefing)
国产大模型苦达利奥久矣文章转载于八尺AI
昨天Anthropic的创始人达利奥·阿莫迪在个人博客上抛出一篇长文,标题叫《我们必须掌控AI前沿发展的节奏》。
文章写得声情并茂,从他父亲死于一种本可被AI攻克的疾病讲起,一路讲到递归自我改进可能在六到十二个月内,让失控的AI Agent接管互联网。
这看上去是一篇充满人文关怀的AI安全宣言。萨姆·奥尔特曼在下面回了一句"我同意达利奥",马斯克也凑过来喊"Dario is right"。三个平时连合影都不肯站一起的人,这次竟尿到一个壶里了。
但如果你把文章翻到后半段,就会发现味道不对了。达利奥在"如何给前沿踩刹车"的章节里,专门列了三条针对中国的遏制措施,禁售芯片,打击蒸馏(原文写的是“人工智能技术提炼”),防盗权重。
一条技术限速的倡议,说着说着就变成了一份对华科技冷战的操作手册。
而就在这篇长文发布的两天前,Anthropic刚刚发布了一份长篇威胁报告,点名七家中国AI实验室,阿里、月之暗面、DeepSeek、智谱、小米、商汤、MiniMax。指控它们对Claude发起了"工业规模的蒸馏攻击",累计交互接近两亿次。
两件事挨得这么近,是巧合吗?恐怕不是。
当一家估值逼近万亿美元,正在冲刺史上最大IPO的公司,开始把一项全行业都在用的常规技术包装成"国家安全威胁",那就得问问,达里奥的动机到底是什么。
1
蒸馏的身世
要说清楚蒸馏是不是偷,得先搞清楚它到底是什么。
2015年3月,杰弗里·辛顿、奥里奥尔·维尼亚尔斯、杰夫·迪恩一起在arXiv上发表了一篇论文,标题叫《神经网络中的知识蒸馏》。
这篇论文讲了一个很朴素的道理,一个大模型(教师)学到的知识,不只是它的参数,更是它对输入做出的概率分布,也就是"软目标"。把这些软目标拿来训练一个小模型(学生),小模型就能用远低于大模型的算力,逼近大模型的表现。
辛顿在论文里甚至明确说,用来训练学生模型的迁移集,可以完全由未标注数据组成。
换句话说,蒸馏从诞生的第一天起就是一种合法的,公开的,被学界广泛认可的模型压缩与能力迁移方法。它的初衷是让AI能跑在手机,嵌入式设备这些算力有限的场景里。
辛顿本人拿这个方法改进了谷歌的语音识别系统,效果显著。
十一年过去了,蒸馏早已不是什么小众技巧,是大模型行业的基础设施。
2024年10月,OpenAI直接在API里上线了官方蒸馏功能,鼓励开发者用o1-preview和GPT-4o的输出来微调更便宜的模型。
Google把Gemini Ultra蒸馏成Gemini Flash,主打低延迟场景。Meta开源Llama,整个社区都在拿它做蒸馏。DeepSeek用R1蒸馏出32B、14B、8B、1.5B一整套小模型,让推理能力能跑在消费级显卡上。
就连Anthropic自己,也在内部用蒸馏生产轻量版的Claude。这不是什么秘密,行业分析公司Ertas AI在一篇题为《模型蒸馏不是盗窃》的文章里写得很清楚,每一个拥有前沿模型的实验室,都有从它衍生出来的更小模型。
蒸馏在AI领域扮演的,正是这样一个"善假于物"的角色,它让知识从昂贵的大模型流向更普惠的小模型,从少数公司的算力壁垒流向更广泛的应用场景。
那么问题来了,为什么同样一项技术,OpenAI做叫能力迁移,Google做叫模型压缩,Meta做叫开源生态,中国公司做就变成了工业规模的蒸馏攻击,和重大国家安全风险?
这个双标,比蒸馏本身更值得玩味。
1
达利奥的叙事术
达利奥为何要把蒸馏上升到国家安全的高度,得先看看他是怎么叙事的。
在《我们必须掌控AI前沿发展的节奏》这篇文章里,达利奥用了一个非常经典的话术结构,先建立一个所有人都无法反对的大前提,AI发展太快,需要安全。
这套逻辑就是,我可以限速,但你不能趁我限速的时候超车。
而蒸馏,就是他用来证明"中国在偷跑"的核心证据之一。其次就是芯片,不过老黄暂时还没搭理他,可能也不打算跟他尿一个壶里。
Anthropic的报告写得煞有介事。七家中国实验室使用"欺诈账号池、住宅代理、一次性邮箱、虚拟支付"绕过风控,大量提取Claude Opus的思维链(CoT),而不只是最终答案。
阿里一家在五到七月就搞了1.51亿次交互,动用了3500多个欺诈账号,日峰值接近300万次。
这些数字看起来很吓人。但你只要稍微多想一层,就会发现不对劲。
第一,如果这些交互真的是"欺诈",为什么Anthropic的风控系统没能在第一时间拦截。1.51亿次交互,3500个账号,持续三个月,这不是什么隐秘的黑客攻击,是在你家门口摆了个摊位,你收了三个月的钱,然后说对方是小偷。
Anthropic在这些交互中收了多少API费用,报告里没提。
第二,思维链(CoT)到底是不是"偷"?CoT是模型在推理过程中产生的中间步骤,用户通过正常的API调用就可以获取。如果Anthropic不想让用户看到CoT,它完全可以在API层面屏蔽。它没有这么做。
第三也是最关键的一点,违反服务条款和违反法律是两回事。Anthropic的API服务条款里可能写了禁止批量生成训练数据,但这是一个民事合同问题,不是刑事犯罪,更不是国家安全威胁。
如果中国公司真的违反了条款,Anthropic可以封号、可以起诉、可以索赔。但它选择了最有戏剧张力的一条路,发布威胁报告,把商业纠纷包装成国家安全事件。
这种叙事术并不新鲜。历史上,每一次技术霸主面对后来者的追赶,都会祭出"国家安全"这面大旗。
十九世纪的英国面对美国的工业崛起,曾试图禁止纺织机械和技术工人出境。二十世纪的美国面对日本的半导体追赶,曾用"国家安全"为由强迫日本签署《广场协议》并限制半导体出口。
桑弘羊在《盐铁论》里说过:"欲粟者务时,欲治者因势。"霸权国家的国家安全叙事,从来都是因时而动,因世而变的。当它领先时,它讲自由贸易,当它被追赶时,它讲国家安全。
达利奥的高明之处在于,他把这套旧叙事装进了AI这个新瓶子里。他构建了一个完整的逻辑链条,从蒸馏让中国公司用极小的成本缩小差距,到差距缩小威胁美国的AI领先地位,到AI领先地位关乎国家安全,最后到蒸馏是国家安全威胁。
细细想,这个链条的每一环都似是而非。蒸馏缩小的是工程实现上的差距,不是基础研究上的差距。中国大模型的进步主要来自自身的研发投入和算法创新,蒸馏只是其中一个环节,AI领先地位是否直接等同于国家安全,本身就是一个值得讨论的命题。
但达利奥不需要这个链条在逻辑上无懈可击,他只需要它在情绪上足够有说服力,"国家安全"这四个字,本身就是情绪的核武器。
有意思的是,达利奥在文章里大谈"民主国家"应该联合起来,但他自己的公司最大的投资方之一是谷歌,而谷歌在中国市场有大量的业务和利益。
他谈打击专制国家的蒸馏,但对美国国内公司之间互相蒸馏的行为,比如OpenAI曾用Anthropic的输出训练自己的模型这类传闻,却只字不提。
1
两万亿IPO前夜的表演
达利奥在这个时间点发难,可谓司马昭之心。
2021年,达利奥带着一群前OpenAI研究员出走创立Anthropic时,公司估值只有55亿美元。五年时间,这个数字像坐了火箭一样往上蹿,2026年5月H轮650亿美元融资后,公司估值达到9650亿。历史性地反超了OpenAI的8520亿美元。
这还不是终点。2026年6月1日,Anthropic向SEC秘密递交了S-1招股书,正式启动IPO流程。摩根士丹利、高盛、摩根大通联合承销,最快10月挂牌。
投资方给出的目标估值是2万亿美元起步,部分乐观者甚至看到3万亿。如果按2万亿发行,它将超越SpaceX在6月创下的1.77万亿纪录,成为全球商业史上最大的IPO。
要支撑这个估值,Anthropic需要讲一个什么样的故事?
它需要讲一个,AI是这个时代最重要的技术革命的故事,可OpenAI也在讲同样的故事,而且OpenAI的品牌知名度和用户规模都更大。
Anthropic需要一个只有它能讲的故事,而中国威胁,就是这个故事的最佳素材。
当一家AI公司告诉投资者,它不仅在做最前沿的技术,还在保卫西方世界的技术霸权,它的估值逻辑就变了。它的竞争对手不再只是OpenAI和Google,是整个中国的AI产业。
这个故事对华尔街有致命的吸引力。
因为它把一个高度不确定的技术赌注,包装成了一个地缘政治的必然选择。不管AI技术怎么发展,不管哪家公司的模型更强,民主国家需要一个可信的AI供应商,这个需求是确定的。
而Anthropic正在把自己打造成这个需求的唯一答案。
达利奥可以给他的前沿踩刹车,但他踩不住整个行业的车轮。两万亿的估值故事讲得再动听,最终也要回到一个最朴素的问题,你的模型到底好不好用。
如果中国的开源模型以十分之一的成本提供接近的能力,全球开发者都会用脚投票选择更开放、更便宜的方案,所有的叙事和指控,最终都会被市场的现实消解。
毕竟,资本市场可以为叙事付溢价,但用户只为产品买单。
实测最新版「豆包手机」助手:所有手机里的AI都该变成它这样作者|王兆洋
微信|Geisterspiele
豆包手机助手消费者版今天正式发布。
搭配了它的手机长这个样子:
搭配了豆包手机助手消费者版的努比亚 NaviX Ultra 将在 9 月 16 日发布
和预览版相比,官方对这个助手的定位显然变化:这是一个面向量产,面向广大消费者的产品。也就是说,它不再只是一个原型机了。
在此前第一次亮相时,豆包手机助手引起了不小的波澜,它以 GUI 为主的技术路线给既有的一切都带来了新思路,让所有人开始思考模型越来越强后,手机会变成什么样,过往我们已经习以为常的以 App 为主的交互方式又会变成什么样。
所以当豆包的朋友找我说要不要提前体验下这个产品时,我立刻答应下来。我对它充满了好奇,和初代的实验属性不同,这个要真正量产,大规模提供给广大用户的产品,究竟做到了什么程度?
现在正式官宣之后,也终于能跟大家分享这段时间提前使用它的感受了。
1
万能对讲机
豆包手机助手消费者版和硬件做了很多融合设计,比如第一时间拿到这台机器,从外形来看,最明显的就是侧面的 AI 键。是的,你可以用它唤起豆包助手。
在我之后的各种使用里,这个 AI 键成了我和这台机器交互最主要的方式。
比如,当我让豆包自动去飞书发送会议邀请时,我的操作过程是,在锁屏状态按住 AI 键直接呼出豆包,语音告诉它去给我们的飞书群发一个会议邀请。
因为这个小小的 AI 按键配置了指纹识别功能,手机识别指纹后可以给豆包助手相关的更高权限。所以不需要屏幕解锁,只要是 AI 键识别了你的指纹,它就在后台开始一顿操作,然后很快就完成了任务。
后来我还顺便让它去看了看我飞书上昨日在内容部门等几个核心工作群里的记录,给了我一个待办列表。这些都是很多人日常工作的常态,而整个过程丝滑无感。
这种按住说话,然后事情就完成摆在你面前的感觉,的确改变了人们对手机的交互方式的预期。
而且在使用了一段时间,用这种方式处理了诸多类似任务后,它成了我下意识会去使用的交互方式。
任务解决的完成度越高,这种新交互“习惯”养成的顺滑度也越高,我不自觉的去按这个按钮的频率,可能真不亚于人们接受 iPhone“发明”的滑动触碰交互方式的速度。
这是个融入了硬件的 AI 交互。这不免让人想起当年苹果早早在 iPhone 17 的侧面就放了一个“快门”按键,为后来的苹果 Intelligence 先占了坑,然而后面的故事有点变成笑话。
我感觉人们眼里苹果本该给这个按钮打造的功能,应该就是豆包二代的这个样子。
这种按住说话的交互给我的感觉,像是我在拿着一个万能对讲机。
这会让人想不停探索这个对讲机能搞定的事情。
我也试了几个我一直想做的,“一句话完成各种 agent 任务”的能力。
比如,我直接通过语音,让豆包助手去自己操作手机,调用底层能力,跨 App 操作,完成了一个 vlog 剪辑工作。
我“口喷”的提示词(其实就是想到哪说哪)很简单:
把我相册里不超过 20 秒的视频,按照《午夜巴黎》开头的那个空镜的组合的方式去剪辑成一个 vlog, 保留视频本身的原声音,然后再配一个同样同款的 BGM。
以下是它给我的结果:
可以看到这个指令涉及多个复杂环节,它涉及对一部电影的某个含糊表达的具体部分的理解,涉及对我意图的判断,和对手机上可以调用的 App 的选择,以及,自动操作手机的能力。
而我暗中观察了它操作的过程,这些难点都一一顺滑实现。
这是个我一直想做,但因为我从来没用过剪映没怎么剪过视频,而一直没做的任务。现在,只要我手机里有这些素材,就真的能“张张嘴一句话”完成了。
这些体验下来,你很难不觉得这个手机就像一个从哆啦 A 梦兜子里拿出来的万能对讲机。
另外,在这个任务里,还可以看到豆包手机助手在 AI 层面不少核心设计思路。
豆包手机助手预览版最引人瞩目的就是自动操作手机的能力。但也是引起最多争议的能力。这一代在操作不同 App 的方法上,也引入了类似 MCP 的方式。基于软硬件结合的设计,豆包手机助手底层的打通程度更深,大模型可以调用电话、日历、闹钟、飞书等底层工具的能力来完成任务。
而自动操作手机的能力继续以 Beta 版的形态保留。当你在设置里打开,它可以在一些任务里通过模拟点击和调用工具的方式来帮你操作手机上的各类应用。操作可以在后台进行,不影响用户正常使用手机。
在这个任务里,可以看出它对手机本身的相册的底层调用,对 App 的 GUI 点击操作。这些能力目前主要会支持一方应用和字节系相关产品调用。
这也是外界最关注的能力之一,而在这一次发布的同时,豆包手机助手也一起推出了一个新的协议:SAEP,也就是屏幕自动化操作声明协议(Screen Automation Execution Protocol)。
它给了第三方应用选择权,应用可以自主选择允许或拒绝 AI 助手在应用内执行屏幕自动化操作。
同时,它也允许开发者们申请和接入协议。
发布之日起,豆包手机助手也启动了为期 30 天的规则公示:
“公示期内,豆包手机助手仅对系统自带应用、字节跳动旗下应用,以及已经通过 SAEP 或邮件明确同意接入的第三方应用执行自动化操作,其他应用默认不操作。”
我还用了用豆包“替你接电话”的功能:
在设置里,你可以设置它接听的范围,接听的策略。我给了它所有权限,然后用自己的另一个号试了试,再然后,我就……忘记了自己开通了这个设置。
直到有天在车上,我突然看到手机自己开始对话起来,低头发现是豆包在替我接电话。
有意思的是,这个电话听到后面,我才意识到,对面也是 AI。
深度的使用了一段时间后,我发现它的很多功能都已经很强,也比较稳定。而这是任何一个有野心彻底重新建立起一套交互习惯的产品,必须做到的前提。
按照官方给出的数据是,这一代相比此前,整体可用率提升至了 80%。
这些能力已经足够神奇,但在个人 agent 类产品过去一段时间快速的在用户里渗透后,它们似乎多少还有些“常见”。
而我对这款产品更大的期待和好奇,是它能不能更加接近一个真正的个人助手,甚至,私人助手的状态。
也就是它开始在这些常规任务之外,能更深入你个人的 context,解决一些你自己定义的需求。
而在边用边查看它在技术工程上的创新点后,我突然意识到,有一个我嘀咕了一年却一直没实现过的功能,可能终于可以做出来了。
1
胡适日记 AI
2025 年我发过一条朋友圈。
要完成“根据我过去一年的照片的地理位置信息,告诉我过去一年都在哪些地方游荡,分别待了多久”这个任务,其实每一个零件都是现成的。照片有 EXIF,EXIF 里有经纬度和时间戳,地图能把经纬度翻成地名,模型能把这堆结构化数据写成人话。没有任何一环需要新技术。
我常年在外面跑,一年下来去过多少城市、见了多少人,到年底一复盘,全忘了。可这些信息全都躺在这台设备里——几千张带 GPS 和时间戳的照片,排得满满的日历,便签里塞着的机票截图和随手记。
但之前这些信息都是“死”的。
过去一年里我试过第三方 App,试过云端模型,全都卡在同一个地方:拿不到东西。没有一个第三方应用能顺畅读完你整个相册的位置信息,你得一张一张传;没有一个助手能自己跳去日历、跳去便签、跳去读书 App 把材料凑齐。想做一次完整的复盘,先花两三个小时在十几个软件之间复制粘贴——那还不如不做。
模型早就够用了。卡住的是权限和接口。没做的是具体的工程工作。
当时诸多 AI 硬件都在追逐着某种“模型原教旨主义”,试图让模型来接管一切手机和硬件产品的操作。
但我的这种需求并不是要模型来单独搞定,而需要模型、硬件底层、工程等一起协同设计解决。
所以在用了一段时间豆包手机助手消费者版后,我终于把这个需求扔给了它。
第一版指令很简单:根据我相册里的图片来告诉我这两天我在哪里,做了些什么?
几秒钟出结果。准确,完整,有据可查。这一步在过去没有任何设备替我做到过。相册、定位、时间戳,第一次真的被一个助手完整读了一遍,不用我传,不用我导,不用我在十几个软件之间来回捣腾。
但我对着结果看了一会。我发现这本质还是只是把我的数据念了一遍给我听。
读完之后,最大问题是我没觉得它更懂我。它做的还是检索和罗列,我自己想了想,我其实想要的是理解和呈现。
那怎么搞,其实能想到的直接方法也简单,就是提示词再改改。但过去的经验提示,这样去操作其实会很随机,有时效果好有时不好。
如何让这个手机上的 AI 助手能更懂你,最好就是一个安全可控的记忆系统。
说直白一点,记忆这一层夹在你和模型中间。模型本身是不记事的,每次任务都从零开始;而手机里的数据又太多太杂,全塞给它也没用。豆包这次把能记的东西分成了三类。
第一类是你手机里本来就有的存量数据——录音、联系人、相册、短信、便签、日历。这些东西一直都在,只是从来没有被完整读过。主动授权之后助手可以调用,为此他们专门配了一个本地搜索工具,负责在这堆存量里检索和找回。
第二类是你主动告诉它要记的。给助手发一条记忆指令就行,灵感、购物清单、待办都算。
第三类是你日常刷手机时顺手“收”的,豆包手机助手提供了诸多入口:语音(对手机助手说记一下),AI 按键,组合键,快捷手势(三指上滑就能把屏幕里的内容保存进记忆),截图(截完点一下「记忆」,长截图也支持)等。
此外还有一层单独的,也就是个人 context。
它有两个来源:一是你主动提供的、希望被记住的信息,比如常用地址;二是豆包在跟你对话过程中自己学到的偏好,比如口味、习惯。这些不会作为一条条"记忆"摆给你看,而是沉淀下来,在后续任务执行的时候当上下文用。
我感觉是豆包把这手机本身作为一个大模型,给它做了一整套新的 harness 系统。
于是我决定在这个记忆系统里简单操作一下。
我想了想我要它怎样来记录或者说描述我,想了想,也许就像让 Her 里的 Samantha 来描述西奥多。
然后我想到了胡适和他的日记。
既然这是一个有点日记意味的功能,那当你想要记录今天的生活,看着这个全世界不停发生“见证历史”的大事、AI 突飞猛进、但同时每个人其实还是在过着自己眼前生活的时代的时候,总让我想到胡适,想起胡适的日记。
民国乱世,世界打得天翻地覆,他似乎该打牌打牌,该读书读书。一战打得最凶的时候,他在日记里检讨自己最近牌打多了。大时代的惊涛骇浪和一个人细碎的日常揉在一起,读起来让人心有戚戚。
于是!需求到这儿就完整了:
让豆包手机通过理解相册里的图片内容和地理信息,然后用胡适的方式,把我每天的生活细节,和当天发生的行业大事拼进同一篇“日记”里,用最懂我的方式记录日常。
我先让它自己上网搜索并阅读胡适的日记,把其中最符合我所说的感觉的语句加入到长期记忆中去,作为写法的参考。与此同时,它其实也已经根据它的理解,记录了不少它认为适合记录的关于我的个人 context,我很好奇这一切“揉”在一起,产出的“日记”,会是什么样。
然后我对它用语音发出了一个非常随意但繁琐长程的指令:
能不能去看一下我昨天拍摄的照片,然后根据这些照片内容的信息,和尤其是照片在手机里存的这个地理位置信息,结合着一起,然后判断一下我在,我昨天都做了些什么事情。同时呢也去搜索一下当天发生的世界上最重要的的一些新闻,然后呢用你,我之前存过的我非常喜欢的胡适的日记的风格去记录一下我昨天的一些,算是一个小的日记,不用特别长篇大论,然后放到我的便签里面。
说完我放下手机,去倒了杯水。水还没喝完,3 分钟后,手机弹了通知:任务完成,已保存至便签。
说完我放下手机,去倒了杯水。水还没喝完,3 分钟后,手机弹了通知:任务完成,已保存至便签。
我打开这个弹窗:
七月二十一日,星期二
今日在西溪龙湖天街盘桓竟日。傍晚与友人在商场内食寿喜锅,蘸生鸡蛋入口,滋味尚佳。饭后闲步逛店,见玩具反斗城陈设,中庭人来人往,市井烟火气甚浓。晚间驱车返程,至五常港路遇晚高峰拥堵,车窗外灯火连绵,车流如织,伫立良久方得通行。阅今日新闻,英国工党伯纳姆就任首相,十年来英已换七相,政局之不稳可见一斑;西班牙竟在世界杯加时胜阿根廷夺冠,倒是意外之喜;国内上半年工业增加值增百分之五点四,青年失业率回落,也算可喜的消息。世事纷纭,日常的一餐一游,倒是最实在的光景。
看完愣了会。寿喜锅、五常港路的晚高峰、英国换首相、西班牙夺冠。
我的私人生活和当天的世界大事,就这么并排放在了一起。
1
唯一一直在你身边的可能就是你的手机
在“开发”出来这个胡适日记 AI 后,每天一天结束我都会让这个 AI 胡适出来写一写。
操作了几次之后,豆包主动提示可以把它做成一个固定任务。
这样一个我一直想实现的功能就这么实现了,而且它的确让我第一次感觉到一个"手机"能有多懂你。
在快 20 年前 iPhone 诞生的那场发布会上,乔布斯说 iPhone 是三样东西合成一个:一个宽屏 iPod,一部手机,一个上网设备。
他当时没有说、大概也没有办法预料的,是手机的第四个角色。
后来的十几年因为这个东西实在太好用,人们开始把它带去所有地方。吃饭带着,走路带着,睡觉放在枕头边。十几年里,几十亿人把自己拍的、写的、说的、买的、去过的地方,源源不断地倒进了它连着的那张网。
是手机让今天的 AI 真正成为可能。
十几年里,事实上我们一直在往这些设备里写。每个人的一生大多数时候,唯一一直在你身边的可能就是手机。它替你记下了每一个地点、每一顿饭、每一次深夜的搜索。但是从来没有过一个读者。
所以那天那篇日记让我愣住的地方,其实不在于它写得有多好,而在于这些东西第一次被理解了一遍。手机做了十几年的记录设备,现在它多了一个身份,它开始成为一个读者。
当然,没有人愿意用几千张照片、全部行程和通话记录,换一篇写得还不错的日记。它今天之所以能成立,很大程度上是因为这些检索和理解发生在这台设备本身,而不是发生在某个你看不见的地方。二代豆包手机上,这些带指纹识别的 AI 键、留在本地的全局记忆的设定、负责在本机数据里检索的本地搜索工具等,也都是在解决这个隐私和安全问题。这一切能否保障好,才是让手机变成真正最懂你的 AI 助手的前提。
而当这些功能的运转足够安全,当它们开始可以由你自己定义、自己发明、自己在手机上实现后,我觉得我们就真的回不去从前的手机体验了。
我们看待手机的方式也会快速变化。我们用了它十几年来记录这个世界。现在轮到它来记录我们了。