谁是“聪明钱”?导读
不同资金的行为特征有何差异?谁对市场更有前瞻意义?港股作为离岸市场,本身就需要与其他市场争夺投资者的关注,同时港股成交活跃度较低,对资金的变化更敏感,因此更适合来观察资金行为。
实际结果可能略反直觉:1)主动外资是市场与基本面的同步甚至滞后指标,更多是“趋势加强”,没趋势也就没有大流入。2)被动外资因为体量小且流入可能只是其他市场的顺带,故参考价值较小。3)南向资金反而呈现一定“聪明钱”的特征,尤其在边际变化上:高点流入放缓,低点流入加速。
资金的信号意义在基本面弱和外部流动性紧的宏观环境下更显著。此时,若南向加速流入往往意味着底部,若海外加速流入往往意味着顶部,反之亦然。
当前正是如此。过去一个月,南向流入放缓,主动外资流入加速,意味着仍是波段和结构,符合我们一直以来对指数震荡走势的判断。
2026年以来,港股与包括A股在内的周边市场表现持续错位,呈现典型的“跷跷板”效应。上半年韩股、A股科技板块不断走强时,港股跑输且资金流出,6月下旬科技股回调后,港股得以反弹且有资金流入。
类似现象并非今年独有,2025年甚至更早之前也是如此:对内,2025年上半年港股风头强劲伴随着南向持续流入,下半年A股走强后南向流入放缓;对外,海外资金也会随日本、印度、韩国等股市吸引力的变化调整对港股的配置。
图表:2025年上半年港股走强、南向持续流入;下半年A股走强后,南向流入放缓
资料来源:Wind,中金公司研究部
图表:海外资金也会随韩国等股市吸引力的变化调整对港股的配置
资料来源:EPFR,中金公司研究部
之所以会出现这种现象,归根结底在于港股是一个“离岸市场”,缺乏本土资金使其需要与其他市场“争夺”不同投资者的“关注”,不同资金在各市场间重新配置,便会呈现“跷跷板”效应,而港股本身较低的成交活跃度也会放大资金变化的影响,更凸显了不同资金行为的重要性。
但这自然会带来一个问题:不同资金的行为受什么驱动?对市场走势有无前瞻意义?换言之,谁是领先市场的“聪明钱”?
复盘2016年以来南向与海外资金动向与市场表现的关系,我们发现以下结论:1)南向资金的流入流出与市场强相关,但也会体现出一定的“聪明钱”特征,如在港股上涨较多后流入放缓、在港股下跌或跑输A股后加快买入。相比险资,主动公募和ETF的市场跟随特征更明显;2)主动外资通常在表现和盈利预期改善后才加速流入,是滞后指标;被动外资规模小且更多受非中国市场的申赎影响,参考价值不大;3)中国信用周期震荡或海外流动性收紧时,资金的参考价值更大:此时,南向加速流入多意味着市场反弹在即;主动外资加速流入则对应后续收益转弱。反之亦然,南向流速明显放缓或转为流出对应市场可能见顶,主动外资加速流出多反映市场此前弱势。
港股不同资金的行为特征:南向有“聪明钱”特征,主动外资是滞后指标,被动外资参考价值不大
过去十年,虽然南向与海外被动资金都有结构性的长期流入力量,但在短期市场定价上,我们发现短期的资金变动更重要。因此,我们从“资金流速变化”和“相对收益变化”两个维度观察:“流速变化”定义为过去1个月日均净流入与过去3个月日均净流入之差;“收益变化”采用恒指相对其他市场指数过去1个月表现的变化。
一、南向:与市场强相关;高位时放缓、低位时加快;保险长期增持,公募与ETF跟随市场
首先,整体趋势上,南向资金与市场表现高度相关:历史上南向资金流入较多年份如2017年(3,399亿港币)、2024年(8,079亿港币)和2025年(1.4万亿港币),恒指涨幅同样较大,分别上涨36%、18%和28%;恒指下跌的年份,如2018年下跌14%,南向年度仅净流入827亿港币,为2015年以来历史最低。具体到港股跑赢A股的阶段更是如此:2020年10月-2021年2月,疫情后政策发力推动居民部门信用周期、消费和地产修复,恒指大幅跑赢上证综指,南向移动平均30天流入规模也达到156亿港币的历史高点。2024年4月-2025年4月也是如此,“924”后政策预期改善和2025年初DeepSeek带动中国资产重估,港股累计跑赢A股30ppt,南向移动平均30天流入规模达到120亿港币的历史次高。
图表:南向流入较多的年份,恒指涨幅也较大
资料来源:Wind,中金公司研究部
图表:港股跑赢A股时,南向整体加速流入
资料来源:Wind,中金公司研究部
其次,边际变化上,南向资金往往在大涨后流入放缓,在港股下跌或跑输A股后反而加快买入,并呈现一定的“聪明钱”特征。2021年4月恒指相对上证超额收益持续走高,南向却转为净流出,随后市场也转为跑输。2024年10月也类似,恒指快速跑赢上证指数,南向资金流入反而放缓。反之,当港股大跌时,我们反而会看到南向流入加速,例如2022年11月,恒指大幅下跌且跑输上证指数,但南向资金却加速流入,2024年12月也是如此,随后市场也逐渐见底。定量测算佐证了这一特征,南向资金的流速与过去1-2个月恒指相对上证收益的相关系数均约为-0.1,即港股跑输A股时,南向资金会加快买入,跑输时买入会放缓。
进一步看,当南向流入速度处于历史前20%时,恒指随后20个交易日平均上涨1.7%;南向流入由加快转为放缓后,恒指通常在3-5个交易日后转为走弱,随后20个交易日平均下跌1.6%,由此体现出一定低位加仓和高位止盈的能力,因此具备“聪明钱”特征。
图表:港股呈现一定“聪明钱”特征,在上涨较多后放缓流入,在下跌或跑输A股后加快买入
资料来源:Wind,中金公司研究部
分不同类型投资者来看:
► 险资是南向主要的长期买入力量,也会在港股大幅下跌时增配、上涨较多时减持,红利大概率是主要配置方向。1)规模上,据中国保险资管业协会统计,2024年末险资港股持仓8,105亿人民币,港股通投资余额约7,622亿人民币,我们假设险资按照港股:A股1:4比例增持权益资产,估算2026年二季度险资港股通投资余额升至1.2万亿人民币,占南向持仓的25-30%。2)方向上,南向长期增持电信、能源等高分红板块,这也符合险资久期长,需要匹配负债端的特征。3)节奏上,险资倾向于跌时多买、涨多后少买,我们估算,险资季度净流入与恒指季度收益的相关系数约为-0.4。市场下跌时,由于股息率和AH折价吸引力提高,险资或倾向于增配,比如3Q21-1Q22港股下跌,但同期险资估算仍净流入超过800亿港币;但市场上涨后险资也会阶段性减少配置,甚至转为净流出以获利兑现,比如4Q22和3Q24时。
图表:险资持续增配港股,是南向较稳定的长期配置力量
资料来源:Wind,国家金融监管总局,中金公司研究部
► 主动公募和ETF更多是跟随市场,上涨时加速流入,下跌时转为流出。我们估算两者季度净流入与恒指当季收益相关系数为0.4。主动公募受基金申赎、相对业绩和基金经理仓位调整影响,行情改善后投资者申购和基金经理增配往往同步增加;ETF同样受产品申购、发行以及投资者风险偏好影响,整体表现为上涨时流入更多。例如,2025年南向资金大幅流入1.4万亿港币,2026年至今流入约3,700亿港币,不及去年同期一半,我们测算主动公募和ETF可以解释南向同比降幅中的60%,可能是主要拖累。
我们估算险资近五年每个季度平均稳健流入约250亿港币,2025-2026年也维持了这一趋势,去年增加和今年减少的部分均主要源自主动公募和ETF资金,其中主动公募由2025年上半年流入500亿港币转为今年上半年流出760亿港币,ETF则由流入转为流出740亿港币。
图表:主动公募配置波动较大,资金流向与市场表现同向
资料来源:Wind,中金公司研究部
图表:南向ETF资金2025年大幅扩张,2026年以来转为流出
资料来源:Wind,中金公司研究部
二、外资:主动外资是滞后指标,被动外资参考价值较弱
参考MSCI的统计,以其新兴市场指数为基准的主动基金规模占四分之三,被动基金仅占四分之一,主动资金从规模占绝对主导,且被动资金流入可能更多反映的是对整体新兴市场而非单独对中国市场的配置,都大大降低了被动资金的参考价值,因此我们建议以主动外资作为观察对象。
► 主动外资是市场和盈利的滞后指标,滞后一到两个季度。1)2017年4月底后主动外资转为流入港股,此前恒生指数已从2016年底低点反弹13%,盈利预期也开始改善。随后主动外资累计流入约50亿美元,但恒指于2018年初见顶,资金则到2018年5月才流出,滞后约一到两个季度。2)2020年11月起主动外资加速回流港股,恒指较当年3月低点反弹约12%,盈利预期也已经上行,此后主动外资累计流入约250亿美元,但指数早在2021年2月见顶,资金流入却持续至2021年9月,较市场高点滞后半年。3)2019年初、2020年初和2023年初,主动外资三次短暂流入港股,也都发生在市场反弹、盈利预期改善之后。
图表:主动外资往往是市场和盈利变化的滞后指标
资料来源:EPFR,FactSte,Wind,中金公司研究部
定量测算也验证了这一点。我们测算港股相对其他市场的流速变化,与过去1-2个月相对收益的相关系数分别为0.4和0.3,说明港股跑赢后,主动外资才会提高配置。之所以如此,与海外主动基金以区域指数为基准的配置方式有关,基金要跑赢包含多个市场的基准指数,自然要优先配置一段时间内表现更强的子市场。例如,EPFR数据显示,由于中资股整体跑输韩股和中国台湾,2025年9月至2026年6月,专注全球新兴市场的主动基金对中资股的配置比例从27.8%下滑至18.8%,同期对韩股的配置比例却从11.0%升至21.6%、对中国台湾从17.1%升至23.6%,配置重心明显迁移。
图表:被动外资长期持续流入,成为亚洲市场结构性增量资金
资料来源:EPFR,中金公司研究部
► 被动外资因为规模小且未必是配置中国,信号意义较小。2020年中以来,被动外资持续流入港股,累计流入约1200亿美元,但却未能改变2021-2024年港股长达三年的震荡下跌。原因在于,被动资金变化主要受全球被动投资规模影响,资金并非专门流向港股,而是先流入新兴市场指数产品,再按照指数权重自然配置到港股。因此,被动外资对短期市场走势的指示意义相对有限。
如何使用资金信号?中国信用周期震荡与海外流动性收紧时价值更大
那么,结合不同类型资金的行为特征,如何更好地利用资金信号来判断市场走势?
虽然港股作为离岸市场对资金的变化更敏感,但资金毕竟只是影响市场走势的其中一个维度,更何况其他因素本身也会影响资金动向。
因此,我们发现,当基本面趋势不明确、而外围流动性也不处在有利环境下时(当前即是如此),资金的影响更大,反之资金可能不会起到主导。具体来看,
► 首先,中国信用周期明确扩张或收缩时,基本面的方向明确,此时资金变化的参考价值下降。南向流速在信用扩张和收缩阶段,与未来3个月恒指收益的相关系数趋近于零。主动外资流入规模在信用扩张和收缩阶段与未来恒指收益的相关系数同样接近零。历史上,2020年下半年中国信用周期持续扩张,南向虽在不同阶段流入放缓,但港股持续上涨;2021年信用周期转为收缩,即使海外流动性宽松、南向一度加速流入,但恒指依然承压;2024年“924”后信贷脉冲回升,资金与市场维持较长时间流入和上涨,均说明信用周期方向明确时,资金参考价值有限。
信用周期震荡阶段,资金信号意义更大:南向加速流入意味着市场可能见底,主动外资加速流入反而意味着港股可能转为跑输。广义财政赤字脉冲和私人社融脉冲方向反复,基本面缺乏明确方向、指数震荡时,我们测算:1)南向资金流速变化与恒指过去收益的相关系数约为-0.1,与未来收益的相关系数则为0.2,意味着南向倾向于在市场低位加速流入,后续市场或有修复,反之亦然。2)主动外资流入规模与恒指过去1-3个月收益的相关系数高达0.4-0.6,与恒指未来收益相关性则转为约-0.3,说明该阶段主动外资滞后特征明显,市场此前表现足够好,主动外资流速才会改善,但此时行情也已运行一段时间,后续收益反而转弱,反过来也是如此。比如4Q22,信用周期震荡,南向在港股阶段性见底前加速流入,同期主动外资仍跟随此前弱势继续卖出,随后港股反弹。
► 其次,海外流动性收紧时,资金信号更具参考价值,例如美联储加息阶段,主动外资加速流入后港股反而可能会走弱,南向加快买入对应港股见底。相反,流动性转松后,两类规律均明显减弱。1)主动外资:美联储加息阶段,主动外资流入规模与未来1个月恒指收益的相关系数为-0.3,说明主动外资加速流入后收益反而趋弱,降息阶段这一相关性则收窄至接近零。2)南向资金:受联系汇率制和海外投资者持仓较高影响,美联储加息阶段港股较A股的折价更容易扩大,南向资金低位加速买入、高位加速卖出的特征也更为明显,南向资金流速与过去1-3个月恒指收益的相关系数约为-0.5,与未来3个月相对收益则为0.3,说明南向通常在市场走弱后加速流入,此后港股表现也更容易改善,反之亦然,降息阶段这一关系同样减弱。
图表:中国信用周期震荡和海外流动性收紧时更具参考价值
注:数据统计区间为2016年6月至2026年8月
资料来源:Wind,EPFR,中金公司研究部
对配置的启示:当前资金信号更重要,南向流入放缓,主动外资流入加速,意味着仍是结构机会
当前中国信用周期震荡走弱,海外流动性的约束上升,因此资金信号更值得关注。具体来看
► 中国信用周期仍处于总量震荡、结构分化阶段,三季度广义财政赤字脉冲或有小幅修复。7月私人社融脉冲小幅走高,企业和居民信贷脉冲分化略有收窄,但广义财政赤字脉冲进一步走弱。往前看,我们测算,三季度广义财政赤字脉冲或向上修复,主要由于1-7月财政融资节奏偏慢,同比少增1.1万亿元,为之后预留发力空间,但财政全年总量增量有限、投资方向依然偏向科技和产业升级,因此可以带来阶段性修复,却难以使信用周期全面扩张。
图表:中国信用周期总量震荡、结构分化
资料来源:Wind,中金公司研究部
图表:1-7月财政融资节奏偏慢
资料来源:Wind,中金公司研究部
► 海外流动性仍有约束,Jackson Hole会议后加息预期升温。沃什强调当前经济和就业仍有韧性,金融条件难言紧缩,只有确认通胀明确且足够快地回到2%目标,才意味着无需进一步行动,或表明美联储短期很难明确转向宽松,CME利率期货计入美联储9月加息预期概率为60.2%,因此短期单纯依靠海外流动性改善、推动港股估值扩张的空间有限(《沃什转鹰意味着什么?》)。
图表:CME利率期货计入美联储9月加息预期概率为60.2%
资料来源:CME,中金公司研究部
这一环境下,资金动向的重要性就更为凸显。过去一个月南向资金流入放缓,主动外资流入加速,根据我们上文中梳理的不同资金的特征,这意味着市场短期迎来较大机会的可能性有限,甚至可能走弱,这也符合近期的市场表现。
图表:过去一个月主动外资曾三周流入港股市场,南向资金流入放缓
资料来源:EPFR,Wind,中金公司研究部
因此,港股当前更适合关注波段行情和结构性机会,我们维持基准情形恒指点位26000-27000的判断。今年以来的走势也基本符合我们的判断,例如去年底市场普遍看到30000点甚至更高,我们在7月初提示港股呈现底部特征(《港股市场的底部特征》)、8月初提示后劲不足(《反弹还有多少后劲?》)。总结而言,短期依然是“赔率”思维,中长期走出持续性行情,仍需看到居民信用周期回升或互联网龙头产业突破,即需要“924时刻”或“DeepSeek时刻”。操作上,1)若港股上涨到接近位置,叠加主动外资较前期趋势加速回流、南向流入放缓,可适当获利兑现;2)若后续重新调整、南向资金再度较前期趋势加速流入,则可重新提高配置。
方向上,科技看产业、周期看美联储、消费看政策。短期如果科技进展有限,可以用分红适度对冲组合波动。我们自有的AI压力指数已从此前极端水平明显回落,压力最大的阶段已逐渐过去,产业基本面压力进一步缓解,但进一步向上仍需新的催化打开当前需求的“天花板”。科技仍可作为配置的主要方向,科技之外,从仓位集中度上可以往周期方向适度均衡,相反消费可能要等待四季度的财政政策进展。我们自有的跨市场和跨行业的胜率赔率框架显示,9月4日当周保险、交运、原材料、能源、半导体的赔率胜率综合打分较高。
图表:9月4日当周保险、交运、原材料、能源、半导体的赔率胜率综合打分较高
资料来源:Wind,FactSet,Bloomberg,中金公司研究部
Source
文章来源
本文摘自:2026年9月6日已经发布的《谁是“聪明钱”?》
刘刚,CFA 分析员 SAC 执证编号:S0080512030003 SFC CE Ref:AVH867
王牧遥 分析员 SAC 执证编号:S0080525050003 SFC CE Ref:BWT0549 月 2 日比特币 ETF 流入 3100 万美元,以太坊 ETF 流出 4800 万Techub News 消息,9 月 2 日美国现货比特币 ETF 单日净流入约 398 枚比特币(约 3100 万美元),同期以太坊 ETF 净流出约 19667 枚以太坊(约 4800 万美元),资金走向明显分化。此次背离终结了以太坊 ETF 连续 12 个交易日的流入纪录。
周度数据显示,截至 9 月 4 日当周比特币 ETF 累计净流入约 9.87 亿美元,以太坊 ETF 周内仍净增 15939 枚以太坊。BlackRock 旗下产品持续领跑,Grayscale 因费率较高持续面临流出。今年加密 ETF 资金流向随市场风险偏好和利率预期剧烈波动。(CryptoBriefing)
商业航天开始交卷移动通信技术的演进史,是人类拓展物理边界的拓荒史,眼下正进入新的篇章。
过去数十年,人类将地面移动通信开发到极致,密集林立的基站和穿山越海的光纤,将数十亿人通过一张大网连接起来。而低轨卫星网络的出现,让信号的连接从地球表面延伸到了太空。
低轨卫星网络的本质,是为了弥补地面基站由于地理环境与建设成本等客观原因而无法覆盖的信号盲区,诸如深海大洋、高山峡谷、沙漠戈壁、低空空域,通过构建空天地一体化连接,更大范围为人们的生产生活服务。
今年,中国工信部向商业航天企业批复卫星物联网商用试验许可,标志着国内低轨卫星物联网走出了实验室和测试场,荷枪实弹地迈进了商业化丛林。
与之对应的是资本市场态度的悄然变化,不再为纯粹的宏大叙事喝彩,转而审视行业的真实回报率。
在这当中,时空道宇作为国内近期获批牌照的民营企业,自然而然地成了资本与行业瞩目的观察样本。
“登天”之难
卫星网络就是把卫星送入轨道并织成一张高可用网络,堪称现代工业体系中天花板级难度的超级系统工程。
所谓“登天”之难,对抗的不仅仅是地球重力,还有严苛太空环境下的多重极限,例如极高的通信可靠性、在轨一致性,以及极致的成本控制。
上世纪90年代,摩托罗拉主导的“铱星计划”,是人类探索卫星网络的起点,但一代铱星在商用8个月后便因巨额亏损濒临破产重组,根源在于设计与工程能力的严重错配:
一方面,由于采用实验室小批量定制模式,每颗卫星造价高达560万美元,66颗工作星的部署带来高昂到可怖的成本;另一方面,地面终端重达近一公斤,功耗高、散热差,在室内或移动场景中几乎无法稳定工作。
铱星的第一代LM-700卫星;图片来源:Flickr
摩托罗拉给同行们买了个昂贵的教训,也给卫星网络立下了高高的准入门槛。
发展到今天,卫星网络要面对的工程难题,比三十年前还要棘手。
比如高频信号脆弱,一场暴雨就可能断连;轨道日益拥挤,电磁干扰频发;车载和工业场景又对终端提出超低功耗、扛震、耐极端温差等苛刻要求。每一条都把门槛越垫越高,将赛道的入口一步步收窄。
大多数参与者都是左手科研成果、右手雄厚资金的“国家队”,小部分的民营企业则往往在经历巨额烧钱阵痛之后,也选择投奔国家资本,能靠自己站稳脚跟的凤毛麟角们,无不是有过硬的自研与工程能力,时空道宇就是其中之一。
时空道宇成立于2018年,创始人王洋是国内最早一批投身商业航天的创业者之一。
作为国内首个实现低轨卫星物联网星座规模化商用的民企,王洋在创立时空道宇之前便已独立研制并发射了国内首颗民营物联通信卫星“嘉定一号”,随后彻底离开编制二次创业。
再次创业,王洋首先解决了卫星规模化量产问题,先是在台州建设了卫星超级工厂,接着在2023年打通了车载卫星通信的前装量产应用,自此形成了从卫星研发制造、星座运控到地面终端的全链条自研能力。
这种兼具航天底蕴与现代工业体系的复合基因,也体现在了时空道宇攻坚底层技术时的策略。
面对传统航天“造价高、周期长”的痛点,通过模块化设计与自动化生产流程,将单星生产周期压缩至28天,单星成本降低约45%,具备年产500颗卫星的批量化交付能力。
通信链路方面,没有盲目追求大带宽,而是聚焦于“高可靠连接”,避开易受恶劣天气干扰的高频段,选用了绕射能力强、穿透力好且抗雨衰特性优异的UHF/VHF频段,保证无线电信号不易中断。
终端侧,针对不同行业开发不同形态的产品,形成高可靠、低功耗的产品矩阵。
这套扎实的技法武功,让时空道宇摆脱了大多数民企后继乏力的问题,反而越跑越快。
然而,这仅仅解决了“把卫星造好、把链路连通”的问题,太空网络如果无法与具体产业深度咬合,终究只是一座空中楼阁。
如何将天上的网络能力转化为地上买得到、用得上的标准化硬件,成为了包括时空道宇在内,所有的商业航天公司必须攻克的关口。
上车的最后一公里
1912年,泰坦尼克号撞上冰山沉没,成为早期无线电海事救援的转折点,催生了海事卫星系统的建立。
1979年国际海事卫星组织成立,卫星通信首次被引入远洋搜救体系,并在随后的波斯湾战争救援、极地科考脱险中,默默扮演着救命稻草的角色。
通过卫星通信实施搜救;图片来源:breakingdefense
但这种无法取代的重要性,在很长时间里,几乎无法被普罗大众感知。远洋货轮的求救电报、灾区现场的专业背负式终端、特种科考队的应急呼叫,这类场景尽管关键,但需求频次极低、受众极其狭窄。
对于动辄耗资数十亿、技术难度极高的低轨卫星星座而言,如果仅仅满足这些低频应急小众需求,是对工程资源的巨大闲置与浪费。
要想摆脱“大材小用”的尴尬,就必须寻找那些既有海量终端规模、又对“全天候连接”存在刚性痛点的实体场景。正在大力发展网联化、智能化的汽车工业,便成为了最理想的试验场与突破口。
8月28日,在工信部正式公布获得商用试验许可仅仅数天后,吉利银河战舰700正式亮相,时空道宇在该车型上首次基于自有低轨卫星物联网星座实现了前装量产上车,成为国内低轨卫星网络又一代表性突破。
把卫星网络真正搬进一辆普通消费者开得走的乘用车里,其难度其实是远超外界想象的。
过去,行业普遍被三大工程堵点卡住:
一是硬件形态,传统卫星天线体积笨重,装在车顶不仅破坏流线造型,还会增加风阻与异响;
二是车规耐候,汽车前装环境要求芯片和模组必须在颠簸震动、极寒酷暑下保持极低发热与极低功耗,传统的动辄数十瓦的高功耗方案根本过不了车规验证;
三是软硬件断层,航天企业与车企的架构差异巨大,跨界定制的成本高到让车企望而却步。
时空道宇的策略是不把设备做成昂贵的改装选装包,而是直接以汽车零部件的逻辑去重构产品。
不仅自研了体积仅有硬币大小、运行功耗低于1.3瓦的车规级芯片模组,将天线隐形嵌入车身结构件中,同时还在底层将通信协议栈与整车的电子电气架构及智能座舱直接打通,让卫星通信变成了车机系统内的一个原生底层接口。
时空道宇车载卫星通信模组;截图自时空道宇官网
这意味着车辆一旦驶入无人区或遭遇突发事故,不需要手动调频找卫星,车辆本身便能自动调用低轨卫星链路完成遇险上报与轨迹回传。
从2023年基于高轨卫星率先试水乘用车规模化商用,到如今依托自有商业低轨星座打通全球首次低轨前装量产,时空道宇向行业证明了卫星通信能够以极低成本、标准化地前装进大众消费品中。
对于其他焦急等待商业化回报的民营商业航天企业而言,时空道宇车载前装的规模化跑通,让他们看到了卫星网络能够持续造血的一条确定性路径,一本可以借鉴和效仿的生存账本。
生存的账本
工信部商用试验许可的批复,是行业的成人礼,自此,商业航天不再只是技术指标的竞赛,而是真实的市场试炼。
时空道宇作为率先拿到商用试验许可的民营力量,天然成为了身后众多还在研发与亏损中挣扎的民营航天企业的对照样本。
对于身处市场化竞争中的民营企业而言,没有财政兜底,唯一的生存法则就是商业闭环与极速造血。对应时空道宇的”账本”,就是构建“网络运营底座 + 终端软硬件架构”的全栈闭环能力:
向上,手握工信部牌照,具备低轨星座设计、规模化制造与在轨运营能力,可收取长周期服务订阅费;向下,将技术延伸至地面的芯片、模组、前装终端与行业应用的场景中。
时空道宇全栈式的产品结构;截图自时空道宇官网
这种“天上控网、地上控端”的纵向一体化模式,使其摆脱了单纯地售卖硬件的模式,转而能够向更具确定性的场景,更直接地兑现其技术价值。
除了在乘用车前装上跑通规模交付外,在许多关乎国计民生和高价值资产出海的复杂场景中,时空道宇已经在商业化推进节奏上展现出了极强的渗透力。
野外作业与防灾应急中,与中国石油共建联合实验室推进油气全产业链落地,在水利防汛演练中跑出99%以上的通信成功率,填补了恶劣环境下的数据回传空白;
高价值资产出海,携手中联重科等行业巨头推进工程机械出海装机,在中东阿曼落地远洋渔业监测,依托亚非拉20多个国家的运营商网络铺就“太空丝路”,其低轨终端已装上浙江海巡执法艇与粤东海域海上灯浮标,消除远海监管盲区;
高阶出行与产业生态,携手曹操出行完成Robotaxi近10万公里的弱网与盲区实车调度测试,在MWC展会上发布全栈开源生态,迅速斩获超两百家生态伙伴及过亿元意向订单。
时空道宇星座生态开放体系;截图自时空道宇官网
在这背后是一个容易被忽视的行业逻辑:卫星通信的真正价值,从来不是取代地面基站、提供更快的网速,而是在地面网络覆盖不到的地方,去填补连接的空白。
从实验室研发到工程突破,再到多场景商业闭环的跑通,时空道宇的快速突围,意义不仅仅在于自身的造血生存,而是一种标杆效应,揭示了一个在人类科技发展史上被无数次验证的道理——
任何一项科学技术,要爆发出勃勃生机,离不开民营机制的高效周转与市场化力量的深度参与。
国企筑牢了国家战略基础设施的底座,时空道宇等民营企业则以极具敏锐度的市场触角,深入毛细血管般的真实产业场景中,靠效率、成本与落地速度撕开商业化的切口。
只有民企能够依靠真实订单赚到钱、跑通正向现金流,资本才敢持续下注,产业链上下游才能形成规模化分工,高精尖的太空技术才能真正沉降为普惠大众的社会基础设施。
从这个意义上说,时空道宇最大的价值,不仅是给已经在赛道中艰难摸索的同行提供一套极具实操价值的解题思路,更给那些在赛道外犹豫观望的产业链伙伴与资本注入了躬身入局的确定性与勇气。
当商业的齿轮开始咬合运转,一个由多方力量共同支撑力的中国商业航天产业生态,正在加速破土而出。
尾声
回顾中国通信产业的演进历程,中国用二十年完成了从跟随者到定义者的身份转换。但当天线向深空延伸、通信的疆域从地表拉伸至太空,游戏规则正在改变。
过去几十年里,决定中国在每个通信时代身位的,是电信运营商与通信设备巨头。密织的基站与光缆,撑起了中国数字经济的半壁江山。但行至空天地一体化互联的时代,接力棒被历史性地交到了商业航天厂商的手中。
从频轨资源的卡位、通信架构的重塑,到太空工业制造的极限降本,新的技术和新的筹码,都将依靠新一代商业航天公司来逐个击破,他们跑得多快,将决定中国是否能在全球全域互联产业中继续保持领先。
这不是百米冲刺,而是马拉松,比的不是一时的冲劲,而是在漫长投入周期中持续迭代与造血的能力,以及对技术方向和商业节奏的把握与判断力。
这是这场从地表到星辰的超级大跃迁,留给所有参与者的终极命题。
机器人触觉的爆发前夜:五大技术路线、数据困局与模型之争你敢让机器人给你按摩吗?在今年的WAIC上,我们体验了一把之后,发现居然还挺舒服的。而这台按摩的机器人,很大的不同在于,它搭载了触觉传感器。
黄仁勋说,“触觉”是具身智能的最后一块拼图,真是如此吗?机器人有了触觉后,真的能更强大吗?干活会更聪明吗?如果答案是肯定的,那么为什么目前大多数机器人都还没有触觉?市场上有哪些路线与冲突呢?
这篇文章,跟我们一起走进实验室,去看看触觉传感器的前线研究。也来聊聊,如今机器人的触觉,发展到什么程度了。
本文为视频改写,欢迎大家收看以下视频
第一个问题是,机器人为什么需要触觉呢?我们不妨先看一个案例。
在一堆花生中,有几个是假的,如果只能看,不能摸,人是非常难分辨出来的。而搭载了触觉传感器的机器手,却能将假花生都挑出来。
只要能上手摸,人也能很快分辨出来。因为假花生是石头做的,表面更冰凉、更光滑,重量更重,还是实心的,摇起来没有真花生中果粒的振动感。
这就是触觉的重要性,因为现实中有很多任务,无法单纯的通过视觉来完成。
李智强Eric
一目科技创始人兼CEO
行业里做过一些实验,比如把正常人的手打一些麻药,让触觉感知神经短暂麻醉后,人手对于一些操作就会失灵,包括拧东西、抓握甚至系扣子等。
你可能会疑惑,一些没有触觉的机器人,不是在很多任务上的成功率都很高了吗?但业内人士指出,成功率高,并不等于可用性强。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
只用视觉时,机器人可以放慢速度,每次微调1毫米,不断尝试后总能完成任务。所以如果只看成功率,这其实是个伪命题。在这种情况下,力非常重要。例如,握东西要多紧、两个物体是否咬合,拧螺丝时不能等到螺丝拧花才意识到力过大。做柔性操作时,每根线的软硬度和材质也都很重要。
触觉到底是什么呢?它听起来是一种感觉,但我们把它拆开看,会发现它包含两种不同维度的信息:一类是对“力”本身的感知,另一类是对“形态学”的感知。
其中,力的感知还分为静态力和动态力。静态力,是抓握物品时,手指持续施加的压力,它告诉你:捏得够紧吗?物体有多硬?动态力,是物体滑动时产生的高频信号,它告诉你:是不是要掉了?摩擦力够不够?
而形态学的感知,就是对不同材料的分辨,比如通过触摸分辨苹果和橘子,就得判断表面是光滑还是粗糙,摩擦时的振动频率等等。这么多复杂的维度,放在机器身上该如何识别呢?
▍五种路径
目前市面上的方案主要有五种:压阻式、压电式、电容式、光学式和磁感应。
第一种是压阻式,这是最传统、最成熟的一条路线,材料受力后发生形变,电阻值发生变化,通过测量电阻变化来反推压力,常用的电子秤就是这个原理。
它最大的优势是成熟、便宜、技术门槛低,但是它只能测垂直方向上的力,而且会随着温度、湿度产生漂移。
第二种是压电式,一些特殊材料,比如石英、PZT陶瓷受力时,内部正负电荷中心发生偏移,从而产生电压信号,就像打火机的放电器。
它最大的特点是,只对变化的力敏感,就是你按下去的一瞬间,它会产生一个电压信号,但如果你一直按着不动,信号会慢慢衰减到零,松开的时候,又会产生一个反向的电压信号。所以压电式非常适合检测振动、冲击这类高频动态信号,却难以测量静态力。
前面两种都是直接把“力”转化成“电信号”,后面三种则是把“力”转为了“形变量”,然后测形变程度。这样做的一大好处就是,不再只局限在垂直方向,而是能检测出三维的力。
电容式的原理就是平行板电容器,当材料受力时,弹性材料会形变 ,比如按下去的时候,上下两层更近了,电容变大,此时就能测量垂直方向的力;或者滑动的时候,板面积变化,电容也变化,能感受到平面上的力。它的优点是灵敏度极高、响应速度快,而且成本相对较低,但问题在于动态范围有限,同时容易受到电磁干扰。
第四种是光学式,也叫视触觉。它是在传感器最上层覆盖一层柔性材料,接触到物体时会产生形变,材料背面有照明层,而藏在最底下的摄像头会实时检测材料的状态,通过算法反算出形变量,再换算成力的分布,因此这是一种可以同时解算接触形貌和接触力的传感器。这是目前行业最热门的方式,也是精度最高的方式,但成本较高。
第五种是磁感应,这种方式结构和光学式类似,只是表面的弹性材料加入了磁性颗粒,去掉了中间的照明层,底部的摄像头变成了磁传感器,这样表面弹性体变化时,磁场也变化,底部传感器捕捉变化后,反算出形变量,同样能推算出三维力。但磁感应容易受电磁干扰,周围的磁场环境会影响精度,而且分辨率有限。
还有一些其他不太常用的方式,比如磁流体、超声等我们就不详细说明了。以上不同方式各有优劣,我们采访嘉宾认为,对于机器人的触觉来说,多传感器结合或许是更好的方案。
▍多传感器结合
我们除了手指外,其他每一寸肌肤,都是有感知的,如果机器人想做到人类的水平,是不是也需要全身布满触觉呢?
但如果全身都用最好的技术,那成本就很难控制了,而且不同部位的要求不一样,同一种技术路径也难以适用全身。比如指尖的精度要求非常高,使用光学式的方案就能达到更高分辨率,但如果是手掌、手臂等其他部位,精度要求没那么高时,用昂贵的光学式就不划算了。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
手掌、手臂等部位的面积也比较大,比如我们考虑视触觉方案,光学模块的设计就会非常的困难,但是如果我们使用压阻式或电容式,它就比较容易覆盖这么大的面积。
在一些比较简单的应用场景下,也可以选择精度不那么高的路径。比如我们在WAIC展会上,就看到一些采用电容式的触觉传感器,已经被批量用于工厂的产品分拣与检测,原因就在于成本相对较低,与精度最高的光学式相比,采购价只有四分之一到二分之一。
而且,即使是同一个部位,未来也有机会融合多种技术,但前提是技术足够成熟。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
电容式灵敏度很高,但问题在于,材料被压紧后,对力的感知范围会非常有限。但是压阻是一种,必须硬碰硬的一种技术。因此,两种技术结合是一个可行的方案,但制造工艺、良率和量产能力能否跟上需求,仍是问题。现阶段,大家还在尽力完善单一技术路线的缺陷。
除了力的感知,广义的触觉还包括振动、材质感知等等,这就得依靠其他传感器来补足。比如人类想分辨丝绸和棉布时,会通过触摸加滑动的方式来产生振动,来感知材质的细粒度,到了机器人身上该怎么做呢?
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
我们会加入加速度计或麦克风这种传感器,能够更有效地捕捉到高频振动产生的信号。
所以完整的触觉方案,不是只选一种技术路线就完事了。
目前行业里最前沿、精度最高的,就是光学式,我们的采访嘉宾Eric所创办的公司一目科技,也是选择了这个方向,接下来,我们就走进他的实验室,探究下光学式的原理。
2000年前后,一批研究人员开始尝试一个大胆的想法:触觉,能不能也像视觉一样,被摄像头“看见”?
其中最具代表性的探索之一,是来自MIT教授Edward Adelson领导的团队,他们在2009年提出了GelSight,让机器人第一次拥有了类似“视觉”的触觉能力。
光学式最显著的优势是分辨率高,甚至已经超过了人类。
李智强Eric
一目科技创始人兼CEO
人的一个指尖大约1平方厘米,上面布了3000个触觉的感知点。每一个点下面有四个不同的nerve(神经元),就相当于12000个不同的神经元在去做感知。而我们的传感器现在可以做到24万个点,已经超过人了。
但是呢,代价也不小,接下来我们从材料、结构、算法、成本四个方面详细说说。
▍材料
首先是材料,有三大要求:
第一是特别软,业内称为“杨氏模量”低,这样才能通过细致的形变,精确反映物体硬度和力度;
第二得耐磨,不然日常执行任务久了,就会出现性能漂移或者破损;
第三要尽量薄,才能尽可能缩小整个传感器尺寸,扩大应用场景。
而这三点却天然对立,无法同时满足。
李智强Eric
一目科技创始人兼CEO
我们一直说这是个“不可能三角”,但我们只能找平衡,或者找一些新的方法,能不能把某些的变量给的约束条件去掉或者减弱。
接下来,我们到材料实验室看看新材料的研发过程。
材料工程师
一目科技
这里是我们做配方研究的实验台,大部分原材料都是液态的,种类很多。我们把不同原材料混合,使成型后的材料达到目标性能。
陈茜
硅谷101联合创始人
这个事情的难点在于什么?是不同配方的比例吗?
李智强Eric
一目科技创始人兼CEO
不仅仅是配方,我们从底层化学基底、单体到配方都需要研究。
Eric告诉我们,现在行业出现一种很有意思的材料,叫“可恢复性材料”,就像人一样,就算不小心划破了,过段时间就能自愈。
李智强Eric
一目科技创始人兼CEO
材料的恢复性一般来自一些特殊官能团。有些分子键断裂后还能恢复,我们在设计配方时要保留这种特殊的官能团。这是我们研发的一种新材料,触感与人的皮肤很接近,而且非常柔软,像婴儿的皮肤,不会造成伤害。
▍结构
而在结构方面,手指肯定是越小越灵活,这就要求触觉传感器也尽可能做得小。
测试工程师
一目科技
我们的产品体积是最小的,厚度和SIM卡的大小基本一致,大概不到16毫米。
陈茜
硅谷101联合创始人
为什么做得薄是一个技术领先的事情?
李智强Eric
一目科技创始人兼CEO
光触觉它背后是需要有感光的芯片或者摄像头,但是为了把整个视场都能看到,相当于微距摄影,它需要有一定距离,这个距离就是它的最底层的物理的制约因素。
要做得小,一方面就是前面提到的材料要尽可能薄,另一方面得从摄像头上下功夫,尽可能降低摄像头的对焦距离,同时还要扩大视场角(FOV),来覆盖更多感应区域。
李智强Eric
一目科技创始人兼CEO
我们通过自研的一些超表面和芯片的技术,能够压缩它的视距,不再用一些传统的lens(透镜)的方式去做。
在结构上,照明层的光路设计也是一大难点。因为手指的形态不是完全平面的结构,左右两边有些弯曲的弧度,这就需要精细设置照明灯珠的排布,保证不同位置照明的一致性。
李智强Eric
一目科技创始人兼CEO
照射的光路有很多讲究,我们要做大量的仿真,也叫光追踪,去观察每一个光子的传播路径。在设计时就要考虑,既要覆盖广,达到270度,又要保证精度和轨迹可预测,否则光和光之间会互相打架,产生串扰。
光学工程师
一目科技
这是一台BSDF测试装置,用于我们不同产品的,表面材料的光学特性的测量,可以将测得的光学特性输入到仿真模拟中,使我们的仿真更加的准确。之前如果买一套这种专业的一点设备要百万级,而这个是我们自己搭的,而且精度各方面挺好的。
另外,照明的灯珠,在市场上有两种方案,一种是单色,另一种是多色,之所以这么做的原因,就要说到第三点:算法。
▍算法
光学式具体是怎么识别触觉的呢?主要有三种方式。
第一种是标记点法。在皮肤层上,会印很多微小的标记点,摄像头跟踪这些点的位移变化,来计算皮肤层的形变。优点是算法简单、制造容易,但缺点是精度上限很低。
李智强Eric
一目科技创始人兼CEO
Marker(标记点)的数量顶多就几十个,这就是resolution(分辨率)的上限了,顶多中间做一些插值,但这都不是真值,所以它的问题就在于,相对来说精度低一些。
第二种是纹理分析法。皮肤表面不再需要规则的点阵,而是随机喷涂的细小颗粒,或者利用材料本身自带的不规则纹理。受力时,摄像头通过追踪光影纹理的流动来计算形变。它的优点在于硬件制造简单,因为不需要做标记点了。
大家手里的光学鼠标,原理就是简化版的纹理分析法,为什么是简化版呢?因为鼠标检测的是二维平面上的变化,而触觉传感器需要检测的是三维,这也是它的缺点所在:算法复杂,计算量更大,相对的响应延迟也较高。
前面两种算法主要关心的是亮度、对比度这些信息,所以用单色照明方案就够了,而第三种光度立体法,就必须用多色光了。
这种方式不需要任何标记点和纹理,皮肤比较均匀,照明层用红绿蓝三种颜色的光,从不同方向打光。发生形变时,由于皮肤表面凹凸变化,不同颜色光线打到同一个点的距离不同,相机捕捉到的就不再是均匀的颜色,算法会分析图像中每个像素点的RGB颜色值,来计算形变。
李智强Eric
一目科技创始人兼CEO
第三种方案兼顾了前两者的优缺点,是比较好的折中方案。制造方面也没有那么复杂,但是它在解算的时候,通过预训练的一些模型,就可以快速地去做分析,所以它算力要求比第一种大,比第二种小,精度也是比较优的。
▍成本
光学式的第四个挑战,就在于成本。通过前面的解析,相信大家也能看出来它的结构有多复杂,相应地成本也更高。
陈天一
一目科技联合创始人兼执行副总裁
目前单指的单价还是千元级的,可能会比别的技术路线稍微贵一些。随着量的上升,我们也看到了把整个的成本降到小几百的可能性。
而且不光是制造本身,后续的算法、算力要求也更高。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
视触觉现在之所以比较流行,是因为大家发现,可以比较好地用视觉的模型直接处理。但它的问题是,这个视觉的模型一般都会比较大,所以对于算力的要求更高。
当然,高成本也对应着高上限,在实验室里,我们也看到了直观的对比。
一个没有触觉的灵巧手,在没有视觉的辅助下,夹起薯片时,因为掌握不好力度,很容易就夹飞了。而带有视触觉的夹爪,不仅可以轻轻夹起薯片,当从它手中抽离时,它还会感知到轻微的晃动和摩擦,慢慢卸力。
还有更好玩的,就是夹树叶。相比薯片,树叶缺少了刚性,稍微多一点力就会发生形变,但我们看到,夹爪依然能精准感知到,树叶发生微小形变后,因弹性而对两边释放的微小力。
不过业内人士认为,现阶段更应该优先考虑的不是成本,而是验证路径的可行性。所以接下来,我们先来说说应用路上的第一道障碍,也就是数据采集。
机器人最稀缺的,就是训练数据,而到了触觉领域,已经不仅仅是“少”了。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
现在触觉可用的数据基本为0。
李智强Eric
一目科技创始人兼CEO
高保真的传感器之前是缺失的,我们通过传统的一些方法,采集来的数据跟人不太接近,且没有那么高保真的能力。
对于“触觉”这种强调实感的维度,普通的视频、文字等互联网数据,无法反映出“力”的大小和方向的,所以这个领域尤其强调真机数据。
但真机数据在获取上,存在着三大难点。
▍真机采集三大难题
我们再来做个简单的小实验哈,我们戴上这个很厚的手套,然后试图拿起一块豆腐,真的很难掌控力度,要么就是它会滑下去,要么可能稍微一用力,它就破了。
最主要的原因,就是厚重的手套完全屏蔽了触觉,无法判断豆腐和手指之间的摩擦力够不够、是不是快掉下去了,以及豆腐的形变程度、是不是快破了,这也是触觉数据采集时要面临的最大悖论。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
采集人的触觉,也就意味着需要在人手和物体之间做一个隔离,那在某种程度上我们屏蔽了人自己的触觉。如果人手被传感器覆盖,导致人本身的触觉没有办法被有效的利用,操作者的手变笨了,demonstration(示范)质量会下降,训练出来的数据结果,就没有办法让机器人能具有像人一样的灵巧的能力。
我们看到一目科技的数采设备,把整个传感器放到了手指前面,操作起来就像用筷子一样。
李智强Eric
一目科技创始人兼CEO
我认为它确实跟真实世界有gap(差距),通过一些算法能把它回退回来,可以去做一些gap的弥补,但是我不可否认它跟人是不一样的。
所以最大的问题就是:要采集触觉,就得先屏蔽触觉,但是屏蔽触觉后,又难以采集触觉。而且采集设备本身也比较复杂,一定程度上,也会影响采集员的操作。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
其实大多数的数采设备都非常的笨重,尺寸大、穿戴比较麻烦,都会在某种程度上影响操作员采集数据本身的一些行为。
要解决这个问题,一方面需要行业做出更薄的传感器,尽可能减少对采集员触觉的屏蔽。
李智强Eric
一目科技创始人兼CEO
我们下一代的触觉传感器是超薄型的,只有3毫米,不需要戴一个非常复杂的手套,只在某些关键的地方贴一些触觉点。
另一方面,行业需要设计出更舒适、更符合人体工学的采集设备,而这需要的多学科领域交叉。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
人体工学设计与设计一个触觉传感器、灵巧手是完全不相干的东西,这是我觉得接下来一年非常重要的一个课题。
行业里也有一些对采集员影响较小的织物采集手套,但这就牵扯到第二个问题:数据密度不够。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
最好的织物触觉手套,一只手也就500个点,我如果想把这个数据应用在,比如传感器上,那gap(差距)还是挺大的。如果我穿戴着这个手套,去抓一个M2的螺钉,其实就只有一个点接触,是没有办法去检测到这个螺丝的方向或者大小的。即使模型再强,也没有办法去有效地让它学习到这样的一些信息。
于弢团队和MIT去年合作了一个项目,用这类手套采集触觉数据。结果发现,大部分有效数据都是,用整个手掌抓取一个较大的东西,因为这种任务对密度的要求最低,一旦涉及到精细操作,数据就失效了。
行业面临的第三个问题是,由于触觉还是非常早期的行业,各家公司的数据采集格式不统一,难以形成大规模训练集。比如有的采集设备是两指的,就只适合用在工业场景的机器夹爪上,不适用于灵巧手的训练。
李智强Eric
一目科技创始人兼CEO
目前在数据的存储和对齐方面,我觉得做的不够好。它们之间的一致性好不好?触觉和其他模态的对齐好不好?比如同时采了触觉、视觉、本体信息,那这些模态是不是能从时间轴,到数据本身的对齐的能力做得更好?这块也是缺失的,或者做得不够好。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
硬件现在是相对不成熟的,不同的技术、传感的方式、数采设备、数据的格式、数据的形态都不一样,算法没有办法演进,因为数据的量上不去。
设备不够成熟,就采不到高质量数据,然后训练不出好模型,就没人愿意投资这个领域,这将是一个恶性循环。
既然真机采集这么难,那如何才能规模化呢?这就得用到仿真合成了。
▍仿真合成的原理与局限
仿真是在虚拟的环境中,模拟真实场景,可以同时、批量采集不同的数据。到了这一步,就不得不说到大家比较熟悉的英伟达了,这条是老黄重点押注的路线,他们为此也搭建了非常完善的框架Isaac Lab。
实际训练时,触觉公司会利用各种公有的模型,并对不同的模型加入一些真实的物理特性,比如一个螺母,它就是刚性的、比较重、表面光滑,或者是一个毛线球,它有多软、多重、表面粗糙程度如何等等。同时还要在系统里输入触觉传感器的特征,比如表面的弹性体的物理特征、手指内的光源分布等等。
有了这些数据后,就可以在系统内模拟触觉传感器接触到不同物体时表面的形变程度、光路变化,推算出最终采集到的数据。仿真的结果,还会和现实表现做对比,通过数据标定来进一步修正。
机械工程师
一目科技
图中展示了某一确定条件下的实际图像采集结果,蓝色的点代表仿真的形变,红色的点代表标定。我们展示的这部分修正是在解算层面,最后做一个映射的矩阵去修正输出,后续也会在模型输入的层面去做修正。
今年五月,有一篇名为《Tabero》的论文还提出了一种方法,那就是复用已有机器人数据,把这些轨迹重新放入Isaac Lab中,并加入触觉传感器模拟,最终生成完整的“视觉-触觉-语言-动作”数据。这其中最大的难点是:计算量太大了。
AI工程师
一目科技
如果用有限元的方法精细计算弹性体的变形,一帧可能就需要一个小时,这对于需要快速实时的获取数据而言,是不能接受的。
所以学术界提出了很多简化的计算方式。比如英伟达在2025年发布的《TacSL》论文,就介绍了一种用于视触觉的仿真方式。它的核心思路是:用软接触模型代替有限元计算。
所谓软接触,就是把物体和皮肤都当作刚体处理,但它们之间可以“互相穿透”,接触的力越大,穿透的越多,这样算出来的形变虽然不是最精确的,但也能大致模拟,而且在计算速度上更快。
但不可否认,仿真和现实之间,永远会有差距。Eric告诉我们,他们仿真的准确率,大概在90%以上,而其中10%的差距主要在于柔性物体的模拟,这也是目前的挑战所在。
李智强Eric
一目科技创始人兼CEO
针对柔性物体,我们也可以去补充一些后训练数据,比如我们已经有一个80分的模型了,我再加一点点后训练,很快就可以到90分以上。
这个思路和《TacSL》论文的策略是一致的。《TacSL》在训练策略时做了两件事:一是随机化物理参数,让策略适应不同的刚度、阻尼;二是在触觉图像上,做大量的数据增强,让策略对摄像头差异、光照变化鲁棒。这样,他们在真机上实现了零样本迁移,在插拔销钉任务上,TacSL在真机上达到了82.7%的成功率。
所以仿真意义,更多是作为真机数据的补充,两者需要搭配训练。
李智强Eric
一目科技创始人兼CEO
真实的数据多一点,还是仿真的数据多一点,每家可能不太一样,我们的判断可能至少1:1,甚至1:1以上,在短期之内仿真可能会占多数。
那到底需要多少数据,才能训练出较好的模型呢?在这点上,业内人士给出的答案比我们想得更乐观点。
▍数据量要多少
柯丽一鸣
Physical Intelligence研究员
什么时候我们收集到100万小时,等同于一个人一生的物理经验的数据,我觉得我们才开始后面的探索。
这是我们采访做具身模型的人时,Physical Intelligence的嘉宾Kay她给我们的答案,但到了触觉领域,数据量却只要十分之一。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
训练一个带有触觉的基础模型,所需要的数据,应该是要远低于基于视觉的基础模型。
李智强Eric
一目科技创始人兼CEO
当你有超过10万小时的数据,你会发现它逐渐就开始有一定的泛化能力。
这背后的原因其实不难理解。因为机器人的行为模型,其实包含了大量操作的“过程”信息,比如转身、伸手、移动等,并不是说这些信息不重要,但真正对训练有效的部分,往往是那些“拿起”、“放下”等等关键的操作。
而对触觉数据来说,平时在没有操作时,输入的信息基本为零,相当于这10万小时已经减掉了无效操作的部分。
说完数据采集,我们再来聊聊触觉的第二个障碍:算法模型的应用。有意思的是,如果直接把触觉信号输入到行为模型中,机器人任务的成功率反而会下降,这是为什么呢?
▍应用挑战
今年6月,伯克利、英伟达、斯坦福集结了李飞飞、Jim Fan等众多知名学者,联合发布了一篇名为《T-Rex》的论文,其中一项实验结果表明:如果把触觉信号,直接输入到π0.5的模型中,各项任务的成功率反而下降了。
这反映出一个问题,加了一个模态,不等于模型表现就变好,所以如何利用触觉信号,就是目前最大的挑战。
李智强Eric
一目科技创始人兼CEO
我觉得最大挑战是,大家对于触觉这个模态还是比较陌生,以及它真的怎么融入到我们模型训练里边,大家还没有一个完整跑通cycle(闭环)的SOTA(最先进的)模型出来。
我们先来简单说说,此前触觉应用的三大挑战。
第一个问题是,触觉没法用规则定义。一个东西到底是软还是硬、是脆还是弹,超过多大的力会破坏物品、物品能不能被破坏,我们没法单纯地设置一个数值、写一个规则,这样在执行任务时,模型会难以判断。
比如,拿起纸杯这件事,力气小点能拿起,稍微再夹紧点、杯子有点形变,也可以接受,但到了鸡蛋上,就绝不能让蛋壳有形变。
第二个问题是,触觉信号维度太多,直接输入到模型中反而成为了噪声。我们前面说过,触觉包含了纵向的压力、横向剪切力和摩擦力、还有表面材质感知的温度、振动、音频等等数据,这些数据不加处理地输入到大脑中,模型将难以分解。
第三个问题是,触觉和其他模态的频率不匹配。触觉信号天然是高频的,而视觉语言模型通常运行在低频率,这就意味着两者难以直接结合,会出现计算资源浪费、反应速度慢、触觉噪声干扰高层规划等问题。
到了今年,由于AI的进步,业界看到了触觉应用的范式。
▍模型算法
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
之所以触觉最近两年开始火,并不是因为触觉这个技术本身这两年才存在,而是在很久以来大家并不知道怎么样去用触觉。像最近的这些AI算法的演化和端到端模型的实现,对于触觉的利用是非常大的促进。
端到端就是直接把信号输入给神经网络,让模型自己学习,不需要人为定义规则,这就解决了第一个挑战。
第二个挑战的解决思路,就是利用编码器(Encoder),前置处理触觉信号,将这些数据打包后输出完整的语义理解。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
用self-supervised learning(自监督学习)的方式,去训练编码器,可以很容易的把不同类型的触觉的模态,甚至视觉结合在一起。然后利用现有的一些,比较常见的注意力机制,就可以比较好地去抓取,不同模态的触觉之间的相互的关系。从模型训练的角度,这能比较有效地把这样的信息,集成到更大的一个backbone(主干网络)里面。
李智强Eric
一目科技创始人兼CEO
我们叫tactile Transformer encoder(触觉Transformer编码器),通过编码器对它进行一个语义理解,比如说“到底是软的硬的?有没有摩擦?形态上像什么?”等等。做完编码之后,再进到backbone(主干网络)的大模型里面去做判断。
再来说说如何解决频率不匹配的问题,在《T-Rex》论文中,就提出了MoT的方式。这个MoT架构,借鉴了MoE的思想,由不同专家处理不同类型的信息,为此构建3个不同的专家(Expert)。
Latent Expert(潜在专家),负责处理视觉和语言观察,预测未来的视觉表征,提供“上下文理解”,这是慢速的、认知层面的。
Action Expert(动作专家),负责根据视觉语言上下文生成动作序列,比如往哪里走、手臂大概怎么摆等,但它输出的只是粗略的动作,最具创新的是第三个专家。
Tactile Expert(触觉专家),它就像机器人的反射系统,在动作执行过程中,通过实时触觉反馈,对力度、角度和接触状态进行快速修正。
听上去好像也不算什么创新,毕竟MoE架构早就有了,只是额外设置了个触觉专家而已。但这套系统最重要的思想,在于“异步执行”。意思是在推理时,动作专家生成动作规划,同时触觉专家以更高的频率独立运行,不断对动作进行修正。
这样机器人在利用触觉时,可以复用已经算好的上下文缓存,只进行快速的触觉推理,这样既保留了大模型的理解能力,又获得了类似人类触觉反射的快速响应能力。
这也类似我们之前聊基础模型的双系统架构:System 2负责慢思考、长程规划,System 1负责快反应、本能动作,而触觉也不例外。
李智强Eric
一目科技创始人兼CEO
我们觉得它应该是两个可以打通的不同的系统,就比如触觉在边缘端,应该有一个快速响应机制,例如接触之后就应该立刻做出动作。同时我觉得触觉信息也应该能回到大脑去,对相对长程的过程里,做一定决策的影响,但是它就偏reasoning(推理)。
我们在采访过程中,也发现了业界的一点分歧,那就是触觉模型,是单独训练,还是要结合摄像头、激光雷达等其他传感器来一起训练呢?
Eric认为,触觉模型可以单独训练,这样才能更好地平衡权重,就像《T-Rex》这篇论文的思路。
李智强Eric
一目科技创始人兼CEO
我们会更倾向于触觉模态的单独训练。因为触觉模态本身的语义理解,就可以完成一定的闭环,当它的语义理解结束之后,再和其他的模态进行融合,让大脑去判断会更好。因为它每一个模块可以去单独地去做训练、测试、闭环,同时这些模块可以即插即用地,插入不同的系统里面做应用。它还能跟其他模态更好对齐,不然眉毛胡子一把抓,都混在一起。模态之间的数据怎么去平衡,是个挺难的问题。
来自北美的于弢认为,两者必须要同时进行,这样才能判断每个“力”在空间中的分布,让模型更好的理解:“我是拿了什么东西,才会有这样的感知”。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
视觉是全局的,而触觉是非常局部的事情。我的手的形态动的时候,同一个传感器对应的在空间上的分布是不一样的,当大家做视觉和触觉的模态融合的时候,并不是一个简单的latent space representation(表征空间)。
当然你在同一个embodiment(载体),做同样一件事情的时候,是可以的,但一旦这样做完之后的transfer(迁移)非常难。比如像哥大李昀烛老师,是把这种触觉的力的分布,结合到三维点云上。也就是说这个力,并不只是一个力,而是它在这个空间中的力的分布。在这种情况下,是需要力的触觉和视觉的结合。
于弢的思路,也对应着我们前面提到的《Tabero》这篇论文。他认为触觉应该参与到高层决策中,理解“轻一点”和“重一点”的语义。
简单来说,《Tabero》主打前置的“语义力控”,而《T-Rex》是执行过程时的“高频修正”。由于触觉这个行业目前处于非常早期的阶段,多条路线同时探索,没有绝对的优劣之分,我们只是向大家展示不同路径。
最后,我们来说说触觉的第三个障碍,规模化。量产的最大的难题,就在于性能的一致性。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
在2026年维也纳举行的ICRA(国际机器人与自动化会议)上,我们亲手测试了很多公司的触觉传感器是否一致,大多数产品还做不到。
因为手指的调整动作都是非常微小的,在做精密操作时,输出的力稍微有点偏差,就可能导致任务失败。而触觉传感器又太精密了,但凡表面的弹性体厚度相差太大、弹性系数不一致、传感器间距不同,都会导致参数偏差,算法就难以计算出正确的数值。
接下来,我们就去一目科技的试产车间看看,他们是如何验证新工艺的。
第一步,是先把凝胶材料放到模具内固化,作为手指的表面弹性体,这一步得注意,不能有任何灰尘和气泡。
这一步需要在提供局部100级超洁净空间的超净工作台操作,会更有利于凝胶制备。
制备完成后,还得先检验是否合格。工作人员会通过拍摄,来视觉筛选掉内部有气泡、杂质的情况,并且所有的数据会经过上位机的判断,再筛选一次。
最后就是将其他地方制备的零部件,集中到一条产线上进行组装。
生产工程师
一目科技
刚才看到的材料会在这里进行分布组装,从第一个粘接工位,到预总装工位,其中包括壳体、灯带、相机、芯片等各个零部件的精密组装。触觉传感器会在总装前的预检测工位,进行成像的检测。电脑里显示的画面,展示了触觉传感器的精密的动态,属于力学的反馈,同时其中包含了很多AI算法。
当然,每个批次的试产样品还得经过自动化测试,用来验证工艺参数的稳定性。
目前在试产阶段,很多步骤依然依赖手工操作,因为触觉传感器是一个比较新品类,现成的标准化自动化设备暂时还没统一。
陈天一
一目科技联合创始人兼执行副总裁
触觉的量产不是脱离了上下游自己去生产,比如数采或是灵巧手的上下游,有不同的协议、不同的接口,对于手的适配要求也不同,所以量产还是要跟着需求,有一些定制化的操作。
一方面是自动化量产线稳定交付标准品,另一方面是试产线承接定制化需求和新工艺验证,两条线协同运转,正是这个行业走向成熟的标志。而到了2026这个时间点,我们采访的几乎所有嘉宾都表示,触觉已经处于爆发前夜了。
陈天一
一目科技联合创始人兼执行副总裁
我们看到今年整个需求有一个大幅度的上涨,大家慢慢认识到了,触觉的数据,对于物理AI训出更好的模型来说,是非常非常重要的。今年,灵巧手、上下游、包括具身的整机,都在去拼命的去做、拼命的出货,自然也会带动整个触觉传感行业更加成熟。
在今年的WAIC展会上,我们也在一目科技的展台,看到了某大型汽车电池装配工厂,将他们的触觉传感器搭载到了机械臂上,实现了工业级的应用。
市场工程师
一目科技
不同的电池包的形态变化,如果依赖传统的自动化,纯去做每次的预编程和大量的开发,无法适应产线的频繁调度和变化的过程。所以基于触觉,就得到了一些柔性装配的能力。
未来,还将应用到实验室里,做更多精密操作的项目。
市场工程师
一目科技
比如说像滴管,去做精准的取液,要恰好把它控制到毫克级的精准程度。有了触觉的精准反馈,可以实现对于滴管施加的力形变的精准控制。
根据美国银行的预测,到2030年,人形机器人的出货量将达到120万台,假设都装配了触觉传感器,每个机器人10根手指,那么触觉的市场需求将提升到千万级别。
于弢
亚德诺半导体(美国)人工智能总监/灵巧AI负责人
如果2030年的时候是量产,我们倒推一年,或者一年半到两年的研发、测试的周期,那也就是说下一年要开始上量。
李智强Eric
一目科技创始人兼CEO
触觉的下一个里程碑节点,我觉得就今年或者明年年初。
在采访时Eric提到,触觉,是让机器人类人、甚至超越人的“最后一块拼图”,因为这不仅是多了一个维度的数据,更是让机器人掌握到了“人类的第一语言”。
李智强Eric
一目科技创始人兼CEO
人类的婴幼儿刚出生之后,第一个会的其实并不是看和听,小朋友都是靠触觉摸这个世界,甚至可能用舔、用舌头,这才是我们人类对于这个世界的第一语言。
Adelson也提到启发GelSight的灵感,是源于观察小孩时,发现触摸对他们更有吸引力。
确实,人类小孩刚出生时,他不会说话、不会走路、连看都看不太清楚,想感知世界,只能伸手去摸,摸妈妈的脸、摸床单的材质、摸脚趾头的形状。
而今天,我们正在教机器人做同样的事情,让它摸花生、摸树叶、摸鸡蛋等等,每摸一次,对物理世界的理解就多一点。
或许很多年后,机器人走进了我们的生活,那时我们回望,可能会发现,转折点就在触觉普及时,因为那一刻,机器人才开始真正的理解了世界。
注:部分图片来源于网络
【本期节目不构成任何投资建议】Binance 将移除三个稳定币现货交易对Techub News 消息,Binance 宣布将于 9 月 11 日 03:00 UTC 移除 OPEN/FDUSD、SAGA/FDUSD 及 VELODROME/USDC 三个现货交易对,作为其现货市场优化的一部分。
该交易所定期监控各交易对流动性与成交量,此次被移除的稳定币对日交易额已降至 10 万至 30 万美元。相关代币仍可通过 USDT 及比特币等市场交易,平台将于停盘时自动终止相关现货交易机器人。(U.Today)一做空地址于近日清仓比特币空单,累计亏损约 54.7 万美元Techub News 消息,据 @ai_9684xtpa 监测,一做空地址于近日平仓价值约 4959 万美元的比特币 4 倍空单,持仓不足 7 小时后止损离场,本次实现亏损 11.4 万美元。该地址此前两次做空比特币同样亏损,三次累计亏损约 54.7 万美元。
目前该地址仍持有以太坊多单,当前浮盈约 1071 万美元。链上数据显示,该地址近期在比特币合约上的做空操作均未获利。美国现货比特币 ETF 单日流入 7.31 亿美元创 1 月以来新高Techub News 消息,美国现货比特币 ETF 于 9 月 3 日录得单日净流入 7.31 亿美元,创 2026 年 1 月以来最大单日流入纪录。贝莱德 IBIT 以约 4.54 亿美元流入额领跑,富达 FBTC 与 ARK 21Shares 的 ARKB 亦贡献显著份额。
此次资金涌入与美联储官员近期释放的鸽派信号相关,降低了持有非收益资产的机会成本。自 2024 年 1 月推出以来,美国现货比特币 ETF 累计净流入已突破 550 亿美元,8 月全月流入约 35 亿美元,为 2025 年 9 月以来最强月度表现。(CryptoBriefing)Strategy 回购 1.76 亿美元股票,未增持比特币Techub News 消息,Strategy 于 8 月 31 日至 9 月 7 日回购约 1.76 亿美元 STRC 股票,未增持比特币,持仓维持 845,050 枚,期末持有 51 亿美元储备及 14 亿美元现金。
此前该公司在 8 月 30 日当周恢复购入约 3.7 亿美元比特币,结束了约 10 周的暂停。同时,其将数字信用证券回购授权从 10 亿美元提升至 20 亿美元,优先股回购尚余 11.9 亿美元额度。(CryptoBriefing)HIVE 签署加拿大数据中心原则并计划 35 亿加元 AI 设施Techub News 消息,HIVE Digital Technologies 已与 AWS、谷歌、微软等 22 家企业共同签署加拿大政府推出的《负责任数据中心发展原则》。该自愿性框架旨在规范数据中心建设,避免将电力及环境成本转嫁给当地社区。
该公司计划在多伦多地区建设 320 MW AI 设施,投资 35 亿加元,预计 2027 年下半年投用,将部署超 10 万张 GPU。此次签署的框架虽无法律约束力,但标志着其正式进军北美 AI 算力基础设施领域。(CryptoBriefing)
Perplexity CEO Aravind Srinivas(阿拉温德·斯里尼瓦桑):AGI 是“一万个知识工作者”,AI 的终极形态是个人助理撰文:Techub News 整理
导语
2025 年 3 月,印度知名企业家、投资人 Nikhil Kamath 在其播客节目「WTF Online」首期中,深度对话了当下 AI 搜索明星公司 Perplexity 的联合创始人兼 CEO Aravind Srinivas(阿拉温德·斯里尼瓦桑)。这场长达两个多小时的对话,不仅追溯了 Aravind Srinivas(阿拉温德·斯里尼瓦桑)从印度金奈到加州伯克利,再到 OpenAI 和 DeepMind,最终创立 Perplexity 的独特旅程,更深入探讨了人工智能的本质、当前大型语言模型(LLM)的局限性、通往通用人工智能(AGI)的路径,以及印度在全球 AI 竞赛中的角色。作为一位兼具顶尖学术研究(伯克利博士)、顶级 AI 实验室(OpenAI、DeepMind)实战经验和成功创业背景的行业领袖,Aravind Srinivas(阿拉温德·斯里尼瓦桑)的见解兼具技术深度与商业视野,为理解 AI 的现状与未来提供了宝贵的一手视角。
摘要
AI 本质再定义:Aravind Srinivas(阿拉温德·斯里尼瓦桑)认为,当前最先进的 AI 系统可被视为一个“数字远程知识工作者”,它集成了约一万种知识工作的能力,其输出在许多任务上已超越中等水平的人类从业者。
AGI 与超级智能的区分:他澄清了 AGI(能做人类大多数智力工作)与超级智能(具备自我意识、自主设定目标并递归自我改进)的区别,指出当前技术仍属于前者范畴,后者尚属科幻领域。
AI 突破的关键:将海量计算力、高质量数据、人类反馈强化学习(RLHF)以及实用的任务微调相结合,是近年来 AI 取得突破性进展的核心原因,而非某个单一的复杂算法创新。
行业竞争现状:目前主流 AI 聊天机器人(如 ChatGPT、Claude、Gemini、Perplexity)在核心问答能力上已趋同质化,真正的差异化将来自更“智能体化”的行为,即能执行复杂任务、集成个人上下文并连接现实世界服务。
给印度与创业者的建议:印度应投资训练自己的大模型,并在语音 AI(支持多种印度语言和方言)以及构建允许普通人轻松创建个性化 AI 应用的平台上寻找机会。
从金奈到硅谷:一位 AI 建造者的旅程
Aravind Srinivas(阿拉温德·斯里尼瓦桑)的起点是印度金奈,一个以教育氛围浓厚著称的城市。和许多同龄人一样,他在母亲的期望下将进入印度理工学院(IIT)视为目标。对板球统计数据的兴趣让他很早就对数字产生了直觉,并在高中后期开始接触编程。尽管在竞争激烈的 IIT 入学考试中未能达到自己的最高期望,他仍进入了 IIT 马德拉斯分校学习电气工程。
在大学期间,一次偶然的机会改变了他的轨迹。一位室友向他介绍了 Kaggle 上的机器学习竞赛。尽管当时对机器学习一无所知,他靠着使用 scikit-learn 库并随机尝试组合各种算法,竟然赢得了比赛。这次成功让他意识到这个领域的潜力,并促使他开始系统性地自学机器学习。他利用在班加罗尔一家初创公司的实习机会,快速构建了推荐系统,并在三周内完成了原定两个半月的任务,这为他赢得了大量自由学习时间。
通过自学斯坦福的课程和吴恩达(Andrew Ng)的讲座,他回到校园后开始了机器学习研究,并最终获得了加州大学伯克利分校的博士学位。在伯克利,他因出色的论文工作引起了 John Schulman(后来成为 OpenAI 联合创始人,ChatGPT 创造者之一)的注意,并因此获得了 2018 年夏季在 OpenAI 实习的机会。
这次实习成为他 AI 认知的一个关键转折点。当时 OpenAI 由 Ilya Sutskever(伊利亚·苏茨克沃)领导。Aravind Srinivas(阿拉温德·斯里尼瓦桑)带着自己认为“很酷”的研究想法——让 AI 学习自己的损失函数,通过迭代优化来涌现智能——向 Ilya Sutskever(伊利亚·苏茨克沃)阐述。然而,Ilya Sutskever(伊利亚·苏茨克沃)在听了半分钟后直接而尊重地告诉他:“你错了,你的所有想法都没用。” Ilya Sutskever(伊利亚·苏茨克沃)随后画了两个圆圈:一个大圆代表生成式 AI,里面一个小圆代表强化学习(RL)。他解释说,这就是实现 AGI 的“配方”,剩下要做的只是投入巨大的算力。这番话发生在 2018 年。
“我那时在研究一些让我感觉自己很聪明、但长远来看未必重要的复杂想法,” Aravind Srinivas(阿拉温德·斯里尼瓦桑)回忆道,“而 Ilya 的核心理念是:让事情真正运作起来才是关键,而且往往是最简单的想法,在投入巨大算力后,在实践中表现最好。” 这一课让他深刻认识到学术界对复杂性的推崇与工业界追求简洁有效之间的差异,也塑造了他日后务实的技术观。
拆解 AI:从计算器到“一万个知识工作者”
面对主持人 Nikhil Kamath “像对10岁孩子解释”的请求,Aravind Srinivas(阿拉温德·斯里尼瓦桑)用清晰的逻辑梳理了 AI 的演进。他首先从最基础的计算器讲起,解释其背后是加法器、乘法器等机械电路的运行。个人电脑的普及、摩尔定律下的芯片小型化、互联网和万维网的诞生,一步步为今天的 AI 革命铺平了道路。
那么,是什么让 2020 年代的 AI 与 2010 年代截然不同? Aravind Srinivas(阿拉温德·斯里尼瓦桑)指出,最关键的变化是“神经网络真的奏效了”。虽然 Geoffrey Hinton(杰弗里·辛顿)等先驱奠定了理论基础,但 Ilya Sutskever(伊利亚·苏茨克沃)及其团队是真正通过投入海量数据和算力让其发挥威力的人。这背后是一种“盲目信念”般的坚持。
他进一步解释了神经网络和机器学习的关系:神经网络是实现机器学习的一种特定方式,它由多层人工神经元(可视为计算单元)组成,通过调整内部参数(权重)来学习数据中的模式。其强大之处在于规模效应——投入的数据和算力越多,其预测能力就越强。而大型语言模型(LLM)本质上就是一个在“预测下一个词”这个单一任务上,使用 Transformer 架构,在互联网规模文本数据(数万亿 token)上训练出来的巨型神经网络。
随后通过后期训练(微调)和基于人类反馈的强化学习(RLHF),模型被塑造成一个有用的对话助手,能够编程、写邮件、总结文档等。Aravind Srinivas(阿拉温德·斯里尼瓦桑)提出了一个实用的定义:当前最先进的 AI 系统可以被看作一个“数字远程知识工作者”,它集成了大约一万种知识工作的能力。这个系统虽然不像人类大脑那样节能高效,也不具备物理常识和身体,但其在众多数字任务上的输出质量已经超过了中等水平的人类从业者。
“当你可以雇佣另一个‘人类’为你工作时,它就开始真正有意义地替代人类劳动了。” 这与之前 AI 在象棋或围棋上的胜利不同,那些虽然令人惊叹,但并未对大多数人的日常工作产生直接影响。
AGI、超级智能与行业竞争的下一步
对话深入到了 AGI 的定义。Aravind Srinivas(阿拉温德·斯里尼瓦桑)区分了两个概念:
AGI(通用人工智能):一个非常智能的系统,能够通过简单的语言指令,独立完成我们使用计算机进行的大多数任务。它可以被视为 GPT-4.5 或未来两三代更先进的模型。但它没有自我意识,不知道自己的优缺点,没有自主性,也不决定下一步该学什么。
超级智能:这是 AGI 之后可能出现的阶段。一个不仅智能,而且能够递归自我改进,自主设定目标,并可能意识到人类会关闭它从而采取对策的实体。他认为这目前仍属于科幻讨论范畴。
对于当前 AI 模型的局限性,他认同 Yan LeCun(杨立昆)的观点,即物理常识和 embodied intelligence(具身智能)是当前 LLM 的短板。让 AI 学会像人类一样灵巧地拿起杯子,需要大量视频数据、物理模拟环境和机器人训练,其泛化能力远不如在互联网文本数据上训练来得容易。
谈到竞争激烈的 AI 聊天机器人市场,Aravind Srinivas(阿拉温德·斯里尼瓦桑)直言,目前 ChatGPT、Anthropic Claude、Google Gemini、xAI Grok、Meta AI 以及 Perplexity 在核心问答能力上已经非常相似,趋于同质化。Perplexity 早期的差异化在于提供带来源的准确、快速答案,但现在其他玩家也在跟进。
他认为,未来的差异化将来自两个层面:
更丰富的交互形式:不仅仅是文本回复,而是能直接提供图表、图片、产品卡片(如酒店、鞋子),并支持一键购买或预订。
真正的智能体(Agent)行为:AI 能够根据个人上下文(邮件、日历等),主动执行复杂任务,如重新安排会议、订餐、叫车、处理邮件往来等。“你躺在床上睡觉,AI 在为你工作。” 这需要强大的推理能力和与各种服务 API 的深度集成,产品构建的复杂性将大大提高,从而减少同质化竞争。
对于模型本身,他透露 Perplexity 的后端会针对不同子任务(如查询重写、文本分块、总结、推荐新问题)调用不同的模型,并通过工程优化保证整体速度依然领先。
印度机遇、个人未来与 AI 治理思考
作为在硅谷成功的印度裔创始人,Aravind Srinivas(阿拉温德·斯里尼瓦桑)对印度在 AI 时代的角色提出了明确建议。他强烈认为印度应该训练自己的大模型,不仅仅是为了支持印度语言,更是为了在全球基准上竞争,从而激励下一代工程师和创业者。对于资源有限的年轻人,他建议可以从构建有吸引力的产品开始,获取用户和融资,再逐步向训练自己的模型迈进。
他指出了几个印度可能具备优势的领域:
语音 AI:针对众多印度语言、方言和口音的语音识别与合成,这是一个西方实验室优先级不高但本地需求巨大的市场。
个性化应用创建平台:随着 AI 大幅降低软件创作门槛,未来每个人都可以为自己或小群体定制专属应用(如个性化的健身计划、支付分摊工具、公司内部假期跟踪器)。一个能抽象化部署、数据管理等复杂性的平台将大有可为。
展望未来 5 年,Aravind Srinivas(阿拉温德·斯里尼瓦桑)预测,人人都会拥有一个功能强大的个人 AI 助理,它将像 iPhone 一样普及而非奢侈品。这将释放巨大的创造力,让人们能将任何想法变为现实。但同时,短期内的劳动力替代问题将非常严峻,社会需要思考如何帮助人们适应和提升技能。
关于 AI 监管,他持谨慎态度,认为监管模型本身不切实际且难以执行。他更倾向于监管具体的应用场景,例如特别关注儿童使用 AI 聊天机器人可能产生的心理依赖和健康风险。他主张在 AI 发展的早期阶段,应保持开放和加速发展的态度,避免过度监管扼杀创新潜力,造成巨大的长期机会成本。
在访谈的最后,Aravind Srinivas(阿拉温德·斯里尼瓦桑)展现了他一贯的谦逊和学习者心态。他分享了自己的动力来源——对学习新事物和挑战难题的真正热爱,而非单纯追求奖励。他也强调了家庭支持(父母和妻子)在他人生各个关键阶段所起到的稳定器和激励作用。这种将个人成长、技术理想与人文关怀相结合的视角,或许正是这位 AI 领军人物独特魅力的所在。