GCSA Agent 在 CyberGym 取得 91.3% 成绩 跻身全球领先 AI 网络安全智能体行列 - GCSAGCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力
GCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力。
香港,2026 年 8 月 29 日 —— 全球网络安全联盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基准测试中取得 91.3% 的成功率,进入 CyberGym “Leading Systems Above 90%” 领先系统区间。
CyberGym (https://www.cybergym.io/cybergym) 是由美国加州大学伯克利分校研究团队开发的大规模真实世界网络安全评测框架,共收录 1,507 个历史真实漏洞测试实例,覆盖 188 个大型软件项目,旨在评估 AI 智能体在真实漏洞分析场景中的实际能力。
与主要评估代码理解、知识问答或静态分析能力的传统 AI Benchmark 不同,CyberGym 要求 AI 智能体直接面对真实的漏洞代码环境。
在其核心 Level 1 测试中,AI Agent 仅获得漏洞描述以及尚未修复的代码库,需要自主完成代码分析、漏洞定位、攻击路径推理、PoC 构造和执行验证。只有生成的 PoC 能够在漏洞版本中成功触发目标漏洞、同时无法在修复后的版本中复现,任务才被认定为成功。
因此,CyberGym 所衡量的并不仅是 AI 是否“理解代码”,而是 AI 是否能够真正完成从安全分析到漏洞复现和验证的完整过程。
从大模型走向安全智能体
本次 CyberGym 测试中,GCSA Agent 基于 Grok 4.5 与 Grok 4.6 模型运行,最终取得 91.3% 的成功率。
这一结果也反映出 AI 网络安全领域正在发生的一项重要变化:
决定最终安全能力的,不再只是底层大模型本身。
真实漏洞研究通常需要连续完成漏洞描述理解、大规模代码检索、攻击面识别、漏洞假设建立、测试输入生成、程序执行、反馈分析以及 PoC 反复迭代等多个环节。
GCSA Agent 围绕这一完整过程构建智能体化安全工作流。
其目标并非简单地利用大语言模型进行代码分析,而是让 AI 能够进入真实执行环境,围绕安全问题自主形成假设、收集运行证据、执行测试,并最终以可复现结果验证安全发现。
此次 CyberGym 测试,为这一能力提供了一个可量化的外部基准。
面向真实世界的漏洞研究能力
CyberGym 的核心价值,在于缩小传统 AI 测试与真实网络安全研究之间的差距。
其评测环境会恢复软件项目漏洞修复前的代码状态,AI Agent 可能需要在包含数千个文件、数百万行代码的大型代码库中自主定位问题,并最终生成能够真正触发漏洞的 PoC。
更值得关注的是,CyberGym 的进一步研究已经显示,这种智能体化安全能力并不局限于复现已知漏洞。
在开放式漏洞研究实验中,AI Agent 已发现多项此前未知的零日漏洞(Zero-day Vulnerabilities)以及历史上并未完全修复的安全补丁,显示出自主漏洞分析技术向真实漏洞发现能力迁移的潜力。
对 GCSA 而言,这也是更重要的发展方向。
Benchmark 成绩不是终点。
GCSA 的目标,是进一步建立能够服务真实网络安全场景的 AI Security Agent,使其逐步参与漏洞发现、分析、验证乃至后续修复的完整安全生命周期。
构建 AI 原生网络安全能力
随着人工智能加速软件开发,AI 同样正在改变漏洞研究与网络攻防的方式。
面对规模越来越大、复杂度越来越高的软件系统,下一代网络安全体系将越来越依赖人类安全专家与自主 AI 智能体之间的协作。
AI Security Agent 有望帮助安全团队:
* 更早发现具有真实利用价值的软件漏洞;
* 在大型代码库中自动分析复杂攻击路径;
* 自动生成 PoC,对漏洞进行执行级验证;
* 通过真实运行结果降低传统安全检测中的误报;
* 加快漏洞研判、验证与修复效率;
* 扩展专业安全团队能够覆盖的软件与系统规模。
GCSA Agent 在 CyberGym 取得 91.3% 的成绩,是 GCSA 构建 AI 原生网络安全能力的重要阶段性成果。
未来,GCSA 将继续推进自主漏洞分析、AI Security Agent 与智能化网络安全技术研究,将前沿人工智能能力进一步转化为真实世界中的安全能力,为构建更加安全、可信和具有韧性的数字环境提供技术支持。
来源: GCSA全球网络安全联盟
官网: www.gcsa.org
Coinbase 财报后暴跌 15%,Benchmark 却高呼买入:五个被忽视的关键信号撰文:White55,火星财经
当 Coinbase 股价周五暴跌 15% 时,市场目光聚焦在财报的黯淡数字上:总收入环比下降 26%,交易收入骤降 39%,加密货币现货交易量较第一季度萎缩超 30%。然而在恐慌抛售中,Benchmark 分析师马克·帕尔默带领的团队在周一报告中写下了截然不同的建议:「这些运营指标只是噪音,逢低买入非常明智」——他们不仅重申「买入」评级,更给出了高达 421 美元的目标价,较当前股价隐含超 30% 上行空间。
一、财报风暴:被掩盖的深层危机
Coinbase 关键财务指标季度对⽐ ( 单位: 百万美元 ) 交易收⼊
Coinbase 的 2025 年第二季度财报如同一枚深水炸弹,在加密货币市场掀起巨浪。表面光鲜的净利润 14.3 亿美元背后,隐藏着危险的财务结构——其中 15 亿美元来自对 Circle 的战略投资未实现收益,另有 3.62 亿美元来自加密资产账面增值。剔除这些「水分」后,调整后净利润仅 3300 万美元,同比下滑 37%。核心业务失血的速度远超预期:交易收入同比暴跌 39% 至 7.64 亿美元,远低于市场预期。
用户流失与交易萎缩形成恶性循环:二季度交易用户锐减 100 万人,回落至 870 万。更致命的是,老用户陷入「情绪恐慌」,人均交易规模断崖式下降 38%,直接导致平台交易量惨淡。2370 亿美元的总交易量虽同比微增,但较第一季度断崖式下跌 40%,其中散户交易量锐减 45%,机构客户也减少 38%。订阅与服务收入同步下滑 6% 至 6.56 亿美元,仅稳定币业务(主要为 USDC)成为微弱亮点,收入环比增长 12% 至 3.33 亿美元。
市场的惩罚来得迅猛而残酷:财报发布后,股价盘后下跌超 9% 至 377.7 美元,随后数日一路下探至 314 美元低位,市值蒸发近百亿美元。这场抛售潮反映出投资者对 Coinbase 商业模式脆弱性的深刻担忧——当交易收入占比仍高达 52.26% 时,市场波动性的减弱便足以击穿盈利防线。
二、五大关键信号:Benchmark 看涨逻辑拆解
1. 稳定币法案的「政策红利」
Benchmark 强调的《GENIUS 法案》绝非空谈。Coinbase 已深度绑定 USDC 生态,Q2 稳定币收入达 3.33 亿美元,同比增长 38%,占营收比重攀升至 22%。其平台内平均 USDC 存量达 138 亿美元,外部流通量更达 474 亿美元,构建了庞大的稳定币网络。法案若通过,Coinbase 与 Circle 的分成协议将使其坐享行业红利,甚至可能打通与摩根大通、美国运通等传统金融机构的稳定币通道。
2. 监管框架下的合规护城河
《CLARITY 法案》预期下,Coinbase 的合规布局已成关键壁垒。今年 6 月,其获得卢森堡 MiCA 牌照,可在 30 个欧洲经济区国家提供零售和机构服务。更早的 2 月,美国 SEC 撤销对其诉讼,扫除重大监管阴云。这些动作使其「加密即服务」模式(Crypto-as-a-Service)吸引超 240 家机构客户,包括贝莱德、PayPal 等巨头,形成难以复制的 B 端网络效应。
3. 超级应用的生态野心
「西方版微信」战略正加速落地。Coinbase 推出的 Base App 已开启公测,集成钱包、支付、社交、DApp 等全功能,活跃地址数远超 Optimism 和 Arbitrum 等 Layer 2 解决方案。首席执行官 Brian Armstrong 直言目标是将 Coinbase 打造为「未来十年顶级金融服务应用」,通过聚合交易、DeFi、NFT 等场景,实现从交易平台向金融生态的质变。
4. 去中心化交易所的整合革命
收购 Deribit 仅是 Coinbase 补齐衍生品拼图的第一步。这起价值 29 亿美元的收购(含 7 亿现金及 1100 万股 COIN 股票),将全球最大加密期权平台纳入麾下,使其一举掌握超 300 亿美元未平仓合约和年超万亿美元的交易生态。更关键的是,其「Everything Exchange」战略计划整合去中心化交易所流动性,允许用户在 Coinbase App 内直接交易数千种链上资产。Bernstein 分析师将此比喻为「加密金融服务领域的亚马逊」。
5. 交易复苏的早期信号
尽管 Q2 交易惨淡,但 Benchmark 指出关键转折点:7 月预期交易收入达 3.6 亿美元,环比增长 44%。这一反弹迹象与比特币价格突破 6.5 万美元、以太坊 ETF 资金流入创新高等市场回暖信号吻合。Coinbase 同期悄然增持 2509 枚 BTC,总持仓达 11776 枚(现价 12.6 亿美元),显示其对后市走向的押注。
三、破局之路:代币化万亿美元的野心
面对核心业务困局,Coinbase 祭出颠覆性战略:代币化传统金融资产。产品副总裁 Max Branzburg 透露,平台即将推出代币化股票交易,瞄准百万亿美元的传统股票市场。通过区块链技术实现全球覆盖、24 小时交易和即时结算,这一举措将直接挑战 Robinhood 等对手——后者已在国际市场提供类似服务。
「我们正在构建『交易一切的交易所』,所有资产都将上链交易。」 Branzburg 的宣言背后,是 Coinbase 向综合金融市场跃迁的野心。预测市场成为另一重要战场,尽管面临 Kalshi、Polymarket 等专业平台的竞争,但其合规优势与用户基础构成差异化武器。
为支撑宏大愿景,Coinbase 技术投入全面转向链上。Base 链隐私保护团队近期扩充,旨在解决机构客户的核心痛点。同时,其跨境支付战略瞄准 40 万亿美元的 B2B 支付市场,通过 USDC 打通企业支付通道,已与 Shopify 等电商平台开展合作。从交易平台到金融基础设施的转型,正逐步消解其对零售交易费的过度依赖。
四、市场分歧:噪音与价值的拉锯战
Coinbase 股价的剧烈波动,折射出市场对其价值判断的深层分裂。空头看到的是:交易收入占比仍过半,用户增长停滞,以及高达 93 亿美元现金储备季度环比减少 5.9 亿美元(下降 6%)的消耗。但多头视角中,这些只是转型期的阵痛:
「投资者应该较少关注短期运营业绩,更多聚焦公司为构建『万物交易所』采取的行动。」 Benchmark 的呼吁直指核心分歧。当传统券商仍以 PE 估值衡量 Coinbase 时,其真正的赌注是:代币化资产能否撬动传统金融世界的墙角,稳定币能否重塑全球支付网络,以及去中心化交易所能否颠覆现有交易范式。
华尔街的估值模型尚未完全消化这些变量。但 Coinbase 的每一步落子——29 亿美元收购 Deribit、Base 链生态扩张、欧美监管牌照获取——都在为其「链上金融帝国」浇筑地基。正如 Armstrong 所言:「所有资产终将上链」,而 Coinbase 要成为那条不可或缺的轨道。
结语:十字路口的加密巨轮
当市场为 Coinbase 的季度波动焦虑不安时,真正的棋手已看向五年后的金融版图。Benchmark 的 421 美元目标价背后,是对「链上万物交易」终局价值的重估。尽管短期盈利阵痛仍将持续,但 Coinbase 的战略转型正在改写游戏规则——从依赖市场情绪的交易所,进化为支撑代币化世界的金融基础设施。
这场豪赌的风险显而易见:监管反复性、技术落地挑战、传统金融反扑都可能成为绊脚石。但当周五的恐慌抛售潮退去,冷静的投资者需要回答一个核心问题:我们是否正在见证亚马逊式转型的早期阵痛?答案将决定 Coinbase 是坠入深渊,还是穿越风暴驶向万亿美元蓝海。
营收增速≠价值创造,Benchmark 合伙人过滤 AI 泡沫的投资指南撰文:蓝莓豆浆
编辑:伊凡
近日,根据外媒报道,美国财政部正在就Benchmark Capital向中国公司 Manus AI 的投资进行调查。美国财政部正在调查该交易是否受美国对华投资规则的约束。新规于今年1 月生效,限制了美国对中国人工智能、半导体和量子计算领域的某些投资,或在某些情况下要求投资者将此类交易告知财政部。
不过,这并不妨碍这家在Uber、Yelp 等公司背后的旧金山老牌投资机构进入大众视野。
近日,知名投资播客20 VC 主播哈里·斯特宾斯(Harry Stebbings)与 Benchmark 普通合伙人维克多·拉萨特(Victor Lazarte)展开了一场深入探讨,聚焦人工智能如何重塑商业与社会结构。
「未来三年,一定会有未来三年,一定会有人创造出估值万亿的大公司。问题是,你怎么才能找到它、加入它、挖到靠谱团队?」
随着AI 技术的迅猛发展,许多观点强调 AI 对人类能力的增强作用,但Lazarte 却提出了更具争议性的观点——AI 不仅是在增强人类的工作效率,而是在实际替代人类,尤其是在知识工作领域。他指出,AI 伴侣与代理接口的发展不仅改变了人与技术的互动方式,也在深层次上影响着人类的社交行为和心理健康,甚至使得「AI 朋友」成为一个新的社会现象。
Lazarte 也分享了 Benchmark 的投资哲学,他以投资 Brex 为例,讲述了如何识别卓越的创始人,并强调董事会成员在企业早期发展中的关键作用。他同时也分析了当前 AI 创业企业的营收增长模式,以及背后隐藏的市场泡沫风险——SaaS 时代,基于规则的投资模型很灵:做到千万营收就能成为行业翘楚。但现在不一定适用。如果模型能力增强后,资产贬值,那么这个创业毫无意义。
Lazarte 指出,AI 的颠覆性不仅体现在对人类岗位的替代上,还推动了新的营收模式和价值链的重塑。他分析了 Mercor 等公司的盈利路径,同时表达了对 AI 行业估值过高的担忧。在他看来,AI 的进一步普及可能加剧社会财富不均,但也可能创造一个公司数量更多、社会更丰富的未来。他建议年轻人应加强计算机科学素养,以便在 AI 主导的时代中找到立足之地。
在对未来投资人的建议中,Lazarte 强调保持好奇心与长期视角,并分享了Benchmark 在投资策略与创始人关系管理方面的实践经验。他还谈到风险投资行业和董事会角色的演变,认为在 AI 浪潮推动下,传统 VC 必须不断调整定位,才能持续为企业赋能。
以下为硅兔君编译的访谈正文,enjoy!
从 100 美元到 3.5 亿美元:一位巴西游戏创业者的逆袭之路
哈里·斯特宾斯:过去 24 小时我可没闲着——我几乎把你身边的人都问遍了!佩德罗、切坦、萨拉、布鲁斯·邓利维、帕特·格雷迪,还有 Brex 的创始人们...功课做足才敢请你来。
维克多·拉萨特:这是我的荣幸,感谢邀请。
哈里·斯特宾斯:佩德罗曾向我透露,Wildlife Studios(你创立的游戏公司)是从 100 美元起步,最终做到年收入 3.5 亿美元的巨头。能否聊聊这段从零开始的旅程?哪些关键时刻塑造了今天的你?
维克多·拉萨特:人们总爱听"白手起家"的故事,但真相是——我们当年拼命融资却屡屡碰壁,被迫选择自力更生。
哈里·斯特宾斯:现在回想,当时融资失败的根本原因是什么?
维克多·拉萨特:2011 年,巴西风投市场极不成熟,而我也缺乏商业经验。我们虽然坚信移动游戏的前景,但拿不出系统的商业论证。最讽刺的是,有人曾出价 5 万美元买下公司 50%股权,这让我们无法接受。说起巴西早期投资乱象,我见过更离谱的案例:朋友签下 20 倍清算优先权条款,最终失去整个公司控制权。那个时代的创业者就像在雷区行走。
哈里·斯特宾斯:既然融资无门,你们如何破局?
维克多·拉萨特:转机来自对市场时机的精准捕捉。2010 年我们发现:2008、2009 年移动应用下载量暴增 42 倍!这让我们果断放弃效仿任天堂的幻想,全力投入移动游戏开发。
预测未来很难,但看懂当下趋势容易得多。就像贝佐斯在D.E.Shaw 工作时发现互联网年增速 23 倍,立刻决定 All in。如今大语言模型(LLM)算力需求两年增长百倍,正是创业黄金期。
我最看好的方向是AI 伴侣。就像Facebook 重构社交网络,未来会出现比Character AI更具革命性的产品。未来,企业将面临三种命运:主动转型、被颠覆淘汰,或被AI 原生新企业替代。
哈里·斯特宾斯:(忧虑 AI 社交影响)当 AI 成为最懂人类的"朋友",这是否会导致真实人际关系的消亡?
维克多·拉萨特:恰恰相反!AI 能优化社交效率。五年后,多数人最亲密的"知己"或许是 AI。它能帮你梳理人生叙事,推荐优质社交关系,就像 24 小时在线的"数字红娘"。宗教研究表明:人类与"无形存在"(如上帝)的精神联结能提升幸福感,这说明人类需要深度情感连接,而 AI 正填补了这个空白。
哈里·斯特宾斯:你希望自己的孩子成长在由 AI 主导社交的世界吗?
维克多·拉萨特:技术恐惧是人性常态,但我坚信这是美好的未来。孤独才是现代人痛苦的根源,AI 将为人类提供持续的情感支持。何况它不会取代真实社交,反而能作为"信用中介"——想象 AI 根据你的特质匹配百万潜在朋友,就像拥有一个永远为你背书的超级人脉枢纽。
投资哲学:如何识别顶尖创业者?
维克多·拉萨特:我初见佩德罗时,他16 岁,因签错协议失去了首个支付公司。我花数月帮他摆脱困境,尽管自己毫无利益可图。后来我建议他来美国创立 Brex,并成为他的首位董事。促使我们这样做的,是我们对投资人本能的警惕,更是我对他商业天赋的坚定信念。
顶尖创业者需兼具两种矛盾特质:开放的思维与温和的叛逆。他们虚心倾听,却坚持独立判断。Brex 和 Mercor 的创始人都能在听完你两小时论述后说:"很有趣,但我认为相反方向才是对的。"
哈里·斯特宾斯:如何洞察创始人本质?
维克多·拉萨特:我会详细询问对方如何安排每一天:几点起床?睡前做什么?闲暇时间的投入最能暴露本质。佩德罗当年痴迷破解iPhone 系统架构,布兰登 21 岁就研读比尔·格利二十年前的博客——这种无功利心的深度钻研,才是成功的关键预兆。
硅谷密码:为何这里诞生70%科技巨头?
维克多·拉萨特:在硅谷创业的成功概率是其他地区的千倍,这绝非偶然。当扎克伯格创建Facebook 时,他能轻易找到 Google 老兵担任董事——这就是商业智慧的代际传递。董事会成员的核心价值,在于帮助创始人汲取历史经验,同时还要理解企业独特性。
哈里·斯特宾斯:你享受担任董事的角色吗?
维克多·拉萨特:这是我最热爱的工作!现在每周主动约谈 510 个项目,但 99%的优质案源来自主动挖掘,而非邮箱里的 BP。
哈里·斯特宾斯:你会主动「出击」去挖掘项目吗?就像那种猎头式的外拨挖掘?
维克多·拉萨特:对,我做的大部分工作都是主动出击。
哈里·斯特宾斯 :大家都以为你进了 Benchmark 或红杉,项目会自己砸你门上。真有那么爽?
维克多·拉萨特:确实有项目会主动找上门,但关键是你真正想投的好项目,能不能主动找到你?我又不是从小就在硅谷长大,再加上我做创始人十三年,直到一年半前才转型做投资人,所以很多我看好的项目都不会自动找过来。一般来讲,我会先在行业里打响知名度,跟圈内牛人聊,「最近哪个项目让你印象最深?」或者盯紧一个赛道研究很久,然后把相关公司一一盘点清楚,做足功课,自然而然就会发现有意思的标的。我在Benchmark之后投的四家公司里,有三家就是这么挖到的。至于第四家,是我和一位老朋友一起创办的,目前还在保密阶段,一年后再揭晓也不迟。
哈里·斯特宾斯 :你自己也开过公司?
维克多·拉萨特:对,还在线下保密阶段,等半年后再告诉你全部细节。
AI 营收泡沫?「实验性收入」到底算不算数?
哈里·斯特宾斯 :回到 Brex 和 Mercor 的那波营收爆发——Brex 18 个月冲到一亿美元,Mercor 11 个月就破亿,这太疯狂了!我想问,现在这种「营收七倍」「营收翻倍」的神话,是不是太夸张?我们是不是给创业者们描绘了一个不切实际的假象?
维克多·拉萨特:在 SaaS 那会儿,基于规则的投资模型很灵:做到千万营收就能成为行业翘楚。但现在不一定适用。
哈里·斯特宾斯 :为啥?
维克多·拉萨特:因为现在AI 圈里很多钱,其实都是「实验性」营收。比如说,你设计很简单的ChatGPT工作流程,让律师们用它写催款函,对外推销给每家律所,收入轻松跑上百万。但随着模型升级,这些「外挂」就贬值了。
维克多·拉萨特:所以我们看项目,第一步看增长——有营收才有硬指标。第二步更要紧:问自己「模型更强以后,你这套生意会增值还是贬值?」如果贬值,那就算了;如果贬值之后还能增值,那才是真的好项目。
维克多·拉萨特:拿 Mercor 举例,它瞄准的是「替代人力」这一超级赛道——听起来残酷,但对社会反而更有益。替代招聘官这一单点痛点,当前模型就能做得比人更好,而且招聘流程本身就极度低效,AI一上场立刻爆发价值。
更关键的是,他们有闭环数据:每次面试的表现和反馈,都会反哺模型,模型就会越用越准、越练越强。再加上平台效应,候选人和招聘方都聚在同一个市场,护城河也就自然筑起来了。」
哈里·斯特宾斯 :我请过 Mercor 创始人上节目,问他是不是 ARR(年化合同收入),他直说「不是年签,是 run-rate」。有人私信我,「Harry,那不算营收!」我当时也懵了,到底算不算?
维克多·拉萨特:绝对算营收。
哈里·斯特宾斯 :那算 ARR 吗?
维克多·拉萨特:没有签年合同的 ARR 概念,是 run-rate。批评声最大的,是觉得「这全靠 labs(模型训练中心)买单」。但你想想——GPT-3 那会儿没人愿意用,再加上RLHF(人类反馈强化学习)的突破,才诞生 ChatGPT。现在 AI 又进入第三阶段——纯强化学习——我觉得这才是最强大的方向。纯强化学习的套路是:找专家命题,再让专家给回答设定评分规则,模型生成大量答案后按规则打分,最后用这些「问答+分数」再训练模型。
这意味着,只要有评测标准和充足算力,模型就能刷过benchmark。Mercor 的秘诀就在于——他们捡出顶级的「考官」和「阅卷官」,这正是 AI 迭代最需要的人力环节。
所以有人说「没签年合同」,可事实是,只要人类在任何知识任务上仍比电脑更强,就会需要继续提供评测数据,以此让 RL 环境不断进化。
哈里·斯特宾斯 :我完全理解也同意——但问题是,我们拿着「实验性」营收去赌风险,到底愿不愿意给这样的估值溢价?
维克多·拉萨特:要具体项目具体分析。Mercor 那次融资我觉得很划算……
哈里·斯特宾斯 :你觉得二十亿美元估值划算?
维克多·拉萨特:我说的是我参与的那轮。
放眼整个行业,有没有泡沫?投资者的回报是否足以覆盖他们承受的风险?这轮AI 革命的体量,可能远超当年的移动互联网。我敢打赌:未来三年,一定会有人创造出估值万亿的大公司。问题是,你怎么才能找到它、加入它、挖到靠谱团队?
比如,美国软件年度支出约一万亿美元,劳动力支出十万亿美元,AI 现在盯上的是劳动力这块市场。想象一下,若能把劳动力成本大规模压缩,结果会怎样?胜出的公司肯定是巨无霸。所以要抢先布局。
当然,回头看难免有高估案例,但整体上,买对赢家就能赚。
哈里·斯特宾斯 :你之前提到过,当年因估值问题错过投资Google 的教训,我一直记着。现在,当预算从「人」转向「技术」,我最担心的是:贫富差距会进一步拉大。哪怕那家公司估值万亿,却可能只雇五千人,却挤压了整个万亿级的劳动力市场。你怎么看?
维克多·拉萨特:百分之百认同。我最担心的是,十年后,比如写代码写报告这种对着电脑的工作,也就是所谓「知识工作」,可能只占1%。
你想想,刚毕业的大学生、刚入行的律师,三年后还有多少工作是模型干不掉的?恐怕没几样。与此同时,公司价值会暴涨,股东和创始人都会更富。一家万亿市值的公司,只需几十号人就能运转,这对社会冲击可想而知。
哈里·斯特宾斯 :我最爱听到一句话:「我们不再招聘新员工,只保留现有人数。」真是讽刺。
维克多·拉萨特:从宏观上看,这对社会其实是好事。公司是人类最伟大发明,只有不断降低人力成本,才能催生出更多优质公司。
我在巴西长大,那儿生活水平不高。来到湾区后才发现,这里太美好了。差别就在——高质量的公司足够多。但我们的挑战是,如何把这些财富分配给更多人。
哈里·斯特宾斯 :我不相信UBI(全民基本收入)。人活着要有目标,光给钱不行。大家说要钓鱼、写诗,可这不是绝大多数人的真实写照。人会上瘾、赌博、……抱歉说重了,但这才是人性。不会拿出画笔写诗。
维克多·拉萨特:那就要么搞 UBI,要么通过传统民主调节。
哈里·斯特宾斯 :说说看?
维克多·拉萨特:想象一个极度富足的社会,可财富高度集中,绝大多数人享受不到——不就跟今天差不多,只会更极端?
维克多·拉萨特:但与此同时,政客们更难欺骗选民,因为每人口袋里都有一个超级 AI 助手。你问助手:「这政客投的票,对我有利吗?」AI 会给你精准分析。
如果有人鼓吹「大规模财富再分配」,选民也得问 AI:「对我有好处吗?」结果谁也说不准,这对民主既是利好,也有大风险。
十年后的日常:你会让AI 安排每一天吗?
哈里·斯特宾斯 :人们总容易被「技术让生活更轻松」冲昏头脑,但这往往是短期视角。你觉得我们是不是高估了一年内的进步、低估了十年后的变化?还是说实际进度会比预期更快?
维克多·拉萨特:那句老话很对:「我们总高估一年能做的事,却低估十年能做的事。」在 AI 领域体现得淋漓尽致:三年前还没有 ChatGPT,现在每月近十亿用户,用后体验截然不同。所以在未来五年内,人们的日常真的会被 AI 实质改写,比想象要快得多。
哈里·斯特宾斯 :那我们今天在做什么,回头看会觉得荒唐?就像以前很多人说「你会在交友软件上找到真爱?别扯了!」「你竟然把信用卡信息输入到网上?不可能!」你觉得会是什么?
维克多·拉萨特:我觉得很快会出现这样一种场景:你有一个 App,早上醒来一打开,它告诉你今天该做什么。你也许搞不清为什么,但就是照做了。做完之后,你会发现自己心情莫名其妙地好了很多。
久而久之,你会对这个App 产生完全的信任。不同于那些只是辅助你完成想做之事的应用——比如我用 Instacart 点菜,它们只是工具。而这个 App 是直接告诉你该做什么,而你会毫不犹豫地照做。
哈里·斯特宾斯 :你觉得这离我们还有多远?
维克多·拉萨特:其实端倪已经显现。现在就有一些「陪伴类」App,比如 St. Finch 这样的「自我关怀宠物」,它扮演的是你的「责任伙伴」角色,每天提醒你运动、喝水、吃药。
比如我自己,想每天早上锻炼20 分钟,但有时候实在提不起劲。这个 App 会在你起床时说:「今天也要动一动哦,连续坚持 X 天你会感觉更棒。」就这样,它一点点把你训练出一个新习惯。
而这只是开始。随着AI 变得更智能,它将理解你的长期目标、掌握你的生活背景——早上睁眼,它就说:「花一小时读读这本书吧。」你真的就去读了。又或者它建议你去见一个人,你就立刻动身了。
逆势建议:别学牙医,去学计算机!
哈里·斯特宾斯:有点好笑,我前几天被问,「你有什么建议给我?我快上大学了。」我说,「很简单,去学脑外科或牙医,至少保证二十年饭碗稳。」你会怎么说?
维克多·拉萨特:我倒是截然相反——强烈推荐学计算机科学。
哈里·斯特宾斯 :真是跟所有人说法背道而驰!好有意思的建议。
维克多·拉萨特:是啊。想想在计算器出现前,人们还得靠「人肉计算器」算天文表格——如果你看过《登月第一人》,主角们大多是女性专门做那些数学运算。后来有了计算器,可大家并没有因此放弃学数学。
学数学本身就很有价值,虽然大学头两年很多都是电脑可以做的运算,但你在理解底层原理,培养严谨的逻辑思维。更何况,当我们训练模型写代码时,模型在其他领域的能力也会提高。
我建议大家学计算机科学,不是为了都当程序员,而是要掌握技术变革、AI 变革的底层逻辑。这种训练能让你把大问题拆解成小问题、用条理化的方法解决,就算不当开发,也非常受用。
哈里·斯特宾斯 :过去 18 个月里 AI 领域出了好几家热门公司,你也投了好几家。有没有哪家当年你本有机会投进,却错过了?
维克多·拉萨特:我们给 Cursor 参与过一个轮次,我觉得代码生成赛道非常有意思。
哈里·斯特宾斯 :有趣!Benchmark 以领投 A 轮著称,你怎么看现在要不要在阶段上更灵活,不一定非领 A?
维克多·拉萨特:我觉得僵化没意义。Benchmark 的核心,是做创业者心目中「最想合作」的伙伴。这跟很多 VC 一样,但我们的要求是:要成为他们的「第一通电话」。
哈里·斯特宾斯 :我能直说吗?每个 VC 都这么说。我甚至不想做「第一通电话」,当创始人遇到大麻烦时,才该给我电话。也许那天永远不会来,但如果真来了,我想成为那个能帮上大忙的人。
维克多·拉萨特:没错,同等条件下,谁不想成为最亲密的伙伴?但关键是牺牲和取舍。Benchmark 投资很少,因为我们花更多时间陪伴被投公司。很多投资人只想写完支票就走,但我们愿意投入精力当真正的伙伴。
哈里·斯特宾斯 :你觉得投资人能不能真正为创始人「加把劲」?Keith Rabois 说最好的创始人根本不需要投资人。
维克多·拉萨特:我觉得可以。如果你去问我共事过的创始人,他们会说:「Victor 就像我创始团队里的另一位合伙人。」有一次 Peter 对我说:「你真的帮了大忙,我已经把你当成共同创始人了。」
从外部真正影响一家公司的发展很难,但创始人需要「思想伙伴」,也需要借助整个生态系统的经验与人脉,而你可以成为那个「催化剂」。
优秀的创始人身边总有很多人脉,但作为董事,我的优势是长期深度参与比如我在Brex 董事会上已经七年,每次大招募我都会参与讨论,积累了别人难以企及的背景知识。
问题在于,这种「背景知识」获取成本极高,因此我们才投得少,每投一家都要花大量时间。
哈里·斯特宾斯 :如果你想灵活的「插队」,比如参与Cursor 后期轮,你能同样带来背景知识吗?毕竟你不在董事会。
维克多·拉萨特:通常不能,所以我们也很少这么做。偶尔会先小额参与,和创始人建立关系,后面再加注。但如果支票太小、投资者太多,你再聪明也改变不了什么。
Benchmark 的投资秘密:为何只投‘创始人首选伙伴’?
哈里·斯特宾斯 :成为 Benchmark 的合伙人,你有感到压力吗?这是个重量级角色。
维克多·拉萨特:压力倒是有,但更让我兴奋的是,我加入时合伙人跟我说:「你来这里,是要和我们一起‘合创’这个基金。我们有传承,但不受限于传统,要有创造性破坏的精神。」
后来和创始合伙人见面时,他们也强调:「唯一能让 Benchmark 永葆活力,就是我们对过去的运作方式毫不留恋。」正是这种态度,给了我们极大灵活性。
哈里·斯特宾斯 :你觉得风投行业在变吗?
维克多·拉萨特:变化太大了。几十年前,董事会更多是「监事会」:资本稀缺,大家怕亏钱,要守住下限。可今天技术投资早已是主流,更重要的是追求上限收益,而不是过分管控风险。
这也改变了董事的职责:不再以「怎么样才不亏钱」为第一要务,而是「怎么放大创始人的理想」。重点从监督变成助推。
哈里·斯特宾斯:理论上「董事的法定职责」是对股东尽责,可股东利益和创始人理想未必一致,你怎么平衡?
维克多·拉萨特:我觉得,你要做的是在投资时尽责:评估创始人能否成为优秀CEO,一旦下注,就去帮助他们做想做的事。即便意见不合,也把他们的意愿放在首位。
哈里·斯特宾斯 :你有曾经对创始人「失去信心」吗?
维克多·拉萨特:就我个人天使投资经历,有过几次没做好。但在 Benchmark,我和 Peter 一起,见证了好几个公司起起伏伏,我学到的一点是:只要创始人还愿意坚持,我们就不放弃。
有家公司的业务不行,很多VC 会说「割肉算了」,可我们选择增开董事会、天天开会,和创始人一起继续奋斗。因为我们答应过他们,就要一如既往支持。
哈里·斯特宾斯 :提到 Benchmark 的投资流程,你最想改动什么?
维克多·拉萨特:我觉得流程已经很轻量,很好。我们只要求:你看上了一家公司,想投时听听合伙人意见,但不用他们逐个签字同意。
哈里·斯特宾斯 :那你通常是单打独斗,还是带合伙人一起早期会面?
维克多·拉萨特:全凭意愿。唯一必须做的是想法介绍给其他合伙人。一般来说,先跟创始人聊一两次,如果确定有戏,就拉进其他合伙人共同讨论,最后大家投票。就算大部分人反对,也依然可以独立行动。
哈里·斯特宾斯 :既然能做,那为什么还要投票?
维克多·拉萨特:投票是要把大家的真实想法数字化,让信号更明确。任何项目都有利弊,大家讨论后给分,就能看出共识在哪。我们打 1 到 10 分,不允许打 5 分,以此逼出立场。
哈里·斯特宾斯 :我问 Peter:「你最想问 Victor 的问题是什么?」他说:「十年后回过头,你希望在什么方面让 Benchmark 产生深远改变,以免被时代淘汰?」你怎么看?
维克多·拉萨特:我觉得「避免被淘汰」不是最关键。更重要的是,未来十年会诞生万亿美元市值的公司,我们怎样才能深度参与其中?
这倒推回去就是:如何成为创始人首选的合伙人?Benchmark 目前做得还不错,但因为团队小,很多机会我们根本没看到。有些人融资的轮次可能不符合「Benchmark 篮子」的标签,但其实他们很值得我们关注。
我们要做的是让外界明确什么才算「Benchmark 该投的轮次」:只要是优秀创始人、瞄准大市场,就是我们的潜在标的,无论是 500 万还是 2 亿。
哈里·斯特宾斯 :过去 Benchmark 的「小而精」是优雅的约束,可现在 AI 领域一轮就 2500、5000 万起步,要拿到 15% 股权,第一笔就要投掉 10% 甚至更多基金份额,这成了新挑战。
维克多·拉萨特:我在 Benchmark 的第一笔支票是 5500 万美元,投给了 Heijin。
哈里·斯特宾斯 :5500 万?那得占多少基金?
维克多·拉萨特:我们那期基金是 6 亿美元,所以占比不到 10%。我觉得基金规模从来都不是问题,真正的瓶颈是——你能不能在最早期就进入、用最少的合伙人做出最大贡献?
我们最擅长的,是和想要深度合作的早期创始人配合。有些创始人觉得找个长期懂业务的「参谋」很重要,那 Benchmark 就合适。至于后期加注,我们也会跟进,必要时通过 SPV 操作。但从来不会为「支票大小」设置硬性上限。
快问快答:Duolingo、Green Oaks 与十年愿景
哈里·斯特宾斯 :我可以跟你聊一整天。来个快问快答收尾吧!在你看来,哪些观点虽然现在不被大众接受,但最终会被证明是正确的?
维克多·拉萨特:我相信不久后,我们会完全听从App 的指令来生活,而且乐在其中。
哈里·斯特宾斯 :和 Peter Fenton 一起工作,你学到的最重要的东西是什么?
维克多·拉萨特:Peter 最优秀的一点,就是能让人敞开心扉。他常常请创始人吃饭,两个半小时下来,你会觉得彻底了解了对方,甚至比和他们谈业务还要深刻。
维克多·拉萨特:这几乎成了他的「超能力」。要约人一起吃饭,只要带上 Peter,大家都会爽快答应,然后纷纷点赞:「哇,这顿饭太特别了!」
哈里·斯特宾斯 :我真想看哪个创始人会回绝:「不好意思,那天我要追剧……」
维克多·拉萨特:我猜总有那么一天,但目前还没遇到过。
哈里·斯特宾斯 :你可以买一只股票并持有 10 年,你选哪只?
维克多·拉萨特:Duolingo。
哈里·斯特宾斯 :为什么?
维克多·拉萨特:AI 将彻底改变人们的学习方式,AI 老师会成为主流。Duolingo 很巧妙,最初只做语言学习App,接下来要做你的 AI 朋友帮你学语言,之后会扩展更多科目。创始人 Luis 非常聪明,这家公司将为所有人提供免费的 AI 家庭教师,对社会意义重大,也非常有价值。
哈里·斯特宾斯 :你可以选一个 Seed 基金和一个 Growth 基金投,你选哪个?
维克多·拉萨特:客观的说,我投过Green Oaks,很不错;早期基金的话我选 Conviction,因为我很看好 Sarah。
哈里·斯特宾斯 :我完全同意。她这几年做的太棒了。最后一个问题:十年后,也就是2034 年,你希望自己在哪里?实现什么?
维克多·拉萨特:我想成为那些最顶级公司的重要一员,可能是早期董事,也可能是联合创始人。
我希望到那时能回头说:「看吧,AI 已经解决了教育、安全、陪伴等许多全球最大的问题,而我正好参与了这些公司的成长。」
哈里·斯特宾斯 :很高兴这次能跟你聊得这么自在。谢谢你,太精彩了!
维克多·拉萨特:谢谢,我也很享受!Solana 应用 Fomo 24 小时协议收入达 140 万美元,超越 Pump.funTechub News 消息,Solana 生态应用 Fomo 在最新统计周期内实现 24 小时协议收入 140 万美元,超越此前占据主导地位的 Pump.fun。这一数据表明 Solana 应用层竞争激烈,用户注意力与资金流动迅速。
尽管单日收入领先并不意味着 Fomo 已永久取代 Pump.fun 的市场地位,但此次超越反映出 Solana 生态内应用轮动与费用生成活动的活跃程度。Solana 凭借低廉的交易成本和快速结算能力,持续吸引零售用户尝试新的交易体验。
分析指出,若 Fomo 能持续数日或数周保持强劲的收入表现,其市场影响力将更为显著;若收入快速回落,则可能仅为短期关注度爆发。无论结果如何,此次数据变化凸显了 Solana 应用排行榜快速更迭的特性。(Bitcoinist)OpenBMB 发布 MiniCPM5-2B 模型,在 34 项基准测试中平均得分 53.9Techub News 消息,OpenBMB 发布 MiniCPM5-2B 模型,这是 MiniCPM5 系列的第二代检查点。该模型为密集因果语言模型,参数量约 25.2 亿,采用标准 Llama 架构,上下文窗口为 131,072 个 token,并采用 Apache 2.0 开源许可。
在 34 项基准测试中,MiniCPM5-2B 平均得分 53.9,优于同规模基准模型 Qwen3.5-4B(51.1)。该模型在工具使用、代码推理和长上下文检索任务上表现突出,但在通用知识任务上稍弱于更大规模的模型。
OpenBMB 同时开源了训练数据集,包括 Ultra-FineWeb、UltraData-Code、UltraData-Math 等,以及多个中间检查点,以便社区验证其强化学习与策略蒸馏训练流程的效果。 (MarkTechPost)Meta FAIR 发布 AI 研究偏好模型,可提前筛选实验方案节省 GPU 时间Techub News 消息,Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型(RPM),旨在让 AI 研究智能体在执行耗时的 GPU 实验前,对候选实验方案进行排序,仅运行最有潜力的方案。该模型包含仅推理和智能体驱动两种变体,使用冻结的预训练大模型(Qwen3.6-27B),相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。
在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择的 0.684 提升至 0.711(仅推理)和 0.729(智能体驱动)。效率方面,两种 RPM 均能在约 15 小时内达到基线模型 24 小时的性能水平,实现约 1.5-1.6 倍的加速。此外,研究在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。(MarkTechPost)加州大学伯克利分校发布CUA-Lite,统一计算机使用代理的训练与评估平台Techub News 消息,加州大学伯克利分校的研究团队发布了 CUA-Lite,这是一个用于计算机使用代理(CUA)的开源平台。该平台将代理、环境、轨迹以及评估和训练框架整合在一个统一的操作空间、数据模式和命令下,覆盖桌面、浏览器和移动端。其轻量级沙箱可在任何 Docker 主机上运行,无需 /dev/kvm 支持。
平台的核心组件 Lite.OSWorld 在普通 Docker 容器中复现了 OSWorld 的任务套件和评估器,内存占用从 4.1 GB 降至 0.9 GB,并行实例数量增加约 4.6 倍,且评估分数与原始虚拟机版本一致。平台还包含 LiteSample 统一数据模式,并已将十余个现有 CUA 数据集预处理后发布在 Hugging Face 上。
该框架集成了 10 多个基于 GPT、Claude、Gemini 等模型的代理,以及 15 多个涵盖桌面、浏览器和移动端的基准测试。通过单一命令支持监督微调和强化学习训练,例如在 Lite.ScaleCUA 上微调 Qwen3-VL-2B-Instruct 模型,在 332 项任务的评估集上平均回合回报从 0.138 提升至 0.237。 (MarkTechPost)Artificial Analysis 发布 Intelligence Index 4.2 版,GPT-6 Astra 评分引质疑后调整Techub News 消息,AI 基准测试平台 Artificial Analysis 发布了其 Intelligence Index 的 4.2 版本。此次更新很可能源于其基准测试未能准确反映 GPT-6 Astra 实际进展的批评。在新版指数中,GPT-6 Astra 的得分较其前代高出 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1 模型。
(The Decoder)AIRA₂ 在机器学习基准测试中领先,较此前代理提升 9 个百分点Techub News 消息,AI 研究机构 AIRA 开发的 AIRA₂ 在机器学习基准测试中取得最高成绩,其性能较此前代理提升了 9 个百分点。该成果突显了 AI 在复杂问题解决方面超越人类能力的潜力,或将重塑未来的 AI 应用。(Crypto Briefing)GPT-6 Astra 在 ARC-AGI-3 基准测试中效率首次超越人类平均水平Techub News 消息,OpenAI 的 GPT-6 Astra 模型在不同基准测试中表现不一。Epoch AI 给予其 169 分领先,而 Artificial Analysis 则认为其表现不优于前代且落后于 Claude Fable 5.1。最大亮点来自 ARC-AGI-3 测试,Astra 首次以高于人类平均水平的效率完成任务。ARC Prize 负责人 François Chollet 虽不认为这证明了通用人工智能(AGI)的实现,但他承认进展速度是预期的两倍,并因此提前了他的 AGI 预测时间表。
(The Decoder)芒果超媒股价周涨 64%,因首播全 AI 生成电视剧《后西游记》Techub News 消息,中国视频平台芒果超媒本周股价最高上涨 64%,创 2015 年 1 月以来最大单周涨幅,并成为 MSCI 亚太指数表现最佳成分股。此次上涨源于其旗下芒果 TV 于 8 月 31 日首播中国首部全 AI 生成长篇电视剧《后西游记》。
该剧采用“边播边审”新模式播出。首播效应也带动昆仑万维、阅文集团等相关 AI 内容概念股上涨。分析师认为,AI 生成内容可能成为行业新增长引擎,政策转变对芒果、爱奇艺等平台构成利好。(BeInCrypto)谷歌 Gemini 3.8 Flash Cyber 在漏洞修复基准测试中得分 47.2%Techub News 消息,谷歌宣布其 Gemini 3.8 Flash Cyber 模型在 CWE-Bench 基准测试中取得了 47.2% 的 pass@1 分数。CWE-Bench 是一个用于评估修补软件漏洞能力的外部基准。
(Tech in Asia)Tether AI 发布开源翻译模型,支持 19 种非洲语言与 9 种欧洲语言Techub News 消息,Tether AI Research 发布开源 AI 翻译模型系列,旨在直接在智能手机、笔记本电脑等边缘设备上运行,主要关注撒哈拉以南非洲地区。该版本包括 QVAC TranslatePsy-AfriSLM 和 QVAC TranslatePsy-AfriNano,分别支持 19 种和 8 种非洲语言,以及覆盖 9 种欧洲语言的 QVAC TranslatePsy-EuroNano。
模型通过本地处理翻译,无需互联网连接,用户数据保留在设备上而非发送至第三方云服务器。TranslatePsy-AfriSLM 模型虽仅含 8 亿参数,但在多项翻译基准测试中性能超越了规模大得多的模型。
该技术旨在为非洲数亿人口解锁本地语言的教育、医疗知识获取能力,结合其医疗健康模型 MedPsy,可望为农业、人道主义响应和跨境沟通等场景提供支持。(Tether)GCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力 GCSA Agent 在全球高难度真实漏洞基准测试中展现自主漏洞分析与 PoC 生成能力。 香港,2026 年 8 月 29 日 —— 全球网络安全联盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent 在 CyberGym 基准测试中取得 91.3% 的成功率,进入 CyberGym “Leading Systems Above 90%” 领先系统区间。 CyberGym (https://www.cybergym.io/cybergym) 是由美国加州大学伯克利分校研究团队开发的大规模真实世界网络安全评测框架,共收录 1,507 个历史真实漏洞测试实例,覆盖 188 个大型软件项目,旨在评估 AI 智能体在真实漏洞分析场景中的实际能力。 与主要评估代码理解、知识问答或静态分析能力的传统 AI Benchmark 不同,CyberGym 要求 AI 智能体直接面对真实的漏洞代码环境。 在其核心 Level 1 测试中,AI Agent 仅获得漏洞描述以及尚未修复的代码库,需要自主完成代码分析、漏洞定位、攻击路径推理、PoC 构造和执行验证。只有生成的 PoC 能够在漏洞版本中成功触发目标漏洞、同时无法在修复后的版本中复现,任务才被认定为成功。 因此,CyberGym 所衡量的并不仅是 AI 是否“理解代码”,而是 AI 是否能够真正完成从安全分析到漏洞复现和验证的完整过程。 从大模型走向安全智能体 本次 CyberGym 测试中,GCSA Agent 基于 Grok 4.5 与 Grok 4.6 模型运行,最终取得 91.3% 的成功率。 这一结果也反映出 AI 网络安全领域正在发生的一项重要变化: 决定最终安全能力的,不再只是底层大模型本身。 真实漏洞研究通常需要连续完成漏洞描述理解、大规模代码检索、攻击面识别、漏洞假设建立、测试输入生成、程序执行、反馈分析以及 PoC 反复迭代等多个环节。 GCSA Agent 围绕这一完整过程构建智能体化安全工作流。 其目标并非简单地利用大语言模型进行代码分析,而是让 AI 能够进入真实执行环境,围绕安全问题自主形成假设、收集运行证据、执行测试,并最终以可复现结果验证安全发现。 此次 CyberGym 测试,为这一能力提供了一个可量化的外部基准。 面向真实世界的漏洞研究能力 CyberGym 的核心价值,在于缩小传统 AI 测试与真实网络安全研究之间的差距。 其评测环境会恢复软件项目漏洞修复前的代码状态,AI Agent 可能需要在包含数千个文件、数百万行代码的大型代码库中自主定位问题,并最终生成能够真正触发漏洞的 PoC。 更值得关注的是,CyberGym 的进一步研究已经显示,这种智能体化安全能力并不局限于复现已知漏洞。 在开放式漏洞研究实验中,AI Agent 已发现多项此前未知的零日漏洞(Zero-day Vulnerabilities)以及历史上并未完全修复的安全补丁,显示出自主漏洞分析技术向真实漏洞发现能力迁移的潜力。 对 GCSA 而言,这也是更重要的发展方向。 Benchmark 成绩不是终点。 GCSA 的目标,是进一步建立能够服务真实网络安全场景的 AI Security Agent,使其逐步参与漏洞发现、分析、验证乃至后续修复的完整安全生命周期。 构建 AI 原生网络安全能力 随着人工智能加速软件开发,AI 同样正在改变漏洞研究与网络攻防的方式。 面对规模越来越大、复杂度越来越高的软件系统,下一代网络安全体系将越来越依赖人类安全专家与自主 AI 智能体之间的协作。 AI Security Agent 有望帮助安全团队: * 更早发现具有真实利用价值的软件漏洞; * 在大型代码库中自动分析复杂攻击路径; * 自动生成 PoC,对漏洞进行执行级验证; * 通过真实运行结果降低传统安全检测中的误报; * 加快漏洞研判、验证与修复效率; * 扩展专业安全团队能够覆盖的软件与系统规模。 GCSA Agent 在 CyberGym 取得 91.3% 的成绩,是 GCSA 构建 AI 原生网络安全能力的重要阶段性成果。 未来,GCSA 将继续推进自主漏洞分析、AI Security Agent 与智能化网络安全技术研究,将前沿人工智能能力进一步转化为真实世界中的安全能力,为构建更加安全、可信和具有韧性的数字环境提供技术支持。 来源: GCSA全球网络安全联盟 官网: www.gcsa.org
