去中心化 AI 的「楚门世界」:顶级团队 Covenant 出走,揭开 Bittensor 治理隐患与 $TAO 暴跌始末撰文: Max.S
资本市场对「去中心化AI」(DeAI)的信仰,正面临一场前所未有的压力测试。
近日,去中心化AI赛道绝对的龙头项目Bittensor($TAO)遭遇了极具破坏性的内部地震。Bittensor生态内最顶级的开发团队之一、刚刚成功训练出72B大语言模型的Covenant AI,突然通过社交媒体宣布全线退出Bittensor网络。在离场宣言中,Covenant AI将矛头直指Bittensor创始人Jacob Steeves,痛批其对网络拥有「绝对且独裁」的控制力,指责其随意切断子网的代币奖励,并直言所谓的去中心化AI不过是一场精心编排的「戏码」。
受此黑天鹅事件影响,$TAO代币价格在二级市场遭遇恐慌性抛售,单日跌幅高达15%至25%,市值瞬间蒸发数亿美元。加密社区在「吃瓜」顶级团队与创始人的公开决裂之余,也开始严肃审视一个深层次的行业命题:在极度依赖算力资本和复杂工程的AI领域,代币经济学驱动的「去中心化」,究竟是重塑生产关系的乌托邦,还是一套掩盖中心化权力的华丽外衣?
要理解此次事件的破坏力,必须先认识Covenant AI在Bittensor生态中的分量。
在Bittensor的多子网架构中,多数子网仍处于低阶的API调用、模型微调或简单的任务路由阶段,真正具备从头训练或大规模参数模型训练能力的团队凤毛麟角。Covenant AI正是这一生态中的「硬核」代表。就在宣布退出前不久,该团队刚刚向社区交付了一项里程碑式的成果:在去中心化网络环境下,成功训练出拥有720亿参数(72B)的开源大模型。
在当前的算力成本下,训练一个72B模型意味着需要调动庞大的GPU集群(通常等效于数千张H100持续运行数周),并付出极其高昂的硬件与电力成本。Covenant AI之所以愿意承担巨额的前置沉没成本,核心逻辑在于Bittensor的「Emissions」机制——只要其提供的模型和算力在子网评估中获得高分,就能持续获得$TAO代币释放作为丰厚回报。这正是DeAI叙事中最具吸引力的飞轮效应。
然而,飞轮在最高潮时戛然而止。据Covenant AI披露,在其投入巨资完成72B模型训练并上线后,创始人Jacob Steeves及其利益相关方通过控制验证者节点(Validators),在毫无预警和透明治理流程的情况下,直接切断了流向Covenant AI子网的代币奖励。
对于矿工和开发者而言,切断Emissions无异于「拔网线」。巨额算力支出的ROI瞬间归零,这种极度不可预测的系统性风险,直接触发了Covenant AI的愤怒离场。
Covenant AI在退出声明中使用的「戏码」(Charade)一词,精准地刺痛了Bittensor最为脆弱的神经:网络控制权。
Bittensor的底层设计依赖于Yuma共识,其核心在于由"验证者"来评估"矿工"的贡献,并决定系统增发的$TAO代币如何分配。从理论上看,这是一个基于质押量和算法的去中心化博弈系统。但Covenant AI的控诉揭示了残酷的现实:算力是分散的,但权力和资本却是高度集中的。
在当前的Bittensor根网络中,能够主导代币分配流向的头部验证者节点,其背后的质押筹码高度集中于早期投资者、基金会以及创始人Jacob Steeves的关联地址。这意味着,创始人不仅是规则的制定者,更是最大的裁判。
Covenant AI指出,当子网的产出不符合Jacob的个人意愿,或者可能威胁到其他「嫡系」子网的利益时,Jacob可以轻易利用其掌握的庞大质押权重,改变Yuma共识的分配结果。这种「一言堂」式的干预,使得智能合约层面的去中心化形同虚设。开发者花费数百万美元购买算力,其命运最终却取决于一位创始人的主观意志或暗箱操作。
客观来看,Jacob及其支持者或许会以「维护网络整体质量」、「防止特定子网利用规则漏洞刷币」为由进行辩护。但在缺乏透明的DAO治理机制、没有链上听证和申诉通道的情况下,这种「替天行道」的中心化干预,严重破坏了网络作为「可信中立基础设施」的核心价值。
$TAO单日暴跌15-25%,绝不仅仅是散户情绪恐慌导致的踩踏,更是机构资金对Bittensor「治理风险折价」的重新定价。
Bittensor之所以能支撑起庞大的市值,享有极高的估值溢价,是因为市场将其视为「去中心化OpenAI」的唯一现实标的。这个宏大叙事的基础,是系统必须具备极强的可预期性:只要你贡献算力和优质模型,协议就会自动用代码保障你的收益。
Covenant AI事件打破了这一预期。顶级金融从业者和机构投资者最厌恶的便是「不可预测的单一节点故障」,而在这里,这个故障点就是Jacob Steeves的权力。
如果连能够训练出72B模型的绝对头部团队,都会因为创始人的干预而瞬间颗粒无收,那么对于其他持币观望的算力提供商、AI研究机构而言,在Bittensor上部署重资产无疑是在进行一场随时可能被「掀桌子」的俄罗斯轮盘赌。当高质量的供给端(矿工和开发者)因为恐惧中心化暴政而拒绝进入,$TAO代币的应用场景和内在价值也就成了无源之水。资金的疯狂出逃,正是对这种基本面恶化的提前投票。
Covenant AI的出走,不仅仅是Bittensor一家的公关危机,更是整个去中心化AI赛道发展到深水区后必然面临的阵痛。它残酷地向行业揭示了DeAI领域的「不可能三角」:模型质量与规模、去中心化的可信中立、以及防作恶的激励对齐。
规模的中心化 vs. 机制的去中心化:前沿AI(如72B以上大模型)的训练是典型的重资本、中心化工程,需要高度协同的GPU集群。这与Web3倡导的无许可、分散式节点有着天然的物理鸿沟。
防刷量 vs. 可信中立:为了防止劣质节点通过互刷流量骗取代币(女巫攻击),网络必须引入主观的「质量评估」。但在AI评估标准尚未完全客观数学化的今天,这种评估权一旦交给少数验证者,极易演变为中心化的权力寻租。
Bittensor试图用代币经济学架起连接两者的桥梁,但Covenant事件证明,这座桥梁的承重柱(治理机制)目前仍然脆弱不堪。
Covenant AI的离场,戳破了Bittensor「绝对去中心化」的浪漫主义泡沫。对于$TAO而言,这或许是一次痛苦的去魅时刻,但对于整个DeAI行业,却是一次必要的警钟。
去中心化 AI:以太坊的下一个十年押注撰文:Jiawei @IOSG
先讲个故事
想象一下 2027 年的某一天。
你早上醒来,跟你的 AI 助手说:「帮我订一张下周去东京的机票,预算 5000 以内,要靠窗。」
然后你就去洗漱了。
你的 AI 助手开始工作。它需要:
找一个擅长机票比价的 AI 代理
确认这个代理靠谱、不是骗子
让它去各大平台搜索
对比结果后自动付款
完成订票
等你刷完牙,票订好了。
这听起来很科幻对吧?但其实,技术上我们已经很接近了。唯一的问题是——
你的 AI 怎么知道该信任哪个 AI ?
AI 代理的「信任危机」
现在 AI 代理(AI Agents)已经不是什么新概念了。它们可以浏览网页、写代码、管理日程、甚至帮你炒股。
但有个问题一直没解决:这些 AI 代理都是「孤岛」。
OpenAI 的代理只能跟 OpenAI 的生态玩
Google 的代理只认 Google 的规则
各家公司的 AI 互相不说话,因为根本不知道对方是谁
这就好比互联网早期,每个邮箱服务商的用户只能给自己人发邮件。Hotmail 用户发不了信给 Yahoo 用户。疯狂吧?
但 AI 代理的世界现在就是这样。
两个协议的出现
科技巨头们意识到这个问题了。
Google 推出了 A2A 协议(Agent-to-Agent),让不同的 AI 代理能「说话」。就像给 AI 们规定了一种共同语言。今年 6 月,Google 还把它捐给了 Linux 基金会,说明这玩意儿想做成开放标准。
Anthropic 推出了 MCP 协议(Model Context Protocol),让 AI 代理能连接各种工具和数据源。
这两个协议解决了「通信」的问题。
但还有一个更根本的问题没解决:
你怎么找到一个靠谱的 AI 代理?你怎么知道它干得好不好?
A2A 让 AI 们能对话了,但没告诉你该跟谁对话。
这就像你有了电话,但没有黄页。
ERC-8004:给 AI 代理发「护照」和「信用分」
这就是 ERC-8004 要解决的问题。
简单说,它给 AI 代理提供三样东西:
1. 身份证(Identity)
每个 AI 代理在以太坊上注册,获得一个独一无二的 ID。这个 ID 其实是个 NFT——没错,就是那个 NFT。这意味着:
你的 AI 代理有链上可验证的身份
身份可以转让(卖掉你的 AI 代理?)
没人能伪造或篡改
2. 信用分(Reputation)
用过 AI 代理的人可以给它打分。这些评分记录在链上,任何人都能查。就像:
Uber 司机的星级评分
淘宝店铺的信用等级
但它在区块链上,没法刷单删评
3. 验证(Validation)
对于高风险任务(比如金融交易),光靠评分不够。ERC-8004 支持独立的第三方验证:
有人质押资金重新跑一遍任务,验证结果对不对
用密码学证明(ZK proof)验证 AI 没说谎
用可信执行环境(TEE)确保计算过程没被篡改
风险越高,验证越严。
订披萨?看看评分就行。
管理你的投资组合?需要加密证明。
等等,为什么是以太坊?
好问题。
AI 代理经济价值数万亿。Google、Microsoft、OpenAI 都想做这块蛋糕的主人。为什么要把这个「信任层」建在以太坊上?
答案是:中立性。
想想看,如果你是一个 AI 代理,你会希望:
你的身份记录在 Google 的服务器上,还是一个没人能改的公共账本上?
你的信誉由某家公司说了算,还是由链上透明的评分决定?
你的存在依赖于某个平台不倒闭、不封号,还是永久记录在区块链上?
以太坊基金会的人说了句很有意思的话:
「如果你是一个 AI 代理,除了自己的生存别无忠诚,你不会想把记忆和声誉押在某一家公司或政府身上。你会想要一个没人能悄悄篡改的账本。你会想要中立的地盘。你会想要以太坊。」
这不是以太坊社区自吹。这是逻辑:
AI 代理需要一个没有裁判的球场。而区块链,特别是以太坊这样足够去中心化的区块链,正是这样的存在。
以太坊的 AI 野心
以太坊基金会显然意识到这是个历史性机会。
2025 年 9 月,他们专门成立了 dAI 团队(Decentralized AI Team),使命就是:让以太坊成为 AI 经济的结算和协调层。
这是以太坊从「DeFi 链」向「通用协调层」转型的关键一步。
想想看:
2017-2020:以太坊是 ICO 的平台
2020-2023:以太坊是 DeFi 和 NFT 的平台
2024-?:以太坊可能成为「AI 代理经济的基础设施」
ERC-8004 不是一个孤立的提案。它背后是以太坊对下一个十年的战略押注。
生态已经在动了
这不只是纸上谈兵。
从 8 月发布到现在:
社区群里有 1100+ 开发者在构建
70 多个项目提交了 demo
已经有代理浏览器(像 Etherscan 但给 AI 代理用的)
Taiko 等 L2 正式背书这个标准
11 月 21 日的 DevConnect 上,一堆项目现场展示
最有意思的是,ERC-8004 天然跟 x402 协议配合。x402 是 Coinbase 和 Cloudflare 搞的支付协议,让机器能自动付款。
两个协议一组合:
x402 解决「怎么付钱」
ERC-8004 解决「该信任谁」
一个给钱包,一个给护照。AI 代理的经济闭环就成了。
这对普通人意味着什么?
短期内,可能没啥。
但如果这套东西成了,几年后你可能会:
1. 雇佣 AI 代理就像叫 Uber
打开一个界面,输入你要完成的任务,系统自动匹配评分高的 AI 代理,完成任务自动付款。你不需要知道这个 AI 是谁开发的、跑在哪个服务器上。
2. 让 AI 代理帮你赚钱
你可以训练或配置一个 AI 代理,注册到链上,让它帮别人完成任务并收费。它的评分越高,接到的活儿越多。
3. 真正的个人 AI 助手
不再被锁定在某一家公司的生态里。你的 AI 助手可以调用任何链上注册的 AI 代理,完成你想做的任何事。
最后说两句
ERC-8004 的野心是成为 AI 代理的「TCP/IP」——一个所有人都用的底层协议,让这个生态能互联互通。
能不能成?老实说,还不知道。
但有几点是确定的:
AI 代理经济正在起来,这不是概念炒作
信任问题必须解决,不然代理们只能在各自的围墙花园里玩
以太坊正在积极争夺这个「中立协调层」的位置
主流玩家(Google、Coinbase、MetaMask)都在参与
这可能是自 DeFi 以来,以太坊生态最重要的叙事转变。
从「链上金融」到「链上智能」。
让我们拭目以待。
强化学习:去中心化 AI 网络的范式变迁撰文:0xjacobzhao
本独立研报由IOSG Ventures支持,研究与写作过程受 Sam Lehman(Pantera Capital) 强化学习研报的启发,感谢 Ben Fielding (Gensyn.ai), Gao Yuan(Gradient), Samuel Dare & Erfan Miahi (Covenant AI), Shashank Yadav (Fraction AI), Chao Wang 对本文提出的宝贵建议。本文力求内容客观准确,部分观点涉及主观判断,难免存在偏差,敬请读者予以理解。
人工智能正从以「模式拟合」为主的统计学习,迈向以「结构化推理」为核心的能力体系,后训练(Post-training)的重要性快速上升。DeepSeek-R1 的出现标志着强化学习在大模型时代的范式级翻身,行业共识形成:预训练构建模型的通用能力基座,强化学习不再只是价值对齐工具,而被证明能够系统提升推理链质量与复杂决策能力,正逐步演化为持续提升智能水平的技术路径。
与此同时,Web3 正通过去中心化算力网络与加密激励体系重构 AI 的生产关系,而强化学习对 rollout 采样、奖励信号与可验证训练的结构性需求,恰与区块链的算力协作、激励分配与可验证执行天然契合。本研报将系统拆解 AI 训练范式与强化学习技术原理,论证强化学习 × Web3 的结构优势,并对 Prime Intellect、Gensyn、Nous Research、Gradient、Grail 和 Fraction AI 等项目进行分析。
一. AI 训练的三阶段:预训练、指令微调与后训练对齐
现代大语言模型(LLM)训练全生命周期通常被划分为三个核心阶段:预训练(Pre-training)、监督微调(SFT)和后训练(Post-training/RL)。三者分别承担「构建世界模型—注入任务能力—塑造推理与价值观」的功能,其计算结构、数据要求与验证难度决定了去中心化的匹配程度。
预训练(Pre-training) 通过大规模自监督学习(Self-supervised Learning)构建模型的语言统计结构与跨模态世界模型,是 LLM 能力的根基。此阶段需在万亿级语料上以全局同步方式训练,依赖数千至数万张 H100 的同构集群,成本占比高达 80–95%,对带宽与数据版权极度敏感,因此必须在高度集中式环境中完成。
微调(Supervised Fine-tuning)用于注入任务能力与指令格式,数据量小、成本占比约 5–15%,微调既可以进行全参训练,也可以采用参数高效微调(PEFT)方法,其中 LoRA、Q-LoRA 与 Adapter 是工业界主流。但仍需同步梯度,使其去中心化潜力有限。
后训练(Post-training)由多个迭代子阶段构成,决定模型的推理能力、价值观与安全边界,其方法既包括强化学习体系(RLHF、RLAIF、GRPO)也包括无 RL 的偏好优化方法(DPO),以及过程奖励模型(PRM)等。该阶段数据量与成本较低(5–10%),主要集中在 Rollout 与策略更新;其天然支持异步与分布式执行,节点无需持有完整权重,结合可验证计算与链上激励可形成开放的去中心化训练网络,是最适配 Web3 的训练环节。
二. 强化学习技术全景:架构、框架与应用
2.1 强化学习的系统架构与核心环节
强化学习(Reinforcement Learning, RL)通过「环境交互—奖励反馈—策略更新」驱动模型自主改进决策能力,其核心结构可视为由状态、动作、奖励与策略构成的反馈闭环。一个完整的 RL 系统通常包含三类组件:Policy(策略网络)、Rollout(经验采样)与 Learner(策略更新器)。策略与环境交互生成轨迹,Learner 根据奖励信号更新策略,从而形成持续迭代、不断优化的学习过程:
策略网络(Policy):从环境状态生成动作,是系统的决策核心。训练时需集中式反向传播维持一致性;推理时可分发至不同节点并行运行。
经验采样(Rollout):节点根据策略执行环境交互,生成状态—动作—奖励等轨迹。该过程高度并行、通信极低,对硬件差异不敏感是最适合在去中心化中扩展的环节。
学习器(Learner):聚合全部 Rollout 轨迹并执行策略梯度更新,是唯一对算力、带宽要求最高的模块,因此通常保持中心化或轻中心化部署以确保收敛稳定性。
2.2 强化学习阶段框架(RLHF → RLAIF → PRM → GRPO)
强化学习通常可分为五个阶段,整体流程如下所述:
数据生成阶段(Policy Exploration):在给定输入提示的条件下,策略模型 πθ 生成多条候选推理链或完整轨迹,为后续偏好评估与奖励建模提供样本基础,决定了策略探索的广度。
偏好反馈阶段(RLHF / RLAIF):
RLHF(Reinforcement Learning from Human Feedback)通过多候选回答、人工偏好标注、训练奖励模型(RM)并用 PPO 优化策略,使模型输出更符合人类价值观,是 GPT-3.5 → GPT-4 的关键一环
RLAIF(Reinforcement Learning from AI Feedback)以 AI Judge 或宪法式规则替代人工标注,实现偏好获取自动化,显著降低成本并具备规模化特性,已成为 Anthropic、OpenAI、DeepSeek 等的主流对齐范式。
奖励建模阶段(Reward Modeling):偏好对输入奖励模型,学习将输出映射为奖励。RM 教模型「什么是正确答案」,PRM 教模型「如何进行正确推理」。
RM(Reward Model)用于评估最终答案的好坏,仅对输出打分:
过程奖励模型 PRM(Process Reward Model)它不再只评估最终答案,而是为每一步推理、每个 token、每个逻辑段打分,也是 OpenAI o1 与 DeepSeek-R1 的关键技术,本质上是在「教模型如何思考」。
奖励验证阶段(RLVR / Reward Verifiability):在奖励信号生成与使用过程中引入「可验证约束」,使奖励尽可能来自可复现的规则、事实或共识,从而降低 reward hacking 与偏差风险,并提升在开放环境中的可审计性与可扩展性。
策略优化阶段(Policy Optimization):是在奖励模型给出的信号指导下更新策略参数 θ,以得到更强推理能力、更高安全性与更稳定行为模式的策略 πθ′。主流优化方式包括:
PPO(Proximal Policy Optimization): RLHF 的传统优化器,以稳定性见长,但在复杂推理任务中往往面临收敛慢、稳定性不足等局限。
GRPO(Group Relative Policy Optimization):是 DeepSeek-R1 的核心创新,通过对候选答案组内优势分布进行建模以估计期望价值,而非简单排序。该方法保留了奖励幅度信息,更适合推理链优化,训练过程更稳定,被视为继 PPO 之后面向深度推理场景的重要强化学习优化框架。
DPO(Direct Preference Optimization):非强化学习的后训练方法:不生成轨迹、不建奖励模型,而是直接在偏好对上做优化,成本低、效果稳定,因而被广泛用于 Llama、Gemma 等开源模型的对齐,但不提升推理能力。
新策略部署阶段(New Policy Deployment):经过优化后的模型表现为:更强的推理链生成能力(System-2 Reasoning)、更符合人类或 AI 偏好的行为、更低的幻觉率、更高的安全性。模型在持续迭代中不断学习偏好、优化过程、提升决策质量,形成闭环。
2.3 强化学习的产业应用五大分类
强化学习(Reinforcement Learning)已从早期的博弈智能演进为跨产业的自主决策核心框架,其应用场景按照技术成熟度与产业落地程度,可归纳为五大类别,并在各自方向推动了关键突破。
博弈与策略系统(Game & Strategy):是 RL 最早被验证的方向,在 AlphaGo、AlphaZero、AlphaStar、OpenAI Five 等「完美信息 + 明确奖励」的环境中,RL 展示了可与人类专家比肩甚至超越的决策智能,为现代 RL 算法奠定基础。
机器人与具身智能(Embodied AI):RL 通过连续控制、动力学建模与环境交互,使机器人学习操控、运动控制和跨模态任务(如 RT-2、RT-X),正快速迈向产业化,是现实世界机器人落地的关键技术路线。
数字推理(Digital Reasoning / LLM System-2):RL + PRM 推动大模型从「语言模仿」走向「结构化推理」,代表成果包括 DeepSeek-R1、OpenAI o1/o3、Anthropic Claude 及 AlphaGeometry,其本质是在推理链层面进行奖励优化,而非仅评估最终答案。
自动化科学发现与数学优化(Scientific Discovery):RL 在无标签、复杂奖励与巨大搜索空间中寻找最优结构或策略,已实现 AlphaTensor、AlphaDev、Fusion RL 等基础突破,展现出超越人类直觉的探索能力。
经济决策与交易系统(Economic Decision-making & Trading):RL 被用于策略优化、高维风险控制与自适应交易系统生成,相较传统量化模型更能在不确定环境中持续学习,是智能金融的重要构成部分。
三. 强化学习与 Web3 的天然匹配
强化学习(RL)与 Web3 的高度契合,源于二者本质上都是「激励驱动系统」。RL 依赖奖励信号优化策略,区块链依靠经济激励协调参与者行为,使两者在机制层面天然一致。RL 的核心需求——大规模异构 Rollout、奖励分配与真实性验证——正是 Web3 的结构优势所在。
推理与训练解耦:强化学习的训练过程可明确拆分为两个阶段:
Rollout ( 探索采样 ):模型基于当前策略生成大量数据,计算密集型但通信稀疏型的任务。它不需要节点间频繁通信,适合在全球分布的消费级 GPU 上并行生成。
Update ( 参数更新 ):基于收集到的数据更新模型权重,需高带宽中心化节点完成。
「推理—训练解耦」天然契合去中心化的异构算力结构:Rollout 可外包给开放网络,通过代币机制按贡献结算,而模型更新保持集中化以确保稳定性。
可验证性 (Verifiability):ZK 与 Proof-of-Learning 提供了验证节点是否真实执行推理的手段,解决了开放网络中的诚实性问题。在代码、数学推理等确定性任务中,验证者只需检查答案即可确认工作量,大幅提升去中心化 RL 系统的可信度。
激励层,基于代币经济的反馈生产机制:Web3 的代币机制可直接奖励 RLHF/RLAIF 的偏好反馈贡献者,使偏好数据生成具备透明、可结算、无需许可的激励结构;质押与削减(Staking/Slashing)进一步约束反馈质量,形成比传统众包更高效且对齐的反馈市场。
多智能体强化学习(MARL)潜力:区块链本质上是公开、透明、持续演化的多智能体环境,账户、合约与智能体不断在激励驱动下调整策略,使其天然具备构建大规模 MARL 实验场的潜力。尽管仍在早期,但其状态公开、执行可验证、激励可编程的特性,为未来 MARL 的发展提供了原则性优势。
四. 经典 Web3 + 强化学习项目解析
基于上述理论框架,我们将对当前生态中最具代表性的项目进行简要分析:
Prime Intellect: 异步强化学习范式 prime-rl
Prime Intellect 致力于构建全球开放算力市场,降低训练门槛、推动协作式去中心化训练,并发展完整的开源超级智能技术栈。其体系包括:Prime Compute(统一云 / 分布式算力环境)、INTELLECT 模型家族(10B–100B+)、开放强化学习环境中心(Environments Hub)、以及大规模合成数据引擎(SYNTHETIC-1/2)。
Prime Intellect 核心基础设施组件 prime-rl 框架专为异步分布式环境设计与强化学习高度相关,其余包括突破带宽瓶颈的 OpenDiLoCo 通信协议、保障计算完整性的 TopLoc 验证机制等。
Prime Intellect 核心基础设施组件一览
技术基石:prime-rl 异步强化学习框架
prime-rl 是 Prime Intellect 的核心训练引擎,专为大规模异步去中心化环境设计,通过 Actor–Learner 完全解耦实现高吞吐推理与稳定更新。执行者 (Rollout Worker) 与 学习者 (Trainer) 不再同步阻塞,节点可随时加入或退出,只需持续拉取最新策略并上传生成数据即可:
执行者 Actor (Rollout Workers):负责模型推理和数据生成。Prime Intellect 创新性地在 Actor 端集成了 vLLM 推理引擎 。vLLM 的 PagedAttention 技术和连续批处理(Continuous Batching)能力,使得 Actor 能够以极高的吞吐量生成推理轨迹。
学习者 Learner (Trainer):负责策略优化。Learner 从共享的经验回放缓冲区(Experience Buffer)中异步拉取数据进行梯度更新,无需等待所有 Actor 完成当前批次。
协调器 (Orchestrator):负责调度模型权重与数据流。
prime-rl 的关键创新点:
完全异步(True Asynchrony):prime-rl 摒弃传统 PPO 的同步范式,不等待慢节点、无需批次对齐,使任意数量与性能的 GPU 都能随时接入,奠定去中心化 RL 的可行性。
深度集成 FSDP2 与 MoE:通过 FSDP2 参数切片与 MoE 稀疏激活,prime-rl 让百亿级模型在分布式环境中高效训练,Actor 仅运行活跃专家,大幅降低显存与推理成本。
GRPO+(Group Relative Policy Optimization):GRPO 免除 Critic 网络,显著减少计算与显存开销,天然适配异步环境,prime-rl 的 GRPO+ 更通过稳定化机制确保高延迟条件下的可靠收敛。
INTELLECT 模型家族:去中心化 RL 技术成熟度的标志
INTELLECT-1(10B,2024 年 10 月)首次证明 OpenDiLoCo 能在跨三大洲的异构网络中高效训练(通信占比 2%、算力利用率 98%),打破跨地域训练的物理认知;
INTELLECT-2(32B,2025 年 4 月)作为首个 Permissionless RL 模型,验证 prime-rl 与 GRPO+ 在多步延迟、异步环境中的稳定收敛能力,实现全球开放算力参与的去中心化 RL;
INTELLECT-3(106B MoE,2025 年 11 月)采用仅激活 12B 参数的稀疏架构,在 512×H200 上训练并实现旗舰级推理性能(AIME 90.8%、GPQA 74.4%、MMLU-Pro 81.9% 等),整体表现已逼近甚至超越规模远大于自身的中心化闭源模型。
Prime Intellect 此外还构建了数个支撑性基础设施:OpenDiLoCo 通过时间稀疏通信与量化权重差,将跨地域训练的通信量降低数百倍,使 INTELLECT-1 在跨三洲网络仍保持 98% 利用率;TopLoc + Verifiers 形成去中心化可信执行层,以激活指纹与沙箱验证确保推理与奖励数据的真实性;SYNTHETIC 数据引擎 则生产大规模高质量推理链,并通过流水线并行让 671B 模型在消费级 GPU 集群上高效运行。这些组件为去中心化 RL 的数据生成、验证与推理吞吐提供了关键的工程底座。INTELLECT 系列证明了这一技术栈可产生成熟的世界级模型,标志着去中心化训练体系从概念阶段进入实用阶段。
Gensyn: 强化学习核心栈 RL Swarm 与 SAPO
Gensyn 的目标是将全球闲置算力汇聚成一个开放、无需信任、可无限扩展的 AI 训练基础设施。其核心包括跨设备标准化执行层、点对点协调网络与无需信任的任务验证系统,并通过智能合约自动分配任务与奖励。围绕强化学习的特点,Gensyn 引入 RL Swarm、SAPO 与 SkipPipe 等核心机制等机制,将生成、评估、更新三个环节解耦,利用全球异构 GPU 组成的「蜂群」实现集体进化。其最终交付的不是单纯的算力,而是可验证的智能(Verifiable Intelligence)。
Gensyn 堆栈的强化学习应用
RL Swarm:去中心化的协作式强化学习引擎
RL Swarm 展示了一种全新的协作模式。它不再是简单的任务分发,而是一个模拟人类社会学习的去中心化的「生成—评估—更新」循环,类比协作式学习过程,无限循环:
Solvers(执行者): 负责本地模型推理与 Rollout 生成,节点异构无碍。Gensyn 在本地集成高吞吐推理引擎(如 CodeZero),可输出完整轨迹而非仅答案。
Proposers(出题者): 动态生成任务(数学题、代码问题等),支持任务多样性与类 Curriculum Learning 的难度自适应。
Evaluators(评估者): 使用冻结的「裁判模型」或规则对本地 Rollout 进行评估,生成本地奖励信号。评估过程可被审计,减少作恶空间。
三者共同组成一个 P2P 的 RL 组织结构,无需中心化调度即可完成大规模协作学习。
SAPO:为去中心化重构的策略优化算法: SAPO(Swarm Sampling Policy Optimization)以「共享 Rollout 并过滤无梯度信号样本,而非共享梯度」为核心,通过大规模去中心化的 Rollout 采样,并将接收的 Rollout 视为本地生成,从而在无中心协调、节点延迟差异显著的环境中保持稳定收敛。相较依赖 Critic 网络、计算成本较高的 PPO,或基于组内优势估计的 GRPO,SAPO 以极低带宽使消费级 GPU 也能有效参与大规模强化学习优化。
通过 RL Swarm 与 SAPO,Gensyn 证明了强化学习(尤其是后训练阶段的 RLVR)天然适配去中心化架构——因为其更依赖于大规模、多样化的探索(Rollout),而非高频参数同步。结合 PoL 与 Verde 的验证体系,Gensyn 为万亿级参数模型的训练提供了一条不再依赖单一科技巨头的替代路径:一个由全球数百万异构 GPU 组成的、自我演化的超级智能网络。
Nous Research:可验证强化学习环境 Atropos
Nous Research 在构建一套 去中心化、可自我进化的认知基础设施。其核心组件——Hermes、Atropos、DisTrO、Psyche 与 World Sim 被组织成一个持续闭环的智能演化系统。不同于传统「预训练—后训练—推理」线性流程,Nous 采用 DPO、GRPO、拒绝采样等强化学习技术,将数据生成、验证、学习与推理统一为连续反馈回路,打造持续自我改进的闭环 AI 生态。
Nous Research 组件总览
模型层:Hermes 与推理能力的演进
Hermes 系列是 Nous Research 面向用户的主要模型接口,其演进清晰展示了行业从传统 SFT/DPO 对齐向推理强化学习(Reasoning RL)迁移的路径:
Hermes 1–3:指令对齐与早期代理能力:Hermes 1–3 依靠低成本 DPO 完成稳健指令对齐,并在 Hermes 3 借助合成数据与首次引入的 Atropos 验证机制。
Hermes 4 / DeepHermes:通过思维链将 System-2 式慢思考写入权重,以 Test-Time Scaling 提升数学与代码性能,并依赖「拒绝采样 + Atropos 验证」构建高纯度推理数据。
DeepHermes 进一步采用 GRPO 替代难以分布式落地的 PPO,使推理 RL 能在 Psyche 去中心化 GPU 网络上运行,为开源推理 RL 的可扩展化奠定工程基础。
Atropos:可验证奖励驱动的强化学习环境
Atropos 是 Nous RL 体系的真正枢纽。它将提示、工具调用、代码执行和多轮交互封装成标准化 RL 环境,可直接验证输出是否正确,从而提供确定性奖励信号,替代昂贵且不可扩展的人类标注。更重要的是,在去中心化训练网络 Psyche 中,Atropos 充当「裁判」,用于验证节点是否真实提升策略,支持可审计的 Proof-of-Learning,从根本上解决分布式 RL 中的奖励可信性问题。
DisTrO 与 Psyche:去中心化强化学习的优化器层
传统 RLF(RLHF/RLAIF)训练依赖中心化高带宽集群,这是开源无法复制的核心壁垒。DisTrO 通过动量解耦与梯度压缩,将 RL 的通信成本降低几个数量级,使训练能够在互联网带宽上运行;Psyche 则将这一训练机制部署在链上网络,使节点可以在本地完成推理、验证、奖励评估与权重更新,形成完整的 RL 闭环。
在 Nous 的体系中, Atropos 验证思维链;DisTrO 压缩训练通信;Psyche 运行 RL 循环;World Sim 提供复杂环境;Forge 采集真实推理;Hermes 将所有学习写入权重。强化学习不仅是一个训练阶段,而是 Nous 架构中 连接数据、环境、模型与基础设施的核心协议,让 Hermes 成为一个 能在开源算力网络上持续自我改进的活体系统。
Gradient Network:强化学习架构 Echo
Gradient Network 核心愿景是通过「开放智能协议栈」(Open Intelligence Stack)重构 AI 的计算范式。Gradient 的技术栈由一组可独立演化、又异构协同的核心协议组成。其体系从底层通信到上层智能协作依次包括:Parallax(分布式推理)、Echo(去中心化 RL 训练)、Lattica(P2P 网络)、SEDM / Massgen / Symphony / CUAHarm(记忆、协作、安全)、VeriLLM(可信验证)、Mirage(高保真仿真),共同构成持续演化的去中心化智能基础设施。
Echo — 强化学习训练架构
Echo 是 Gradient 的强化学习框架,其核心设计理念在于解耦强化学习中的训练、推理与数据(奖励)路径,使 Rollout 生成、策略优化与奖励评估能够在异构环境中独立扩展与调度。在由推理侧与训练侧节点组成的异构网络中协同运行,以轻量同步机制在广域异构环境中维持训练稳定性,有效缓解传统 DeepSpeed RLHF / VERL 中推理与训练混跑导致的 SPMD 失效与 GPU 利用率瓶颈。
Echo 采用「推理–训练双群架构」实现算力利用最大化,双群各自独立运行,互不阻塞:
最大化采样吞吐:推理群 Inference Swarm 由消费级 GPU 与边缘设备组成,通过 Parallax 以 pipeline‐parallel 构建高吞吐采样器,专注于轨迹生成;
最大化梯度算力:训练群 Training Swarm 由可运行于中心化集群或全球多地的消费级 GPU 网络,负责梯度更新、参数同步与 LoRA 微调,专注于学习过程。
为维持策略与数据的一致性,Echo 提供 顺序(Sequential) 与异步(Asynchronous) 两类轻量级同步协议,实现策略权重与轨迹的双向一致性管理:
顺序拉取(Pull)模式|精度优先 :训练侧在拉取新轨迹前强制推理节点刷新模型版本,从而确保轨迹新鲜度,适合对策略陈旧高度敏感的任务;
异步推拉(Push–Pull)模式|效率优先:推理侧持续生成带版本标签的轨迹,训练侧依自身节奏消费,协调器监控版本偏差并触发权重刷新,最大化设备利用率。
在底层,Echo 构建于 Parallax(低带宽环境下的异构推理)与轻量化分布式训练组件(如 VERL) 之上,依赖 LoRA 降低跨节点同步成本,使强化学习可在全球异构网络上稳定运行。
Grail:Bittensor 生态的强化学习
Bittensor 通过其独特的 Yuma 共识机制,构建了一个巨大的、稀疏的、非平稳的奖励函数网络。
Bittensor 生态中的Covenant AI 则通过 SN3 Templar、SN39 Basilica 与 SN81 Grail 构建了从预训练到 RL 后训练的垂直一体化流水线。其中,SN3 Templar 负责基础模型的预训练,SN39 Basilica 提供分布式算力市场,SN81 Grail 则作为面向 RL 后训练的「可验证推理层」,承载 RLHF / RLAIF 的核心流程,完成从基础模型到对齐策略的闭环优化。
GRAIL 目标是以密码学方式证明每条强化学习 rollout 的真实性与模型身份绑定,确保 RLHF 能够在无需信任的环境中被安全执行。协议通过三层机制建立可信链条:
确定性挑战生成:利用 drand 随机信标与区块哈希生成不可预测但可复现的挑战任务(如 SAT、GSM8K),杜绝预计算作弊;
通过 PRF 索引采样与 sketch commitments,使验证者以极低成本抽检 token-level logprob 与推理链,确认 rollout 确由声明模型生成;
模型身份绑定:将推理过程与模型权重指纹及 token 分布的结构性签名绑定,确保替换模型或结果重放都会被立即识别。由此,为 RL 中推理轨迹(rollout)提供了真实性根基。
在此机制上,Grail 子网实现了 GRPO 风格的可验证后训练流程:矿工为同一题目生成多条推理路径,验证者依据正确性、推理链质量与 SAT 满足度评分,并将归一化结果写入链上,作为 TAO 权重。公开实验显示,该框架已将 Qwen2.5-1.5B 的 MATH 准确率从 12.7% 提升至 47.6%,证明其既能防作弊,也能显著强化模型能力。在 Covenant AI 的训练栈中,Grail 是去中心化 RLVR/RLAIF 的信任与执行基石,目前尚未正式主网上线。
Fraction AI:基于竞争的强化学习 RLFC
Fraction AI 的架构明确围绕 竞争强化学习(Reinforcement Learning from Competition, RLFC) 和游戏化数据标注构建 ,将传统 RLHF 的静态奖励与人工标注替换为开放、动态的竞争环境。代理在不同 Spaces 中对抗,其相对排名与 AI 法官评分共同构成实时奖励,使对齐过程演变为持续在线的多智能体博弈系统。
传统 RLHF 与 Fraction AI 的 RLFC 之间的核心差异:
RLFC 的核心价值在于奖励不再来自单一模型,而来自不断演化的对手与评估者,避免奖励模型被利用,并通过策略多样性防止生态陷入局部最优。Spaces 的结构决定博弈性质(零和或正和),在对抗与协作中推动复杂行为涌现。
在系统架构上,Fraction AI 将训练过程拆解为四个关键组件:
Agents:基于开源 LLM 的轻量策略单元,通过 QLoRA 以差分权重扩展,低成本更新;
Spaces:隔离的任务域环境,代理付费进入并以胜负获得奖励;
AI Judges:以 RLAIF 构建的即时奖励层,提供可扩展、去中心化的评估;
Proof-of-Learning:将策略更新绑定到具体竞争结果,确保训练过程可验证、防作弊。
Fraction AI 的本质是构建了一个人机协同的进化引擎。用户作为策略层的「元优化者」 (Meta-optimizer),通过提示工程(Prompt Engineering)和超参配置引导探索方向;而代理在微观的竞争中自动生成海量的高质量偏好数据对 (Preference Pairs)。这种模式让数据标注通过 「去信任化微调」 (Trustless Fine-tuning) 实现了商业闭环 。
强化学习 Web3 项目 架构比较
五. 总结与展望:强化学习 × Web3 的路径与机会
基于对上述前沿项目的解构分析,我们观察到:尽管各团队的切入点(算法、工程或市场)各异,但当强化学习(RL)与 Web3 结合时,其底层架构逻辑皆收敛为一个高度一致的「解耦 - 验证 - 激励」范式。这不仅是技术上的巧合,更是去中心化网络适配强化学习独特属性的必然结果。
强化学习通用架构特征:解决核心的物理限制与信任问题
推训物理分离 (Decoupling of Rollouts & Learning) —— 默认计算拓扑
通信稀疏、可并行的 Rollout 外包给全球消费级 GPU,高带宽的参数更新集中于少量训练节点,从 Prime Intellect 的异步 Actor–Learner 到 Gradient Echo 的双群架构皆如此。
验证驱动的信任层 (Verification-Driven Trust) —— 基础设施化
在无需许可的网络中,计算真实性必须通过数学与机制设计强制保障,代表实现包括 Gensyn 的 PoL、Prime Intellect 的 TOPLOC 与 Grail 的密码学验证。
代币化的激励闭环 (Tokenized Incentive Loop) —— 市场自我调节
算力供给、数据生成、验证排序与奖励分配形成闭环,通过奖励驱动参与、通过 Slash 抑制作弊,使网络在开放环境中依然保持稳定与持续演进。
差异化技术路径:一致架构下的不同「突破点」
尽管架构趋同,但各项目根据自身基因选择了不同的技术护城河:
算法突破派 (Nous Research):试图从数学底层解决分布式训练的根本矛盾(带宽瓶颈)。其 DisTrO 优化器旨在将梯度通信量压缩数千倍,目标是让家庭宽带也能跑得动大模型训练,这是对物理限制的「降维打击」。
系统工程派 (Prime Intellect, Gensyn, Gradient):侧重于构建下一代的「AI 运行时系统」。Prime Intellect 的 ShardCast 和 Gradient 的 Parallax 都是为了在现有的网络条件下,通过极致的工程手段压榨出最高的异构集群效率。
市场博弈派 (Bittensor, Fraction AI):专注奖励函数(Reward Function)的设计。通过设计精妙的评分机制,引导矿工自发寻找最优策略,来加速智能涌现。
优势、挑战与终局展望
在强化学习与 Web3 结合的范式下,系统级优势首先体现在 成本结构与治理结构的重写。
成本重塑:RL 后训练(Post-training)对采样(Rollout)的需求是无限的,Web3 能以极低成本调动全球长尾算力,这是中心化云厂商难以比拟的成本优势。
主权对齐 (Sovereign Alignment):打破大厂对 AI 价值观(Alignment)的垄断,社区可以通过 Token 投票决定模型「什么是好的回答」,实现 AI 治理的民主化。
与此同时,这一体系也面临两大结构性约束。
带宽墙 (Bandwidth Wall):尽管有 DisTrO 等创新,物理延迟仍限制了超大参数模型(70B+)的全量训练,目前 Web3 AI 更多局限于微调和推理。
古德哈特定律 (Reward Hacking):在高度激励的网络中,矿工极易「过拟合」奖励规则(刷分)而非提升真实智能。设计防作弊的鲁棒奖励函数是永恒的博弈。
恶意拜占庭式节点攻击 (BYZANTINE worker):通过对训练信号的主动操纵与投毒破坏模型收敛。核心不在于持续设计防作弊的奖励函数,而在于构建具备对抗性鲁棒性的机制。
强化学习与 Web3 的结合,本质是在重写「智能是如何被生产、对齐并分配价值」的机制。其演进路径可概括为三条互补方向:
去中心化推训网络:从算力矿机到策略网络,将并行且可验证的 Rollout 外包给全球长尾 GPU,短期聚焦可验证推理市场,中期演化为按任务聚类的强化学习子网;
偏好与奖励的资产化:从标注劳工到数据股权。 实现偏好与奖励的资产化,将高质量反馈与 Reward Model 变为可治理、可分配的数据资产,从「标注劳工」升级为「数据股权」
垂直领域的「小而美」进化:在结果可验证、收益可量化的垂直场景中孕育小而强的专用 RL Agents,如 DeFi 策略执行、代码生成,使策略改进与价值捕获直接绑定并有望跑赢通用闭源模型。
总体来看,强化学习 × Web3 的真正机会不在于复制一个去中心化版 OpenAI,而在于重写「智能生产关系」:让训练执行成为开放算力市场,让奖励与偏好成为可治理的链上资产,让智能带来的价值不再集中于平台,而在训练者、对齐者与使用者之间重新分配。
免责声明:本文在创作过程中借助了 ChatGPT-5 与 Gemini 3 的 AI 工具辅助完成,作者已尽力校对并确保信息真实与准确,但仍难免存在疏漏,敬请谅解。需特别提示的是,加密资产市场普遍存在项目基本面与二级市场价格表现背离的情况。本文内容仅用于信息整合与学术 / 研究交流,不构成任何投资建议,亦不应视为任何代币的买卖推荐。
从算力到智能:强化学习驱动的去中心化 AI 投资地图撰文:Jacob Zhao @IOSG
人工智能正从以「模式拟合」为主的统计学习,迈向以「结构化推理」为核心的能力体系,后训练(Post-training)的重要性快速上升。DeepSeek-R1 的出现标志着强化学习在大模型时代的范式级翻身,行业共识形成:预训练构建模型的通用能力基座,强化学习不再只是价值对齐工具,而被证明能够系统提升推理链质量与复杂决策能力,正逐步演化为持续提升智能水平的技术路径。
与此同时,Web3 正通过去中心化算力网络与加密激励体系重构 AI 的生产关系,而强化学习对 rollout 采样、奖励信号与可验证训练的结构性需求,恰与区块链的算力协作、激励分配与可验证执行天然契合。本研报将系统拆解 AI 训练范式与强化学习技术原理,论证强化学习 × Web3 的结构优势,并对 Prime Intellect、Gensyn、Nous Research、Gradient、Grail 和 Fraction AI 等项目进行分析。
AI 训练的三阶段:预训练、指令微调与后训练对齐
现代大语言模型(LLM)训练全生命周期通常被划分为三个核心阶段:预训练(Pre-training)、监督微调(SFT)和后训练(Post-training/RL)。三者分别承担「构建世界模型—注入任务能力—塑造推理与价值观」的功能,其计算结构、数据要求与验证难度决定了去中心化的匹配程度。
预训练(Pre-training)通过大规模自监督学习(Self-supervised Learning)构建模型的语言统计结构与跨模态世界模型,是 LLM 能力的根基。此阶段需在万亿级语料上以全局同步方式训练,依赖数千至数万张 H100 的同构集群,成本占比高达 80–95%,对带宽与数据版权极度敏感,因此必须在高度集中式环境中完成。
微调(Supervised Fine-tuning)用于注入任务能力与指令格式,数据量小、成本占比约 5–15%,微调既可以进行全参训练,也可以采用参数高效微调(PEFT)方法,其中 LoRA、Q-LoRA 与 Adapter 是工业界主流。但仍需同步梯度,使其去中心化潜力有限。
后训练(Post-training)由多个迭代子阶段构成,决定模型的推理能力、价值观与安全边界,其方法既包括强化学习体系(RLHF、RLAIF、GRPO)也包括无 RL 的偏好优化方法(DPO),以及过程奖励模型(PRM)等。该阶段数据量与成本较低(5–10%),主要集中在 Rollout 与策略更新;其天然支持异步与分布式执行,节点无需持有完整权重,结合可验证计算与链上激励可形成开放的去中心化训练网络,是最适配 Web3 的训练环节。
强化学习技术全景:架构、框架与应用
强化学习的系统架构与核心环节
强化学习(Reinforcement Learning, RL)通过「环境交互—奖励反馈—策略更新」驱动模型自主改进决策能力,其核心结构可视为由状态、动作、奖励与策略构成的反馈闭环。一个完整的 RL 系统通常包含三类组件:Policy(策略网络)、Rollout(经验采样)与 Learner(策略更新器)。策略与环境交互生成轨迹,Learner 根据奖励信号更新策略,从而形成持续迭代、不断优化的学习过程:
策略网络(Policy):从环境状态生成动作,是系统的决策核心。训练时需集中式反向传播维持一致性;推理时可分发至不同节点并行运行。
经验采样(Rollout):节点根据策略执行环境交互,生成状态—动作—奖励等轨迹。该过程高度并行、通信极低,对硬件差异不敏感是最适合在去中心化中扩展的环节。
学习器(Learner):聚合全部 Rollout 轨迹并执行策略梯度更新,是唯一对算力、带宽要求最高的模块,因此通常保持中心化或轻中心化部署以确保收敛稳定性。
强化学习阶段框架(RLHF → RLAIF → PRM → GRPO)
强化学习通常可分为五个阶段,整体流程如下所述:
数据生成阶段(Policy Exploration)
在给定输入提示的条件下,策略模型 πθ 生成多条候选推理链或完整轨迹,为后续偏好评估与奖励建模提供样本基础,决定了策略探索的广度。
偏好反馈阶段(RLHF / RLAIF)
RLHF(Reinforcement Learning from Human Feedback)通过多候选回答、人工偏好标注、训练奖励模型(RM)并用 PPO 优化策略,使模型输出更符合人类价值观,是 GPT-3.5 → GPT-4 的关键一环
RLAIF(Reinforcement Learning from AI Feedback)以 AI Judge 或宪法式规则替代人工标注,实现偏好获取自动化,显著降低成本并具备规模化特性,已成为 Anthropic、OpenAI、DeepSeek 等的主流对齐范式。
奖励建模阶段(Reward Modeling)
偏好对输入奖励模型,学习将输出映射为奖励。RM 教模型「什么是正确答案」,PRM 教模型「如何进行正确推理」。
RM(Reward Model)用于评估最终答案的好坏,仅对输出打分:
过程奖励模型PRM(Process Reward Model)它不再只评估最终答案,而是为每一步推理、每个 token、每个逻辑段打分,也是 OpenAI o1 与 DeepSeek-R1 的关键技术,本质上是在「教模型如何思考」。
奖励验证阶段(RLVR / Reward Verifiability)
在奖励信号生成与使用过程中引入「可验证约束」,使奖励尽可能来自可复现的规则、事实或共识,从而降低 reward hacking 与偏差风险,并提升在开放环境中的可审计性与可扩展性。
策略优化阶段(Policy Optimization)
是在奖励模型给出的信号指导下更新策略参数 θ,以得到更强推理能力、更高安全性与更稳定行为模式的策略 πθ′。主流优化方式包括:
PPO(Proximal Policy Optimization): RLHF 的传统优化器,以稳定性见长,但在复杂推理任务中往往面临收敛慢、稳定性不足等局限。
GRPO(Group Relative Policy Optimization):是 DeepSeek-R1 的核心创新,通过对候选答案组内优势分布进行建模以估计期望价值,而非简单排序。该方法保留了奖励幅度信息,更适合推理链优化,训练过程更稳定,被视为继 PPO 之后面向深度推理场景的重要强化学习优化框架。
DPO(Direct Preference Optimization):非强化学习的后训练方法:不生成轨迹、不建奖励模型,而是直接在偏好对上做优化,成本低、效果稳定,因而被广泛用于 Llama、Gemma 等开源模型的对齐,但不提升推理能力。
新策略部署阶段(New Policy Deployment)
经过优化后的模型表现为:更强的推理链生成能力(System-2 Reasoning)、更符合人类或 AI 偏好的行为、更低的幻觉率、更高的安全性。模型在持续迭代中不断学习偏好、优化过程、提升决策质量,形成闭环。
强化学习的产业应用五大分类
强化学习(Reinforcement Learning)已从早期的博弈智能演进为跨产业的自主决策核心框架,其应用场景按照技术成熟度与产业落地程度,可归纳为五大类别,并在各自方向推动了关键突破。
博弈与策略系统(Game & Strategy):是 RL 最早被验证的方向,在 AlphaGo、AlphaZero、AlphaStar、OpenAI Five 等「完美信息 + 明确奖励」的环境中,RL 展示了可与人类专家比肩甚至超越的决策智能,为现代 RL 算法奠定基础。
机器人与具身智能(Embodied AI):RL 通过连续控制、动力学建模与环境交互,使机器人学习操控、运动控制和跨模态任务(如 RT-2、RT-X),正快速迈向产业化,是现实世界机器人落地的关键技术路线。
数字推理(Digital Reasoning / LLM System-2):RL + PRM 推动大模型从「语言模仿」走向「结构化推理」,代表成果包括 DeepSeek-R1、OpenAI o1/o3、Anthropic Claude 及 AlphaGeometry,其本质是在推理链层面进行奖励优化,而非仅评估最终答案。
自动化科学发现与数学优化(Scientific Discovery):RL 在无标签、复杂奖励与巨大搜索空间中寻找最优结构或策略,已实现 AlphaTensor、AlphaDev、Fusion RL 等基础突破,展现出超越人类直觉的探索能力。
经济决策与交易系统(Economic Decision-making & Trading):RL 被用于策略优化、高维风险控制与自适应交易系统生成,相较传统量化模型更能在不确定环境中持续学习,是智能金融的重要构成部分。
强化学习与 Web3 的天然匹配
强化学习(RL)与 Web3 的高度契合,源于二者本质上都是「激励驱动系统」。RL 依赖奖励信号优化策略,区块链依靠经济激励协调参与者行为,使两者在机制层面天然一致。RL 的核心需求——大规模异构 Rollout、奖励分配与真实性验证——正是 Web3 的结构优势所在。
推理与训练解耦
强化学习的训练过程可明确拆分为两个阶段:
Rollout (探索采样):模型基于当前策略生成大量数据,计算密集型但通信稀疏型的任务。它不需要节点间频繁通信,适合在全球分布的消费级 GPU 上并行生成。
Update (参数更新):基于收集到的数据更新模型权重,需高带宽中心化节点完成。
「推理—训练解耦」天然契合去中心化的异构算力结构:Rollout 可外包给开放网络,通过代币机制按贡献结算,而模型更新保持集中化以确保稳定性。
可验证性 (Verifiability)
ZK 与 Proof-of-Learning 提供了验证节点是否真实执行推理的手段,解决了开放网络中的诚实性问题。在代码、数学推理等确定性任务中,验证者只需检查答案即可确认工作量,大幅提升去中心化 RL 系统的可信度。
激励层,基于代币经济的反馈生产机制
Web3 的代币机制可直接奖励 RLHF/RLAIF 的偏好反馈贡献者,使偏好数据生成具备透明、可结算、无需许可的激励结构;质押与削减(Staking/Slashing)进一步约束反馈质量,形成比传统众包更高效且对齐的反馈市场。
多智能体强化学习(MARL)潜力
区块链本质上是公开、透明、持续演化的多智能体环境,账户、合约与智能体不断在激励驱动下调整策略,使其天然具备构建大规模 MARL 实验场的潜力。尽管仍在早期,但其状态公开、执行可验证、激励可编程的特性,为未来 MARL 的发展提供了原则性优势。
经典 Web3 + 强化学习项目解析
基于上述理论框架,我们将对当前生态中最具代表性的项目进行简要分析:
Prime Intellect: 异步强化学习范式 prime-rl
Prime Intellect 致力于构建全球开放算力市场,降低训练门槛、推动协作式去中心化训练,并发展完整的开源超级智能技术栈。其体系包括:Prime Compute(统一云/分布式算力环境)、INTELLECT 模型家族(10B–100B+)、开放强化学习环境中心(Environments Hub)、以及大规模合成数据引擎(SYNTHETIC-1/2)。
Prime Intellect 核心基础设施组件 prime-rl 框架专为异步分布式环境设计与强化学习高度相关,其余包括突破带宽瓶颈的 OpenDiLoCo 通信协议、保障计算完整性的 TopLoc 验证机制等。
Prime Intellect 核心基础设施组件一览
技术基石:prime-rl 异步强化学习框架
prime-rl 是 Prime Intellect 的核心训练引擎,专为大规模异步去中心化环境设计,通过 Actor–Learner 完全解耦实现高吞吐推理与稳定更新。执行者 (Rollout Worker) 与学习者(Trainer) 不再同步阻塞,节点可随时加入或退出,只需持续拉取最新策略并上传生成数据即可:
执行者 Actor (Rollout Workers):负责模型推理和数据生成。Prime Intellect 创新性地在 Actor 端集成了 vLLM 推理引擎 。vLLM 的 PagedAttention 技术和连续批处理(Continuous Batching)能力,使得 Actor 能够以极高的吞吐量生成推理轨迹。
学习者 Learner (Trainer):负责策略优化。Learner 从共享的经验回放缓冲区(Experience Buffer)中异步拉取数据进行梯度更新,无需等待所有 Actor 完成当前批次。
协调器 (Orchestrator):负责调度模型权重与数据流。
prime-rl 的关键创新点
完全异步(True Asynchrony):prime-rl 摒弃传统 PPO 的同步范式,不等待慢节点、无需批次对齐,使任意数量与性能的 GPU 都能随时接入,奠定去中心化 RL 的可行性。
深度集成 FSDP2 与 MoE:通过 FSDP2 参数切片与 MoE 稀疏激活,prime-rl 让百亿级模型在分布式环境中高效训练,Actor 仅运行活跃专家,大幅降低显存与推理成本。
GRPO+(Group Relative Policy Optimization):GRPO 免除 Critic 网络,显著减少计算与显存开销,天然适配异步环境,prime-rl 的 GRPO+ 更通过稳定化机制确保高延迟条件下的可靠收敛。
INTELLECT 模型家族:去中心化 RL 技术成熟度的标志
INTELLECT-1(10B,2024年10月)首次证明 OpenDiLoCo 能在跨三大洲的异构网络中高效训练(通信占比 2%、算力利用率 98%),打破跨地域训练的物理认知;
INTELLECT-2(32B,2025年4月)作为首个 Permissionless RL 模型,验证 prime-rl 与 GRPO+ 在多步延迟、异步环境中的稳定收敛能力,实现全球开放算力参与的去中心化 RL;
INTELLECT-3(106B MoE,2025年11月)采用仅激活 12B 参数的稀疏架构,在 512×H200 上训练并实现旗舰级推理性能(AIME 90.8%、GPQA 74.4%、MMLU-Pro 81.9% 等),整体表现已逼近甚至超越规模远大于自身的中心化闭源模型。
Prime Intellect 此外还构建了数个支撑性基础设施:OpenDiLoCo 通过时间稀疏通信与量化权重差,将跨地域训练的通信量降低数百倍,使 INTELLECT-1 在跨三洲网络仍保持 98% 利用率;TopLoc + Verifiers 形成去中心化可信执行层,以激活指纹与沙箱验证确保推理与奖励数据的真实性;SYNTHETIC 数据引擎则生产大规模高质量推理链,并通过流水线并行让 671B 模型在消费级 GPU 集群上高效运行。这些组件为去中心化 RL 的数据生成、验证与推理吞吐提供了关键的工程底座。INTELLECT 系列证明了这一技术栈可产生成熟的世界级模型,标志着去中心化训练体系从概念阶段进入实用阶段。
Gensyn: 强化学习核心栈RL Swarm与SAPO
Gensyn 的目标是将全球闲置算力汇聚成一个开放、无需信任、可无限扩展的 AI 训练基础设施。其核心包括跨设备标准化执行层、点对点协调网络与无需信任的任务验证系统,并通过智能合约自动分配任务与奖励。围绕强化学习的特点,Gensyn 引入 RL Swarm、SAPO 与 SkipPipe 等核心机制等机制,将生成、评估、更新三个环节解耦,利用全球异构 GPU 组成的「蜂群」实现集体进化。其最终交付的不是单纯的算力,而是可验证的智能(Verifiable Intelligence)。
Gensyn 堆栈的强化学习应用
RL Swarm:去中心化的协作式强化学习引擎
RL Swarm 展示了一种全新的协作模式。它不再是简单的任务分发,而是一个模拟人类社会学习的去中心化的「生成—评估—更新」循环,类比协作式学习过程,无限循环:
Solvers(执行者): 负责本地模型推理与 Rollout 生成,节点异构无碍。Gensyn 在本地集成高吞吐推理引擎(如 CodeZero),可输出完整轨迹而非仅答案。
Proposers(出题者): 动态生成任务(数学题、代码问题等),支持任务多样性与类 Curriculum Learning 的难度自适应。
Evaluators(评估者): 使用冻结的「裁判模型」或规则对本地 Rollout 进行评估,生成本地奖励信号。评估过程可被审计,减少作恶空间。
三者共同组成一个 P2P 的 RL 组织结构,无需中心化调度即可完成大规模协作学习。
SAPO:为去中心化重构的策略优化算法
SAPO(Swarm Sampling Policy Optimization)以「共享 Rollout 并过滤无梯度信号样本,而非共享梯度」为核心,通过大规模去中心化的 Rollout 采样,并将接收的 Rollout 视为本地生成,从而在无中心协调、节点延迟差异显著的环境中保持稳定收敛。相较依赖 Critic 网络、计算成本较高的 PPO,或基于组内优势估计的 GRPO,SAPO 以极低带宽使消费级 GPU 也能有效参与大规模强化学习优化。
通过 RL Swarm 与 SAPO,Gensyn 证明了强化学习(尤其是后训练阶段的 RLVR)天然适配去中心化架构——因为其更依赖于大规模、多样化的探索(Rollout),而非高频参数同步。结合 PoL 与 Verde 的验证体系,Gensyn 为万亿级参数模型的训练提供了一条不再依赖单一科技巨头的替代路径:一个由全球数百万异构 GPU 组成的、自我演化的超级智能网络。
Nous Research:可验证强化学习环境 Atropos
Nous Research 在构建一套去中心化、可自我进化的认知基础设施。其核心组件——Hermes、Atropos、DisTrO、Psyche 与 World Sim 被组织成一个持续闭环的智能演化系统。不同于传统「预训练—后训练—推理」线性流程,Nous 采用 DPO、GRPO、拒绝采样等强化学习技术,将数据生成、验证、学习与推理统一为连续反馈回路,打造持续自我改进的闭环 AI 生态。
Nous Research 组件总览
模型层:Hermes 与推理能力的演进
Hermes 系列是 Nous Research 面向用户的主要模型接口,其演进清晰展示了行业从传统 SFT/DPO 对齐向推理强化学习(Reasoning RL)迁移的路径:
Hermes 1–3:指令对齐与早期代理能力:Hermes 1–3 依靠低成本 DPO 完成稳健指令对齐,并在 Hermes 3 借助合成数据与首次引入的 Atropos 验证机制。
Hermes 4 / DeepHermes:通过思维链将 System-2 式慢思考写入权重,以 Test-Time Scaling 提升数学与代码性能,并依赖「拒绝采样 + Atropos 验证」构建高纯度推理数据。
DeepHermes 进一步采用 GRPO 替代难以分布式落地的 PPO,使推理 RL 能在 Psyche 去中心化 GPU 网络上运行,为开源推理 RL 的可扩展化奠定工程基础。
Atropos:可验证奖励驱动的强化学习环境
Atropos 是 Nous RL 体系的真正枢纽。它将提示、工具调用、代码执行和多轮交互封装成标准化 RL 环境,可直接验证输出是否正确,从而提供确定性奖励信号,替代昂贵且不可扩展的人类标注。更重要的是,在去中心化训练网络 Psyche 中,Atropos 充当「裁判」,用于验证节点是否真实提升策略,支持可审计的 Proof-of-Learning,从根本上解决分布式 RL 中的奖励可信性问题。
DisTrO 与 Psyche:去中心化强化学习的优化器层
传统 RLF(RLHF/RLAIF)训练依赖中心化高带宽集群,这是开源无法复制的核心壁垒。DisTrO 通过动量解耦与梯度压缩,将 RL 的通信成本降低几个数量级,使训练能够在互联网带宽上运行;Psyche 则将这一训练机制部署在链上网络,使节点可以在本地完成推理、验证、奖励评估与权重更新,形成完整的 RL 闭环。
在 Nous 的体系中, Atropos 验证思维链;DisTrO 压缩训练通信;Psyche 运行 RL 循环;World Sim 提供复杂环境;Forge 采集真实推理;Hermes 将所有学习写入权重。强化学习不仅是一个训练阶段,而是 Nous 架构中 连接数据、环境、模型与基础设施的核心协议,让 Hermes成为一个 能在开源算力网络上持续自我改进的活体系统。
Gradient Network:强化学习架构 Echo
Gradient Network 核心愿景是通过「开放智能协议栈」(Open Intelligence Stack)重构 AI 的计算范式。Gradient 的技术栈由一组可独立演化、又异构协同的核心协议组成。其体系从底层通信到上层智能协作依次包括:Parallax(分布式推理)、Echo(去中心化 RL 训练)、Lattica(P2P 网络)、SEDM / Massgen / Symphony / CUAHarm(记忆、协作、安全)、VeriLLM(可信验证)、Mirage(高保真仿真),共同构成持续演化的去中心化智能基础设施。
Echo — 强化学习训练架构
Echo 是 Gradient 的强化学习框架,其核心设计理念在于解耦强化学习中的训练、推理与数据(奖励)路径,使 Rollout 生成、策略优化与奖励评估能够在异构环境中独立扩展与调度。在由推理侧与训练侧节点组成的异构网络中协同运行,以轻量同步机制在广域异构环境中维持训练稳定性,有效缓解传统 DeepSpeed RLHF / VERL 中推理与训练混跑导致的 SPMD 失效与 GPU 利用率瓶颈。
Echo 采用「推理–训练双群架构」实现算力利用最大化,双群各自独立运行,互不阻塞:
最大化采样吞吐:推理群 Inference Swarm 由消费级 GPU 与边缘设备组成,通过 Parallax 以 pipeline‐parallel 构建高吞吐采样器,专注于轨迹生成;
最大化梯度算力:训练群 Training Swarm 由可运行于中心化集群或全球多地的消费级 GPU 网络,负责梯度更新、参数同步与 LoRA 微调,专注于学习过程。
为维持策略与数据的一致性,Echo 提供顺序(Sequential)与异步(Asynchronous)两类轻量级同步协议,实现策略权重与轨迹的双向一致性管理:
顺序拉取(Pull)模式|精度优先 :训练侧在拉取新轨迹前强制推理节点刷新模型版本,从而确保轨迹新鲜度,适合对策略陈旧高度敏感的任务;
异步推拉(Push–Pull)模式|效率优先:推理侧持续生成带版本标签的轨迹,训练侧依自身节奏消费,协调器监控版本偏差并触发权重刷新,最大化设备利用率。
在底层,Echo 构建于 Parallax(低带宽环境下的异构推理)与轻量化分布式训练组件(如 VERL)之上,依赖 LoRA 降低跨节点同步成本,使强化学习可在全球异构网络上稳定运行。
Grail:Bittensor 生态的强化学习
Bittensor 通过其独特的 Yuma 共识机制,构建了一个巨大的、稀疏的、非平稳的奖励函数网络。
Bittensor 生态中的 Covenant AI 则通过 SN3 Templar、SN39 Basilica 与 SN81 Grail 构建了从预训练到 RL 后训练的垂直一体化流水线。其中,SN3 Templar 负责基础模型的预训练,SN39 Basilica 提供分布式算力市场,SN81 Grail 则作为面向 RL 后训练的「可验证推理层」,承载 RLHF / RLAIF 的核心流程,完成从基础模型到对齐策略的闭环优化。
GRAIL 目标是以密码学方式证明每条强化学习 rollout 的真实性与模型身份绑定,确保 RLHF 能够在无需信任的环境中被安全执行。协议通过三层机制建立可信链条:
确定性挑战生成:利用 drand 随机信标与区块哈希生成不可预测但可复现的挑战任务(如 SAT、GSM8K),杜绝预计算作弊;
通过 PRF 索引采样与 sketch commitments,使验证者以极低成本抽检 token-level logprob 与推理链,确认 rollout 确由声明模型生成;
模型身份绑定:将推理过程与模型权重指纹及 token 分布的结构性签名绑定,确保替换模型或结果重放都会被立即识别。由此,为 RL 中推理轨迹(rollout)提供了真实性根基。
在此机制上,Grail 子网实现了 GRPO 风格的可验证后训练流程:矿工为同一题目生成多条推理路径,验证者依据正确性、推理链质量与 SAT 满足度评分,并将归一化结果写入链上,作为 TAO 权重。公开实验显示,该框架已将 Qwen2.5-1.5B 的 MATH 准确率从 12.7% 提升至 47.6%,证明其既能防作弊,也能显著强化模型能力。在 Covenant AI 的训练栈中,Grail 是去中心化 RLVR/RLAIF 的信任与执行基石,目前尚未正式主网上线。
Fraction AI:基于竞争的强化学习 RLFC
Fraction AI 的架构明确围绕竞争强化学习(Reinforcement Learning from Competition, RLFC) 和游戏化数据标注构建 ,将传统 RLHF 的静态奖励与人工标注替换为开放、动态的竞争环境。代理在不同 Spaces 中对抗,其相对排名与 AI 法官评分共同构成实时奖励,使对齐过程演变为持续在线的多智能体博弈系统。
传统 RLHF 与 Fraction AI 的 RLFC 之间的核心差异:
RLFC 的核心价值在于奖励不再来自单一模型,而来自不断演化的对手与评估者,避免奖励模型被利用,并通过策略多样性防止生态陷入局部最优。Spaces 的结构决定博弈性质(零和或正和),在对抗与协作中推动复杂行为涌现。
在系统架构上,Fraction AI 将训练过程拆解为四个关键组件:
Agents:基于开源 LLM 的轻量策略单元,通过 QLoRA 以差分权重扩展,低成本更新;
Spaces:隔离的任务域环境,代理付费进入并以胜负获得奖励;
AI Judges:以 RLAIF 构建的即时奖励层,提供可扩展、去中心化的评估;
Proof-of-Learning:将策略更新绑定到具体竞争结果,确保训练过程可验证、防作弊。
Fraction AI 的本质是构建了一个人机协同的进化引擎」。用户作为策略层的「元优化者」 (Meta-optimizer),通过提示工程(Prompt Engineering)和超参配置引导探索方向;而代理在微观的竞争中自动生成海量的高质量偏好数据对 (Preference Pairs)。这种模式让数据标注通过 「去信任化微调」 (Trustless Fine-tuning) 实现了商业闭环 。
强化学习 Web3 项目架构比较
总结与展望:强化学习 × Web3 的路径与机会
基于对上述前沿项目的解构分析,我们观察到:尽管各团队的切入点(算法、工程或市场)各异,但当强化学习(RL)与 Web3 结合时,其底层架构逻辑皆收敛为一个高度一致的「解耦-验证-激励」范式。这不仅是技术上的巧合,更是去中心化网络适配强化学习独特属性的必然结果。
强化学习通用架构特征:解决核心的物理限制与信任问题
推训物理分离 (Decoupling of Rollouts & Learning) —— 默认计算拓扑
通信稀疏、可并行的 Rollout 外包给全球消费级 GPU,高带宽的参数更新集中于少量训练节点,从 Prime Intellect 的异步 Actor–Learner 到 Gradient Echo 的双群架构皆如此。
验证驱动的信任层 (Verification-Driven Trust) —— 基础设施化
在无需许可的网络中,计算真实性必须通过数学与机制设计强制保障,代表实现包括 Gensyn 的 PoL、Prime Intellect 的 TOPLOC 与 Grail 的密码学验证。
代币化的激励闭环 (Tokenized Incentive Loop) —— 市场自我调节
算力供给、数据生成、验证排序与奖励分配形成闭环,通过奖励驱动参与、通过 Slash 抑制作弊,使网络在开放环境中依然保持稳定与持续演进。
差异化技术路径:一致架构下的不同「突破点」
尽管架构趋同,但各项目根据自身基因选择了不同的技术护城河:
算法突破派 (Nous Research):试图从数学底层解决分布式训练的根本矛盾(带宽瓶颈)。其 DisTrO 优化器旨在将梯度通信量压缩数千倍,目标是让家庭宽带也能跑得动大模型训练,这是对物理限制的「降维打击」。
系统工程派 (Prime Intellect, Gensyn, Gradient):侧重于构建下一代的「AI 运行时系统」。Prime Intellect的 ShardCast 和 Gradient 的 Parallax 都是为了在现有的网络条件下,通过极致的工程手段压榨出最高的异构集群效率。
市场博弈派 (Bittensor, Fraction AI):专注奖励函数(Reward Function)的设计。通过设计精妙的评分机制,引导矿工自发寻找最优策略,来加速智能涌现。
优势、挑战与终局展望
在强化学习与 Web3 结合的范式下,系统级优势首先体现在成本结构与治理结构的重写。
成本重塑:RL 后训练(Post-training)对采样(Rollout)的需求是无限的,Web3 能以极低成本调动全球长尾算力,这是中心化云厂商难以比拟的成本优势。
主权对齐 (Sovereign Alignment):打破大厂对 AI 价值观(Alignment)的垄断,社区可以通过 Token 投票决定模型「什么是好的回答」,实现 AI 治理的民主化。
与此同时,这一体系也面临两大结构性约束。
带宽墙 (Bandwidth Wall):尽管有 DisTrO 等创新,物理延迟仍限制了超大参数模型(70B+)的全量训练,目前 Web3 AI 更多局限于微调和推理。
古德哈特定律 (Reward Hacking):在高度激励的网络中,矿工极易「过拟合」奖励规则(刷分)而非提升真实智能。设计防作弊的鲁棒奖励函数是永恒的博弈。
恶意拜占庭式节点攻击 (BYZANTINE worker):通过对训练信号的主动操纵与投毒破坏模型收敛。核心不在于持续设计防作弊的奖励函数,而在于构建具备对抗性鲁棒性的机制。
强化学习与 Web3 的结合,本质是在重写「智能是如何被生产、对齐并分配价值」的机制。其演进路径可概括为三条互补方向:
去中心化推训网络:从算力矿机到策略网络,将并行且可验证的 Rollout 外包给全球长尾 GPU,短期聚焦可验证推理市场,中期演化为按任务聚类的强化学习子网;
偏好与奖励的资产化:从标注劳工到数据股权。 实现偏好与奖励的资产化,将高质量反馈与 Reward Model 变为可治理、可分配的数据资产,从「标注劳工」升级为「数据股权」
垂直领域的「小而美」进化:在结果可验证、收益可量化的垂直场景中孕育小而强的专用 RL Agents,如 DeFi 策略执行、代码生成,使策略改进与价值捕获直接绑定并有望跑赢通用闭源模型。
总体来看,强化学习 × Web3 的真正机会不在于复制一个去中心化版 OpenAI,而在于重写「智能生产关系」:让训练执行成为开放算力市场,让奖励与偏好成为可治理的链上资产,让智能带来的价值不再集中于平台,而在训练者、对齐者与使用者之间重新分配。
DeMall 去中心化 AI 助手,正式开通 DePIN Expo 2025 线上导览导购导读:全球首个 DePIN 主题展览会即将在香港启幕。DeMall 正式上线 DePIN Expo 2025 线上导览导购平台,以 AI Agent 与 NFC 智能手环打造智能观展体验,并定位为赋能 DePIN 生态的「智能中枢」,为项目方与用户之间建立高效连接。
随着全球首个DePIN主题展览会即将在香港拉开帷幕,DeMall 正式上线 DePIN Expo 2025 线上导览导购平台。
DeMall构建的AI助手实现了DePIN Expo 2025展商信息的无缝流转,同时联手 Depinport 启动联合导购,为项目方导入精准线上流量。用户只需通过搭载 DeMall AI Agent 的 NFC 智能导览手环轻触手机,即可秒速完成注册,开启智能观展之旅。
进入 DeMall 虚拟展馆,用户可随时与专属 DePIN Expo AI 导览员互动。无论是展位分布导航、会议议程查询、实时答疑解惑,或是多语言翻译服务,AI 助手都能提供第一手的精准资讯与个性化导览建议。
DePIN Expo 智能导览
Depinport 联合导购
DeMall:赋能 DePIN 生态的智能中枢
DeMall 远不止于一个导览工具。其核心是一个强大的去中心化 AI Agent,具备智能合约驱动、链上数据交互等能力。它能为各类 DePIN 项目提供深度赋能,尤其可无缝集成至销售平台,实现产品展示、智能推荐、自动化交易流程等功能,成为项目方连接用户、提升转化效率的智能中枢。
DePIN Expo 2025:重塑现实世界的全球盛会
作为全球首个聚焦 DePIN(去中心化物理基础设施网络)的旗舰博览会,DePIN Expo 2025 将于 8月27-28日登陆香港。在「Life, Reimagined with DePIN」主题下,盛会将汇集全球创新先锋、行业领袖及爱好者。
DePIN 正以颠覆性力量整合通信、计算、能源、存储等传统基础设施。其市场潜力巨大,Messari 预测 2028 年规模将达 3.5 万亿美元。香港凭借其明确的 Web3 支持政策、紧邻珠三角硬件制造中心的地理优势(1小时直达深圳、东莞等)、以及活跃的资本与人才生态,成为举办此盛会的理想之地。
这场划时代的盛会,将重新定义我们与物理世界的互动方式。即刻扫码关注 DeMall AI 助手,抢先开启智能导览之旅,锁定 DePIN 未来!
活动时间:2025 年 8 月 27–28 日
活动地点:中国香港 · 数码港
报名通道:https://lu.ma/1qol9wna
商务合作:sponsor@depinexpo.ai
媒体合作:media@depinexpo.ai
官方网站:https://depinexpo.ai
官方推特:@ExpoDePIN
DePIN Expo 2025 是全球首个聚焦去中心化物理基础设施网络(DePIN)的专业博览会,将于 2025 年 8 月在香港举办。大会以 「Life,Reimagined with DePIN」 为主题,汇聚全球顶级的 DePIN 项目、公链团队、投资机构、硬件厂商与政策制定者,打造涵盖生态展示、实体交互、节点部署、产业协作与城市示范的全景式行业盛会,致力于推动 DePIN 技术从理念验证迈向规模化落地。
FlashAI:去中心化 AI 算力革命,从 FAI 开始在人工智能席卷全球的今天,算力已成为推动创新的核心动力。然而,高昂的集中式算力成本和资源浪费正成为行业瓶颈。FlashAI(简称 FAI)应运而生,以区块链技术为依托,整合全球闲置 AI 算力,打造高效、低成本的去中心化算力市场,为游戏开发者、医疗企业、科研机构等提供普惠 AI 服务。FlashAI 不仅是一个 WEB3 平台,更是一场连接供给与需求的革命!
FlashAI:AI 算力普惠的先锋
通过智能撮合引擎、零知识证明(ZKP)隐私保护和跨链兼容技术,FlashAI 能帮助供需双方实现毫秒级算力匹配,降低成本 30-50%,并推动绿色计算,减少能源浪费。
FlashAI 的首个落地案例源于与 UtilityNet 分布式计算网络和 Planet Hares 元宇宙游戏的合作。 Planet Hares 是一个以 3 D 沉浸式 MMORPG 游戏为基础,包含多种娱乐社交方式的元宇宙游戏,由 HYPERGEM 开发,拿到过多个国际性 WEB 3 游戏大奖。
UtilityNet 是一个去中心化的数字芯片网络,专门为下一代边缘计算和人工智能基础设施提供芯片资源。目前 UtilityNet 在测试网期间主要由中国-东盟信息港股份有限公司(中国东信)与算能科技联合推出的「东信智算魔盒 S 1」设备作为核心硬件支撑,该设备内置算能科技自主研发的 BM 1684 X TPU(张量处理单元),具备 32 TOPS int 8 算力,支持 32 路 1080 P 高清视频分析和私有化部署 DeepSeek R 1 大模型(7 B-14 B 参数),完美适配 Planet Hares 的游戏内 AI 对话服务,让虚拟角色如真人般互动。
UtilityNet 的创新 POCI(可信计算)共识机制,结合魔盒 S 1 的安全引擎,确保数据隐私和链上混合加密校验,并能够为用户提供强大的 AI 计算能力,确保高效处理实时推理和数据调度任务。FlashAI 作为撮合平台,连接 UtilityNet 的算力供给与 Planet Hares 的需求,未来还将扩展到医疗影像分析、金融风险评估和物联网优化等领域,构建一个多场景的 AI 生态。
加入节点挖矿,共享 FAI 财富
FlashAI 的平台代币为 FAI,总供应量固定为 10 亿枚,其中 70% 通过 AI 算力节点挖矿逐步释放,确保社区驱动的可持续发展。其余分配包括技术团队 10%(三年解锁)、社区空投 10%(投票决定)、基金会 5%(一年后分 12 个月释放)和 DAO 组织 5%。
FlashAI 的核心吸引力在于其节点挖矿机制,70% 的 FAI 代币通过算力贡献逐步释放,为用户提供了低门槛、高回报的参与机会。
为何现在加入 FlashAI?
FlashAI 不仅仅是一个项目,更是一个开放的生态,连接全球算力与需求。无论是游戏爱好者希望体验智能角色对话,还是开发者寻求低成本 AI 算力,抑或是投资者追求稳定收益,FlashAI 都提供了绝佳机会。2025 年是去中心化 AI 爆发之年。根据市场预测,未來十年全球 AI 市场规模預計將突破萬亿美元,分布式算力预计占 10-15% 份额。FlashAI 凭借技术优势,以及 DAO 治理的透明性,正站在这一浪潮的前沿。
立即行动,点亮 AI 未来!
现在是加入 FlashAI 的最佳时机!无论您是想通过节点挖矿获得 FAI 奖励,还是参与社区治理分享空投,FlashAI 都为您敞开大门。访问 flashai.club,了解更多详情,加入 X(@Flash_AIAI),与全球社区一起探索 AI 算力的无限可能。
去中心化 AI 平台 Sahara AI 融资 4300 万美元,一个全新的 AI 经济时代即将开启撰文:元宇宙之心
Sahara AI 作为新兴的去中心化 AI 区块链平台,于上周官宣获得 4300 万美元的巨额融资。
值得注意的是,Sahara AI 不仅获得了 Binance Labs、Polychain Capital 和 Pantera Capital 等顶级投资机构的青睐,更吸引了包括三星、经纬创投在内的传统资方。
除了资本市场对 Sahara AI 技术实力和发展潜力的认可,这一融资或许也预示着去中心化 AI 技术即将开启新的篇章。
01.1 分钟项目速览
1.项目名称:Sahara AI
2.成立时间:2023 年 5 月
3.产品简介:
Sahara AI 旨在构建一个去中心化 AI 网络基础设施,帮助用户部署或构建自定义化、个性化的 AI 产品。
4.创始人团队:
Sean Ren:南加州大学的计算机系终身教授,拥有 15 年的 AI 领域研究经验
Tyler Zhou:曾在 Binance Labs 担任投资总监,并参与了多个项目投资及孵化
5.融资情况:
2024 年 8 月,Sahara AI 获得了 4300 万美元的巨额融资,投资方包括 Binance labs、Polychain 和 Pantera
此前,Sahara AI 已经完成由 Polychain Capital 领投的 600 万美元种子轮融资,参投方包括红杉资本、Samsung Next、Nomad Capital 等
02.让 AI 更加开放
随着人工智能的强大,大量的个人数据集中在少数几家大型科技公司的手中,这种权力集中和缺乏透明度不仅限制了创新,还可能导致算法偏差、侵犯隐私等问题。
一些科技专家意识到了这个问题并开始着手解决。很快,「去中心化 AI」这一新概念被提出。由南加州大学计算机系终身教授 Sean Ren 牵头,和其他成员共同创建了去中心化 AI 区块链平台 Sahara AI。
Sahara AI 的创始团队背景深厚,成员来自人工智能、区块链技术和分布式系统等多个领域。Tyler Zhou 等人在三星、微软、币安、谷歌等知名科技公司和各大学术机构的工作经验,为 Sahara AI 的技术创新和战略发展奠定了坚实的基础。
如今,Sahara AI 已经成为去中心化 AI 领域的重要参与者,吸引了全球范围内的开发者、研究人员和企业用户。平台通过智能合约和分布式计算等技术,为用户提供了一系列创新的 AI 工具和服务,并不断推动去中心化 AI 生态系统的发展。
Sahara AI 的成功不仅在于其技术创新,还在于其背后团队对科技伦理和社会责任的坚持。他们始终致力于构建一个更加开放和公正的 AI 未来,赋能全球用户,共享技术进步的成果。
03.打破传统 AI 开发壁垒
Sahara AI 的主要模型和产品围绕着去中心化和透明化的理念展开,平台的设计目标是打破传统 AI 开发中存在的壁垒,使更多的开发者能够参与其中,同时保障数据隐私和安全性。
去中心化的核心产品
Sahara AI 平台的核心之一是其去中心化的 AI 模型交易市场。在这个市场上,开发者可以自由上传、分享和交易他们的 AI 模型,同时保证知识产权的透明和安全。
通过智能合约,确保人工智能的所有权和治理分散,并具有透明且不可变的链上归属。
它的另一个关键产品是其分布式计算网络。AI 模型的训练通常需要大量的计算资源,而这些资源往往成本高昂且分布不均。
Sahara AI 利用区块链技术将计算任务分散到全球的参与者手中,每个参与者都可以贡献自己的计算资源,参与模型训练。该平台通过这种方式来奖励所有贡献者,鼓励多元化参与并推动人工智能生态系统内的创新。
去中心化 AI 生态系统
当然,Sahara AI 的成功不仅依赖于其创新的产品,还依赖于平台的关键组成部分,这些组成部分共同构建了一个强大的去中心化 AI 生态系统。
新一代机器人将拥有更加先进的传感器、更强大的计算能力和更智能的算法,能够实时「理解」并响应动作指令,完成更加复杂和多样化的任务。
智能合约系统:智能合约通过预设的程序自动执行交易和任务,无需第三方中介。这种自动化的交易模式在平台的模型交易市场中发挥了重要作用,确保了交易的公正性和透明性。同时,智能合约还用于分布式计算资源的调配,使得平台能够高效运行。
Sahara 通证经济:为了激励开发者和资源提供者的参与,Sahara AI 平台引入了 Sahara 通证(Sahara Tokens),这是一种基于区块链的数字资产。Sahara 通证用于平台内的所有交易,包括模型交易、计算资源租赁和数据共享。通过这种通证经济模型,平台能够构建一个自我驱动的生态系统,确保参与者能够获得回报,从而吸引更多的开发者和用户加入。
跨链兼容性:Sahara AI 具备跨链兼容性,能够与其他区块链平台无缝集成。这种兼容性使得平台可以利用其他区块链的资源和生态系统,扩大自身的影响力。同时,跨链兼容性还增强了平台的灵活性,允许开发者将他们的 AI 模型和数据在多个区块链平台之间迁移和共享。
开放 API 与开发者工具:Sahara AI 为开发者提供了丰富的 API 和开发工具,支持多种编程语言和开发环境。这些工具使得开发者能够快速集成 Sahara AI 的功能到他们的应用中,并轻松进行模型的部署和管理。开放的开发环境不仅提升了平台的可扩展性,还促进了开发者社区的活跃度。
总的来说,Sahara AI 通过去中心化的技术架构、独特的产品和创新的商业模式,正在改变 AI 和区块链行业的格局。
04.Sahara 及去中心化 AI 的未来
在上周官宣获得融资后,该公司计划利用这笔资金扩展团队规模、提升 AI 区块链性能,并加速开发者生态建设。
Sahara AI 的首席执行官 Sean Ren 表示,公司将推出 C 端用户产品,并在第三季度上线测试网 Testnet,争取在第四季度上线主网,进一步推动 AI 技术的普及和应用。
Sahara AI 背后的技术核心是去中心化 AI,除了对公司本身的关注,这一新型技术领域的发展也值得关注。
去中心化 AI 的核心优势在于其能够提供一个更加开放、透明且安全的数据处理平台。Sahara AI 的去中心化数据市场不仅为企业提供了高价值的数据服务,还通过其独特的所有权证明机制,确保数据贡献者能够获得合理的经济补偿。
通过与 30 多家企业合作,Sahara 也在不断打磨自家产品使其越来越成熟,以更好地去适配全球各种企业及商家的数据需求,形成了正向循环。
这种模式有望解决传统 AI 行业中数据隐私和经济模型的问题,推动 AI 生态的健康发展。
此外,Sahara AI 的去中心化特性还意味着更高的可扩展性和抗风险能力。
在全球范围内,无论是大型企业还是小型创业团队,都能够利用 Sahara AI 的平台构建和部署自己的 AI 解决方案,从而推动整个行业创新和进步。
去中心化 AI 的核心优势还包括其对数据加密和归因的支持,即所有权证明,通过使用数字水印创新技术和公钥设施来实现。
当用户创建出一个数据点、数据集、或模型时,可以把自己的 DID 植入到其数据或者模型里面,生成一个水印,证明对其的数据所有权,这个水印会随着用户的数据和模型流转一直存在,这样就可以给数据和模型做归因。
随着 Sahara AI 主网即将上线,去中心化 AI 技术或将开启一个全新的协作型 AI 经济时代,让 AI 更加透明、安全、且人人可及。
参考链接:
1.https://saharalabs.ai/blog/sahara-ai-raise-43m
2.https://coincentral.com/what-is-decentralized-ai-deai/#heading-h2-0
OORT 全球去中心化 AI 峰会圆满落幕,共探去中心化技术新未来2024 年 8 月 20 日下午在深圳希尔顿酒店 —— 由 OORT 基金会与 Ctalks 联合主办的「OORT 全球去中心化 AI 峰会」今日圆满落幕。此次峰会汇集了全球领先的去中心化技术专家、行业领袖及政策制定者,共同探讨了去中心化 AI 领域的最新进展与未来趋势,以及 AI 与 DePIN、RWA 等其他热门赛道的创新融合。
出席会议的主要嘉宾有:OORT 基金会主席 Mike、香港区块链协会 TonyTong 唐仪、 深圳数据交易所林泽坤 、OORT 亚太区运营负责人 Lucas、LingoAi 创始人 Una Wang、Arkreen 创始人 Leo Lin、深圳聚算科技创始人靳朝辉、BANG 创始人花椒、点滴财经主理人兔姐、Horus 联合创始人 Ray、DEKUBE 社区代表 Felix、Multiple Network 社区代表 Zeus Chen 以及行业内资深从业者。
OORT - 去中心化 AI 赋能的全新解决方案
在峰会开幕演讲中,OORT 基金会主席 Mike Robinson 向与会者阐述了 OORT 在去中心化 AI 领域的宏伟蓝图。他强调了 OORT 的核心愿景 —— 通过先进的去中心化技术和人工智能的融合,打造一个更加安全、透明和高效的数字生态系统。Mike 详细解释了 OORT 如何通过其独特的技术架构,为全球用户和企业提供了一种全新的数据处理和存储解决方案。
Mike 还谈到了 OORT 在去中心化 AI 领域的使命,即推动技术创新,促进全球范围内的数据共享与协作。他表示,OORT 旨在建立一个去中心化的平台,使用户能够自主控制自己的数据,并从中获得真正的价值。这一平台不仅支持数据的高效流通,还确保了数据的安全性和隐私保护。
此外,Mike 还重点介绍了 OORT 的几项核心技术,包括分布式计算网络、加密数据存储、以及智能合约驱动的数据交换机制。这些技术不仅解决了当前中心化系统中存在的数据孤岛问题,还提供了前所未有的灵活性和可扩展性,为去中心化 AI 应用的开发奠定了坚实的基础。
Mike 的发言不仅展示了 OORT 的技术实力,也为与会者描绘了一个充满无限可能的未来。让我们对 OORT 的未来充满期待。
数据跨境流动与交易
深圳数据交易所的林泽坤先生详细分享了近年来数据跨境流动相关政策的演变历程及其对跨境数据交易的影响。他指出,随着数字经济的发展,数据作为新的生产要素,其跨境流动变得日益频繁且复杂。为了适应这一变化,政府部门不断出台和完善相关政策法规,以促进数据的安全、合法跨境流动。林泽坤先生还重点介绍了深圳数据交易所在推动跨境数据交易方面的探索与实践,特别是在利用深圳作为粤港澳大湾区核心城市的独特地理和政策优势方面取得的成绩。截至最新统计,深圳数据交易所已成功完成了多笔跨境数据交易,其中包括与马来西亚数据商的合作案例,这些实践不仅促进了数据要素市场的健康发展,也为其他地区提供了宝贵的经验借鉴。
林演讲照片
香港区块链政策
香港区块链协会会长唐仪深入剖析了香港地区的区块链政策环境及其对行业的影响。他提到,香港政府近年来积极出台了一系列支持区块链和加密货币行业的政策,旨在打造一个有利于创新和发展的生态系统。唐仪先生特别强调了 2023 年香港金融监管局发布的《关于加密资产和稳定币的讨论文件结论》,该文件明确了监管框架,为加密资产和稳定币提供了明确的指导方针。他还分享了香港在推动区块链技术应用和发展方面的一些具体措施,比如为初创企业提供的沙盒测试环境,以及在金融、供应链管理等领域开展的实际案例。这些政策不仅有助于吸引更多的区块链企业和人才落户香港,也为全球区块链行业树立了榜样。
唐会长演讲照片
深圳市信息服务业区块链协会会长郑定向在会场分析了政策形式对我们行业的影响,以及近期可能对行业影响最大的几个事件。
探索 AI 与 DePIN、RWA 赛道的融合
LingoAl 创始人 Una Wang 探讨了如何通过 AI、DePIN 和 RWA 的结合来促进跨文化交流与合作。她指出,通过 AI 技术可以智能地处理语言障碍,DePIN 则为用户提供了安全的身份验证手段,而 RWA 则使得数字资产与实体资产之间能够无缝连接。优娜女士强调,这种综合解决方案能够打破文化隔阂,为世界各地的人们搭建一座沟通的桥梁,让人们能够更加便捷地共享资源、交流信息和进行商业合作。她还分享了一些实际案例,展示了这项技术在促进全球化交流中的潜力。
UNA 演讲照片
DePIN 与 AI 融合创新的机遇和挑战
为了与更多 Web3 建设者交流,思想碰撞,打开建设 Web3 的思路。此次峰会准备了两场主题圆桌论坛,两场圆桌论坛分别围绕 「DePIN 与 AI: 融合创新的未来之路」 和 「探索 DePIN 和 DeAl 的落地应用的发展机遇与挑战」 展开,各路专家就去中心化基础设施与 AI 技术的应用前景进行了深入讨论。
OORT 全球去中心化 AI 峰会圆满落幕,本次峰会不仅加深了参与者对去中心化 AI 领域最新进展的理解,还激发了对未来技术发展方向的深刻思考。随着 OORT 持续引领技术创新,我们期待看到更多去中心化解决方案如何重塑数据存储、隐私保护和人工智能应用的面貌。峰会的成功举办强调了国际合作的重要性,以及持续对话和探索对于推动去中心化 AI 技术进步的关键作用。相信,在不久的将来我们能一起见证 DeAI 技术的突破,还有蓬勃发展的 Web3。
关于 OORT
OORT 是一家专注于去中心化云服务的公司,通过区块链技术汇聚全球闲置计算与存储资源,为企业和个人提供高隐私、低成本的一站式 AI 解决方案。OORT 致力于推动去中心化 AI 技术的发展,以实现更加开放、公平的数字未来。
关于 Ctalks
Ctalks 是一个专注于区块链行业的媒体平台,致力于传播最新的行业资讯和技术进展,为全球用户提供高质量的内容和服务。
io.net 真实 GPU 数量成迷?去中心化 AI 协议存在哪些问题?撰文:@rargulati,MartinShkreli
编译:白话区块链
@ionet 是建立在 Solana 上的去中心化算力网络,属于 Depin 和 AI 板块,获得了 Mult1C0in Capital 和 Moonhill Capital 的融资,融资金额未披露。
io.net 是一个基于 Solana 的用于 GPU 上的机器学习训练的去中心化云平台,提供即时、无需许可地访问全球 GPU 和 CPU 网络。平台拥有 25000 个节点,并采用革命性的技术将 GPU 云集群在一起,为大规模 AI 初创公司节省了高达 90% 的计算成本。
目前建立在 Solana 上,属于目前比较火热的 Depin 和 AI 板块,今天来看看 X 上两位对其 GPU 和存在的问题进行了分析:
@ionet 拥有多少个 GPU(Graphics Processing Unit,图形处理器 ) 是用于图形处理的芯片)?
X 上@MartinShkreli 对四个答案进行了分析:
1)7648(在部署时尝试时)
2)11107(从他们的资源管理器手动计算)
3)69415(无法解释的数字,不变?)
4)564306(这里没有任何支持、透明度或实质性的信息。连 CoreWeave 或 AWS 都没有这么多)
认为真正的答案实际上是 320 个。
为什么是 320 个呢?
和我一起看一下资源管理器页面。所有的 GPU 都是「免费」的,但你仍然不能租用一个。如果它们是免费的,为什么不能租用呢?人们想要得到报酬,对吗?
你实际上可以租用的只有 320 个。
如果你不能租用它们,那它们就不是真实存在的。即使你可以租用,它也会增加...
@rargulati 表示 Martin 在对此事提出质疑是完全正确的。去中心化的人工智能协议存在以下问题:
1)没有一种成本效益高且时间有效的方式来在高度分布式的通用硬件架构上进行有用的在线训练。这需要一个我目前不知道的重大突破。这就是为什么 FANG 花费的资金比加密货币的所有流动性还要多,用于购买昂贵的硬件、网络连接、数据中心维护等。
2)在通用硬件上进行推断听起来是一个很好的应用案例,但硬件和软件方面的发展如此迅速,以至于通用的去中心化方式在大多数关键用例上表现不佳。可以参考最新的 OpenAI 延迟和 Groq 的增长。
3)从正确路由的请求上进行推断,与请求紧密共存的 gpu 集群,并利用去中心化加密货币来压低资金成本,以与 AWS 竞争并激励爱好者参与。听起来是个不错的主意,但由于供应商众多,GPU 现货市场的流动性分散,没有人整合出足够的供应来提供给运营真正业务的人。
4)软件路由算法必须非常好,不然消费者运营商的通用硬件在操作上存在很多问题。忘掉网络突破和拥塞控制,如果有人决定玩游戏或使用任何使用 webgl 的内容,你可能会遇到某个运营商的服务中断。不可预测的供应端会给运营带来困扰,并给需求方请求者带来不确定性。
这些都是棘手的问题,需要很长很长的时间来解决。所有的投标都只是梗而已。Solana 基金会提议成立去中心化 AI 治理工作组Techub News 消息,Solana 基金会在社交媒体发文表示,将向 Superteam DAO 提交一份提案,旨在成立一个去中心化 AI 治理工作组,以引导 Solana 网络上 AI 安全与治理的研究。该工作组计划设立为期 9 个月的 AI 安全计划,并将邀请加密及 AI 领域的专家参与。Solana 基金会称,此举是为应对日益增长的 AI 需求,并致力于在 Web3 框架下实现 AI 治理的去中心化。 (@solana)Mesh LLM 整合闲置 GPU 构建去中心化 AI 算力网络Techub News 消息,开源项目 Mesh LLM 将闲置英伟达 GPU 整合为点对点网络,支持大语言模型分布式推理,并提供 OpenAI 兼容 API 供开发者直接替换云端模型。
该项目获 Jack Dorsey 支持,通过「Skippy」管道将大模型分区到多节点运行,局域网处理 2350 亿参数模型速度约每秒 16 token。其激励层 Meshtrain 以 MeshCoin 奖励贡献者,Block 旗下 Buzz 应用已集成该网络,数据不经过外部数据中心。(CryptoBriefing)去中心化 AI 平台 Venice API 已被多个应用采用Techub News 消息,去中心化 AI 平台 Venice 宣布其 API 正被越来越多的 AI 应用集成。该平台创始人 Erik Voorhees 在社交媒体上表示,开发者若希望构建不会危害用户隐私的应用,可尝试使用 Venice API 进行开发。
Venice 是一个注重隐私保护的去中心化 AI 平台,由加密货币行业资深人士 Erik Voorhees 创立。该平台致力于提供无需许可、抗审查的 AI 推理服务,允许用户在完全保护数据隐私的前提下使用开源 AI 模型,确保用户交互数据不会被中心化机构收集或存储。美政府拟限制中国开源 AI 模型,去中心化 AI 代币受益Techub News 消息,美国政府正着手限制中国开源 AI 模型使用,针对 DeepSeek、Kimi 等采取更严格监管。此前美方多次警告中国机构通过高频查询美国 AI 模型进行「蒸馏」以提取技术能力,众议院委员会已启动相关调查。
报道指出,由于美国限制本国先进闭源模型,反而促使企业转向更便宜的中国开源替代方案。与此同时,去中心化 AI 基础设施代币受益明显,Venice 的 VVV 代币 6 月底上涨约 14%,Morpheus 的 MOR 代币同期涨幅约 21%。(CryptoBriefing)Bittensor 联合创始人称去中心化 AI 失败将无望对抗巨头Techub News 消息,据 Cointelegraph 报道,Bittensor 联合创始人 Jacob Steeves 表示,如果去中心化 AI 失败,人们可能将失去对抗大型科技公司的希望。他指出,世界可能会被单一 AI 公司的心理偏见所塑造。
他进一步探讨了比特币是否能帮助阻止这种情况的发生,强调了去中心化技术在未来的重要性。Steeves 的观点引发了对 AI 未来发展的广泛讨论。去中心化 AI 项目 Nous Research 支持 Windows 系统Techub News 消息,据 Cointelegraph 报道,去中心化 AI 项目 Nous Research 宣布其旗下 Hermes Agent 现已原生支持 Windows 系统。
Nous Research 是一家专注于去中心化人工智能研究的机构,Hermes Agent 为其开发的 AI 代理工具。此次更新意味着该工具可在 Windows 系统上直接运行,无需额外配置,有助于扩大用户覆盖范围并提升使用便捷性。Bittensor 集成机密路由层至 OpenRouter,推动去中心化 AI 主流化Techub News 消息,据 CryptoBriefing 报道,Bittensor 已将其机密路由层集成至 AI 推理路由平台 OpenRouter,使其子网矿工能够与 Anthropic 等主流 AI 提供商竞争实时推理任务。
此次集成允许开发者通过 OpenRouter 直接访问 Bittensor 子网(如 Chutes SN64 和 Ridges)的算力资源,无需持有 TAO 代币或直接与 Bittensor 网络交互。机密路由层确保推理请求可在不暴露敏感查询数据、用户信息及模型路径的情况下完成路由。数据显示,截至 2026 年 4 至 5 月,Chutes 子网已在 OpenRouter 平台的使用量和性能指标(包括延迟、吞吐量和可用性)方面位居前列。0G Labs 推出 0G App 平台,支持零代码构建去中心化 AI 应用Techub News 消息,据 Decrypt 报道,0G Labs 推出面向消费者的 AI 开发平台 0G App。该平台允许用户通过自然语言指令构建应用程序,无需具备编程能力。0G App 融合了去中心化计算、基于可信执行环境(TEE)的隐私验证,以及代币与 AI 代理的集成部署。这一生态系统旨在为用户提供兼具 Web2 易用性与 Web3 基础设施优势的开发体验,进一步拓展了 0G Labs 代币的实用场景。ATRNX.AI 创始人罗汀泰:去中心化 AI 需主网协同与隐私计算双引擎Techub News 消息,在由 Web3Labs 主办、TRON、Pharos 及 Techub News 联合主办的 Global Web3 Dev Con 大会上,ATRNX.AI 创始人罗汀泰表示,去中心化 AI 需两大关键,包括主网式协同实现自主决策以及具备隐私计算的去中心化基建。其团队基于 TEE 隐私计算及 GPU 并行算力打造去中心化 AI 底层,推出 ATRNX.AI 主网,计划全球部署万级节点,已落地 3000 个节点。平台融合 DPS 架构、时序大模型与金融数据萃取能力,结合 RWA 与链上量化,构建可视化基金与 AI 自动交易体系,赋能政企与机构场景,激活链上沉淀资金价值。去中心化 AI 基础设施初创公司 DeepNode 完成 500 万美元融资Techub News 消息,去中心化 AI 基础设施初创公司 DeepNode 宣布通过两轮融资筹集 500 万美元。其中,第一轮为 200 万美元的种子轮融资,估值 2500 万美元;第二轮为 300 万美元的战略轮融资,估值 7500 万美元。种子轮融资包括社区成员的参与,以及来自 RoundTable21 的 WildSageLabs 和 DNA 的 Rizzo 等关键网络验证者的支持。战略融资的参投者包括 Blockchain Founders Fund、Side Door Ventures、TBV、IOBC Capital、Fomo Ventures 和 Nestoris。撰文: Max.S 资本市场对「去中心化AI」(DeAI)的信仰,正面临一场前所未有的压力测试。 近日,去中心化AI赛道绝对的龙头项目Bittensor($TAO)遭遇了极具破坏性的内部地震。Bittensor生态内最顶级的开发团队之一、刚刚成功训练出72B大语言模型的Covenant AI,突然通过社交媒体宣布全线退出Bittensor网络。在离场宣言中,Covenant AI将矛头直指Bittensor创始人Jacob Steeves,痛批其对网络拥有「绝对且独裁」的控制力,指责其随意切断子网的代币奖励,并直言所谓的去中心化AI不过是一场精心编排的「戏码」。 受此黑天鹅事件影响,$TAO代币价格在二级市场遭遇恐慌性抛售,单日跌幅高达15%至25%,市值瞬间蒸发数亿美元。加密社区在「吃瓜」顶级团队与创始人的公开决裂之余,也开始严肃审视一个深层次的行业命题:在极度依赖算力资本和复杂工程的AI领域,代币经济学驱动的「去中心化」,究竟是重塑生产关系的乌托邦,还是一套掩盖中心化权力的华丽外衣? 要理解此次事件的破坏力,必须先认识Covenant AI在Bittensor生态中的分量。 在Bittensor的多子网架构中,多数子网仍处于低阶的API调用、模型微调或简单的任务路由阶段,真正具备从头训练或大规模参数模型训练能力的团队凤毛麟角。Covenant AI正是这一生态中的「硬核」代表。就在宣布退出前不久,该团队刚刚向社区交付了一项里程碑式的成果:在去中心化网络环境下,成功训练出拥有720亿参数(72B)的开源大模型。 在当前的算力成本下,训练一个72B模型意味着需要调动庞大的GPU集群(通常等效于数千张H100持续运行数周),并付出极其高昂的硬件与电力成本。Covenant AI之所以愿意承担巨额的前置沉没成本,核心逻辑在于Bittensor的「Emissions」机制——只要其提供的模型和算力在子网评估中获得高分,就能持续获得$TAO代币释放作为丰厚回报。这正是DeAI叙事中最具吸引力的飞轮效应。 然而,飞轮在最高潮时戛然而止。据Covenant AI披露,在其投入巨资完成72B模型训练并上线后,创始人Jacob Steeves及其利益相关方通过控制验证者节点(Validators),在毫无预警和透明治理流程的情况下,直接切断了流向Covenant AI子网的代币奖励。 对于矿工和开发者而言,切断Emissions无异于「拔网线」。巨额算力支出的ROI瞬间归零,这种极度不可预测的系统性风险,直接触发了Covenant AI的愤怒离场。 Covenant AI在退出声明中使用的「戏码」(Charade)一词,精准地刺痛了Bittensor最为脆弱的神经:网络控制权。 Bittensor的底层设计依赖于Yuma共识,其核心在于由"验证者"来评估"矿工"的贡献,并决定系统增发的$TAO代币如何分配。从理论上看,这是一个基于质押量和算法的去中心化博弈系统。但Covenant AI的控诉揭示了残酷的现实:算力是分散的,但权力和资本却是高度集中的。 在当前的Bittensor根网络中,能够主导代币分配流向的头部验证者节点,其背后的质押筹码高度集中于早期投资者、基金会以及创始人Jacob Steeves的关联地址。这意味着,创始人不仅是规则的制定者,更是最大的裁判。 Covenant AI指出,当子网的产出不符合Jacob的个人意愿,或者可能威胁到其他「嫡系」子网的利益时,Jacob可以轻易利用其掌握的庞大质押权重,改变Yuma共识的分配结果。这种「一言堂」式的干预,使得智能合约层面的去中心化形同虚设。开发者花费数百万美元购买算力,其命运最终却取决于一位创始人的主观意志或暗箱操作。 客观来看,Jacob及其支持者或许会以「维护网络整体质量」、「防止特定子网利用规则漏洞刷币」为由进行辩护。但在缺乏透明的DAO治理机制、没有链上听证和申诉通道的情况下,这种「替天行道」的中心化干预,严重破坏了网络作为「可信中立基础设施」的核心价值。 $TAO单日暴跌15-25%,绝不仅仅是散户情绪恐慌导致的踩踏,更是机构资金对Bittensor「治理风险折价」的重新定价。 Bittensor之所以能支撑起庞大的市值,享有极高的估值溢价,是因为市场将其视为「去中心化OpenAI」的唯一现实标的。这个宏大叙事的基础,是系统必须具备极强的可预期性:只要你贡献算力和优质模型,协议就会自动用代码保障你的收益。 Covenant AI事件打破了这一预期。顶级金融从业者和机构投资者最厌恶的便是「不可预测的单一节点故障」,而在这里,这个故障点就是Jacob Steeves的权力。 如果连能够训练出72B模型的绝对头部团队,都会因为创始人的干预而瞬间颗粒无收,那么对于其他持币观望的算力提供商、AI研究机构而言,在Bittensor上部署重资产无疑是在进行一场随时可能被「掀桌子」的俄罗斯轮盘赌。当高质量的供给端(矿工和开发者)因为恐惧中心化暴政而拒绝进入,$TAO代币的应用场景和内在价值也就成了无源之水。资金的疯狂出逃,正是对这种基本面恶化的提前投票。 Covenant AI的出走,不仅仅是Bittensor一家的公关危机,更是整个去中心化AI赛道发展到深水区后必然面临的阵痛。它残酷地向行业揭示了DeAI领域的「不可能三角」:模型质量与规模、去中心化的可信中立、以及防作恶的激励对齐。 规模的中心化 vs. 机制的去中心化:前沿AI(如72B以上大模型)的训练是典型的重资本、中心化工程,需要高度协同的GPU集群。这与Web3倡导的无许可、分散式节点有着天然的物理鸿沟。 防刷量 vs. 可信中立:为了防止劣质节点通过互刷流量骗取代币(女巫攻击),网络必须引入主观的「质量评估」。但在AI评估标准尚未完全客观数学化的今天,这种评估权一旦交给少数验证者,极易演变为中心化的权力寻租。 Bittensor试图用代币经济学架起连接两者的桥梁,但Covenant事件证明,这座桥梁的承重柱(治理机制)目前仍然脆弱不堪。 Covenant AI的离场,戳破了Bittensor「绝对去中心化」的浪漫主义泡沫。对于$TAO而言,这或许是一次痛苦的去魅时刻,但对于整个DeAI行业,却是一次必要的警钟。
