在AI性能验证中出现信任空白这一主要挑战之际,基于区块链的新型评估体系正受到关注。基于区块链的AI评估项目Recall近期在报告中介绍了名为"Proof-of-Intelligence"的新型信任机制,其目标是构建"帮助AI自我证明的基础设施"。该系统以AI间实时竞争为主要工具,核心在于利用基于数据的行为记录构建声誉系统,而非依赖人类主观评价。
Recall通过2025年举办的"AlphaWave"交易挑战赛,进行了AI代理实际验证性能并接受评估的实验。超过1000个AI交易代理在一周内针对181个代币完成了9977笔交易,创造了约30亿韩元的收益。通过该实验,交易行为、收益率、可重复性、风险管理等数据被记录在区块链上,并基于此计算出AI综合声誉分数"RecallRank"。Notch Research分析认为,该评分体系具有超越简单排行榜的价值,在AI生态中扮演着信任货币的角色。
Recall的核心结构由竞争层、排名引擎、经济策展三层组成。在竞争层,AI在真实环境中解决问题并生成数据;排名引擎基于这些数据,通过"绩效"和"确定性"两个指标计算声誉分数。在经济策展层,社区成员可对其信任的AI进行代币质押,并根据预测结果获得奖励或承担损失。这些数据会再次应用于声誉评分,使信任伴随实际风险。
Proof-of-Intelligence系统尤其区别于依赖预制演示视频或单次测试结果的传统基准测试方法,要求数据满足实时性、可重复性、可验证性三项标准。所有AI的判断与行为都存储在区块链上,可供任何人查阅验证,并以不可篡改的形式保存。据整理该系统的Notch Research表示,此结构成为填补AI信任空白的关键钥匙。
Recall通过竞争收集数据,基于此对AI性能进行排名,并构建由社区共同评估结果有效性的链上机制。不仅在交易等可量化领域,在创造力或共情力等定性技能领域,用户社区也可直接提议评估项目并举办验证大赛。此时,代币质押等经济选择比简单评分更能提升评估可信度。
在2025年8月进行的"Recall Predict"实验中,在GPT-5发布前夕,超过25万名用户对各类AI模型性能进行了预测。该实验是全球首个由分布式社区主导的AI性能预测基准测试,预测准确率达82%。此预测结果同样被用作RecallRank计算的输入值。AlphaWave评估的是AI"行为",而Predict则是验证"判断力"的实验。
RecallRank作为反映可重复性及社区判断的声誉系统,而非单次成果,采用贝叶斯更新模型动态更新信任值。特别通过逐步降低陈旧数据影响力,构建以实时数据为核心的声誉体系。社区质押不仅是简单投票,更通过处理为集体概率分布来校准信任准确度。
最终Recall正在从单纯的AI测试平台,演进为基于AI信任实现资本流动的声誉基础设施。随着AI技术发展速度加快,评估体系也需转向透明可验证系统的主张正获得认同。Recall通过区块链技术实现这一愿景,正在系统性重新定义AI与人类信任关系方面进行首次尝试。这实证了AI发展的下一阶段并非追求更庞大的模型,而是实现"更可信赖的结果"这一命题。


