Techub News 消息,Sakana AI 发布研究论文《Beyond Imitation》,介绍其围绕错误检测构建的大模型辅助同行评审系统。该系统采用多层评审(MLR)架构,使用 Claude Sonnet 4 与 Claude Haiku 3.5 等现成 API 模型,无需 GPU 或微调,每次评审成本约 0.47 美元。 在一个包含 1,164 个植入矛盾的基准测试中,MLR 系统在 4 次评审下捕获了 73.43% 的核心主张错误,而最佳基线模型仅捕获 14.81%。但在真实撤稿论文测试中,其精确匹配率仅为 16.11%。 该系统包含三个智能体:附录智能体总结实验细节、文献综述智能体进行网络搜索定位研究背景、评审智能体执行三阶段提示链进行评审。论文还指出,MLR 的评审重点与人类存在差异,更强调有效性和实验,而人类更看重清晰度和新颖性。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,Sakana AI 发布研究论文《Beyond Imitation》,介绍其围绕错误检测构建的大模型辅助同行评审系统。该系统采用多层评审(MLR)架构,使用 Claude Sonnet 4 与 Claude Haiku 3.5 等现成 API 模型,无需 GPU 或微调,每次评审成本约 0.47 美元。 在一个包含 1,164 个植入矛盾的基准测试中,MLR 系统在 4 次评审下捕获了 73.43% 的核心主张错误,而最佳基线模型仅捕获 14.81%。但在真实撤稿论文测试中,其精确匹配率仅为 16.11%。 该系统包含三个智能体:附录智能体总结实验细节、文献综述智能体进行网络搜索定位研究背景、评审智能体执行三阶段提示链进行评审。论文还指出,MLR 的评审重点与人类存在差异,更强调有效性和实验,而人类更看重清晰度和新颖性。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。