Techub News 消息,AI 评估组织 METR 与 Epoch AI 联合发布 MirrorCode 基准测试,用于评估 AI 智能体的长程编码能力。测试结果显示,Claude Opus 4.6 成功将约 16,000 行代码的生物信息学工具 gotree 从 Go 语言重构为 Rust 语言,并通过 99.95% 的测试。 该基准测试要求 AI 在不查看源代码的情况下,仅通过输入输出行为重构完整的命令行程序。研究人员估计,人类工程师完成 gotree 重构任务需要 2 至 17 周,而 Claude 在 10 亿 token 预算内完成。测试还涵盖 Unix 工具、解释器、加密实现等领域的 20 多个目标程序。(CryptoBriefing)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja.
Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat.
Pengguna menanggung sendiri risiko bagi tindakan berdasarkan maklumat di laman web ini.
Techub News 消息,AI 评估组织 METR 与 Epoch AI 联合发布 MirrorCode 基准测试,用于评估 AI 智能体的长程编码能力。测试结果显示,Claude Opus 4.6 成功将约 16,000 行代码的生物信息学工具 gotree 从 Go 语言重构为 Rust 语言,并通过 99.95% 的测试。 该基准测试要求 AI 在不查看源代码的情况下,仅通过输入输出行为重构完整的命令行程序。研究人员估计,人类工程师完成 gotree 重构任务需要 2 至 17 周,而 Claude 在 10 亿 token 预算内完成。测试还涵盖 Unix 工具、解释器、加密实现等领域的 20 多个目标程序。(CryptoBriefing)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Semua maklumat di laman web ini adalah untuk rujukan sahaja. Laman web ini tidak menjamin ketepatan, kesahan, ketepatan masa atau kelengkapan maklumat. Pengguna menanggung sendiri risiko bagi sebarang tindakan berdasarkan maklumat ini.