Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种用于多轮大语言模型智能体的策略蒸馏方法。该方法训练智能体避免最具破坏性的早期错误,并在错误发生时进行恢复。在针对 13 个基线的测试中,该方法在 ALFWorld、WebShop 和基于搜索的 QA 任务上,为 Qwen3-1.7B 和 Qwen3-8B 学生模型取得了最佳平均成绩。研究结论是,恢复能力是可学习的,而标准策略蒸馏很少教授这一点。 该方法在 Qwen3-8B 学生模型上,能从 72.7% 的重放关键错误中恢复,而标准策略蒸馏的恢复率仅为 20.3%。该方法不增加推理成本,训练后的智能体可在其基础模型运行的任何地方运行。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Mọi thông tin trên trang web này chỉ mang tính tham khảo.
Trang web không bảo đảm tính chính xác, hiệu lực, kịp thời hay đầy đủ của thông tin.
Người dùng tự chịu rủi ro khi hành động dựa trên thông tin của trang web này.
Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种用于多轮大语言模型智能体的策略蒸馏方法。该方法训练智能体避免最具破坏性的早期错误,并在错误发生时进行恢复。在针对 13 个基线的测试中,该方法在 ALFWorld、WebShop 和基于搜索的 QA 任务上,为 Qwen3-1.7B 和 Qwen3-8B 学生模型取得了最佳平均成绩。研究结论是,恢复能力是可学习的,而标准策略蒸馏很少教授这一点。 该方法在 Qwen3-8B 学生模型上,能从 72.7% 的重放关键错误中恢复,而标准策略蒸馏的恢复率仅为 20.3%。该方法不增加推理成本,训练后的智能体可在其基础模型运行的任何地方运行。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

Mọi thông tin trên trang web này chỉ mang tính tham khảo. Trang web không bảo đảm tính chính xác, hiệu lực, kịp thời hay đầy đủ của thông tin. Người dùng tự chịu rủi ro khi hành động dựa trên thông tin của trang web này.