Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种用于多轮大语言模型智能体的策略蒸馏方法。该方法训练智能体避免最具破坏性的早期错误,并在错误发生时进行恢复。在针对 13 个基线的测试中,该方法在 ALFWorld、WebShop 和基于搜索的 QA 任务上,为 Qwen3-1.7B 和 Qwen3-8B 学生模型取得了最佳平均成绩。研究结论是,恢复能力是可学习的,而标准策略蒸馏很少教授这一点。 该方法在 Qwen3-8B 学生模型上,能从 72.7% 的重放关键错误中恢复,而标准策略蒸馏的恢复率仅为 20.3%。该方法不增加推理成本,训练后的智能体可在其基础模型运行的任何地方运行。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,NVIDIA 联合普林斯顿大学和马里兰大学的研究人员推出 PivotOPD,这是一种用于多轮大语言模型智能体的策略蒸馏方法。该方法训练智能体避免最具破坏性的早期错误,并在错误发生时进行恢复。在针对 13 个基线的测试中,该方法在 ALFWorld、WebShop 和基于搜索的 QA 任务上,为 Qwen3-1.7B 和 Qwen3-8B 学生模型取得了最佳平均成绩。研究结论是,恢复能力是可学习的,而标准策略蒸馏很少教授这一点。 该方法在 Qwen3-8B 学生模型上,能从 72.7% 的重放关键错误中恢复,而标准策略蒸馏的恢复率仅为 20.3%。该方法不增加推理成本,训练后的智能体可在其基础模型运行的任何地方运行。(MarkTechPost)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。