Techub News 消息,微软亚洲研究院(Microsoft Research Asia)发布并开源了 Agent Lightning v1.0,这是一个轻量级的智能体强化学习框架。该框架采用「Harnessed Agentic RL」训练范式,允许开发者直接使用真实部署环境中的智能体进行强化学习训练,无需在训练框架内重新实现智能体逻辑。 Agent Lightning v1.0 整个框架仅包含约 3500 行代码,设计轻量。它原生支持 Kubernetes,智能体可作为标准 Kubernetes 作业运行,无需依赖付费的商业沙盒服务。 此外,研究团队展示了一个端到端的编码智能体训练示例,基于 Qwen3.5-9B 模型,仅使用约 6000 个训练样本,在 SWE-bench Verified 基准测试上的 Pass@1 得分从 41.8% 提升至 56.4%,绝对提升达 14.6 个百分点。(Microsoft Research)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。
本网站不保证信息的准确性、有效性、及时性和完整性。
任何依赖于本网站所提供信息的行为,均由用户自行承担风险。
Techub News 消息,微软亚洲研究院(Microsoft Research Asia)发布并开源了 Agent Lightning v1.0,这是一个轻量级的智能体强化学习框架。该框架采用「Harnessed Agentic RL」训练范式,允许开发者直接使用真实部署环境中的智能体进行强化学习训练,无需在训练框架内重新实现智能体逻辑。 Agent Lightning v1.0 整个框架仅包含约 3500 行代码,设计轻量。它原生支持 Kubernetes,智能体可作为标准 Kubernetes 作业运行,无需依赖付费的商业沙盒服务。 此外,研究团队展示了一个端到端的编码智能体训练示例,基于 Qwen3.5-9B 模型,仅使用约 6000 个训练样本,在 SWE-bench Verified 基准测试上的 Pass@1 得分从 41.8% 提升至 56.4%,绝对提升达 14.6 个百分点。(Microsoft Research)
如您认为本页面(或本平台)内容存在侵权或违规情形,请您在发现之日起尽快与我们联系,并提供:权利人姓名/名称及联系方式、被侵权作品名称及权属证明、具体侵权链接及情况说明。我们在核实后将及时处理相关内容。
联系方式:creator@techub.news
商务合作:contacting@techub.news
点击链接下载 Techub News App,获取最新讯息:
https://www.techub.news/download
(或扫描下方二维码下载)

本网站所提供的所有信息仅供参考之用。本网站不保证信息的准确性、有效性、及时性和完整性。任何依赖于本网站所提供信息的行为,均由用户自行承担风险。