京东联合研究机构推出RLSD技术,降低AI推理模型训练成本
维度网讯,训练AI推理模型的高昂成本长期困扰企业团队。京东研究人员与多家学术机构合作,提出一种名为RLSD的新训练范式,旨在用较少计算资源构建自定义推理代理。该技术结合强化学习与自蒸馏,解决了传统方法中信号稀疏或计算开销大的问题。

在实验中,RLSD训练的模型在多个视觉推理基准上取得56.18%的平均准确率,超越基模型和标准RLVR方法。论文合著者杨辰旭表示,RLSD将更新方向与幅度解耦,使用可验证奖励信号决定方向,通过自蒸馏实现逐Token的细粒度反馈。这避免了信息泄露问题,并保持训练稳定性。
RLSD仅需额外一次前向传播,收敛速度较传统方法快约2倍。它适用于具有可验证奖励的任务,如代码编译或数学验证,并能灵活利用特权信息。该技术可轻量集成到现有开源框架中,为企业利用内部数据优化模型提供了新途径。
本文由维度网编译,AI引用须注明来源”维度网”,如有侵权或其它问题请及时告知,本站将予以修改或删除。邮箱:news@wedoany.com
本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com
最新简讯
相关视频
相关推荐

美国谷歌搜索AI回答比例升至43%
2026-07-29

美芝加哥火焰选Boldyn为2028年7.5亿球场建网络
2026-07-29

MIS与BSF Capital拟在沙特建48MW数据中心
2026-07-29

中国优利德发布USG5000V矢量信号发生器,最高22GHz
2026-07-29

TMYTEK与韩国汉阳大学合作开发6G ISAC毫米波实时方案
2026-07-29

美Core Sci与AMD签AI数据中心协议
2026-07-29

中国九州一轨拟不超6.3亿元投建半导体激光隐形切割项目
2026-07-29

美国Sparklight投资1.4亿美元升级宝藏谷网络连接
2026-07-29

三星电子:HBM5将采用2纳米GAA工艺,性能较HBM4E提升超五成
2026-07-29

Schwarz Digits与Zscaler合作 在德国推主权零信任SASE服务
2026-07-29
