行业动态
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
量子位
2026年9月4日 17:19
2026年9月4日 17:19
动态投掷:39% → 94%。 机器人需要从随机位置抓取物体,再投进不同位置的目标箱。这个任务不是到达一个目标位姿就结束,而是要求手臂在摆动过程中持续积累速度,并在准确时刻释放。论文特别指出,一旦在 action chunk 边界发生停顿,手臂可能几乎降到静止,剩余摆动很难重新恢复所需释放速度。因此,它对异步执行尤其敏感。在累计 250 个 rollout episodes 的评估节点,成功率从基础策略的 39% 提升至 94%。 SmoothRL 由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。 本文由星尘智能提供,量子位获授权转载,观点归原作者所有。
注:以上内容摘选自原始新闻,点击「访问原文」查看完整内容。
标签
星尘智能
新闻来源
量子位 · 2026年9月4日 17:19