qbitai 机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理 发布时间:2026-09-04 09:19 UTC 星尘智能基座模型团队近日发布了SmoothRL,一种支持异步执行的在线强化学习框架。该框架旨在解决大模型在线强化学习中推理与训练速度不匹配的问题,允许机器人等其他系统在模型推理时继续运行,无需等待。SmoothRL通过异步机制提高了训练效率,有望加速大模型在机器人等领域的应用。 阅读原文 ↗