今天看啥  ›  专栏  ›  机器之心

扩散LLM推理用上类GRPO强化学习!优于单独SFT,UCLA、Meta新框架d1开源

机器之心  · 公众号  · AI  · 2025-04-20 12:03
    

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照