专栏 RSS订阅(公众号)
温馨提示:订阅专栏后我们将尽力更新;开通极速订阅将快速且稳定更新;无人订阅的专栏有可能不会更新
程序化API访问方法
专栏 二维码
TodayRss-海外RSS稳定源
他们也喜欢这个专栏
 • 
RSS订阅
今天看啥  ›  专栏  ›  吃果冻不吐果冻皮
专注于AI工程化(LLM、MLOps、LLMOps、RAG、Agent)落地。
免责声明:本专栏仅为信息导航参考,不代表原文立场或观点。 原专栏内容版权归原作者所有,如您为原作者并希望删除该专栏,请通过 【版权申诉通道】联系我们处理。
开通 RSS极速订阅 可分钟级获得文章
第23期-大模型书籍赠送活动
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
聊聊强化学习中的奖励、价值函数与期望
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
聊聊 RL 在多模态任务上复现 R1 的一些问题
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从算法成功转到模型推理:应届生斩获 6 个 offer 的进阶之路
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
FlexRLHF-分布式RLHF系统
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从复杂文档到AI秒懂的高质量数据:EasyDoc解析实战指南
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从DeepSeek->Kimi->豆包->Qwen3,看Reasoning model之路
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
强化学习算法梳理:从 PPO 到 GRPO 再到 DAPO
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从字节、百川、Bespoke Labs 3个大模型项目,看RL驱动下的Agent技术趋势
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
Qwen3开源,性能越级,混合模式,Dense与MoE共8种尺寸
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
Qwen3中性能最强MOE模型部署抛砖引玉 + 实测
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从论文中积累复现 R1 的 insight
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
思考 RLHF 的本质以及主流算法思路
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从Math RL初窥LLM推理模型:是怎么work、哪些trick是有效的!
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
从模型原理到代码实践,深入浅出上手Transformer,叩开大模型世界的大门
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  · 
好文推荐!从强化学习到DeepSeek R1
吃果冻不吐果冻皮  ·  公众号  ·  ·  1 年前  ·