|
|
RL没你想的那么神,蒸馏也没那么low~ 吃果冻不吐果冻皮 · 公众号 · · 昨天 · |
|
|
做LLM最怕选错方向!这份按资源匹配的407篇论文清单,帮你省下3个月试错时间 吃果冻不吐果冻皮 · 公众号 · · 昨天 · |
|
|
解构 Scaling Law:优化、架构、数据的三重奏 吃果冻不吐果冻皮 · 公众号 · · 2 天前 · |
|
|
自进化(Self-evolving/RSI),一篇就够了 吃果冻不吐果冻皮 · 公众号 · · 4 天前 · |
|
|
大模型Agent的“隐藏杠杆”:编排层如何让Token开销直降41% 吃果冻不吐果冻皮 · 公众号 · · 6 天前 · |
|
|
从 DeepSeek mHC 到 xHC:如何高效 scale 残差流? 吃果冻不吐果冻皮 · 公众号 · · 1 周前 · |
|
|
从 LLM Rollout 到 Agentic Rollout!Agentic RL 训练框架设计中... 吃果冻不吐果冻皮 · 公众号 · · 1 周前 · |
|
|
RL Infra 训练基础: loop 与 RLHF-PPO 吃果冻不吐果冻皮 · 公众号 · · 2 周前 · |
|
|
NVIDIA InfiniBand 技术解析及应用 吃果冻不吐果冻皮 · 公众号 · · 2 周前 · |
|
|
从推理角度看 kimi k3 吃果冻不吐果冻皮 · 公众号 · · 2 周前 · |
|
|
大模型RL训练为何会「越训越窄」?ACL Outstanding Paper从token-level... 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
我替你读完了CVPR/ICLR/ICML等顶会的所有【Transformer】论文! 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
NVIDIA SHARP 技术解析:通过网络内计算提升分布式通信性能 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
深度解析 MiMo-V2-Flash 中的 MOPD :把多老师蒸馏到一个 student 模型中 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
基于 CUDA MPS 的同 GPU 数据并行 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
MoE 推理的通信暗战:从 DeepEP 到 LPLB,All-to-All 延迟压缩 90% 的工... 吃果冻不吐果冻皮 · 公众号 · · 3 周前 · |
|
|
Claude工程师终于交出Fable 5焚诀!教你打破和模型之间的信息差 吃果冻不吐果冻皮 · 公众号 · · 1 月前 · |
|
|
当异步 Agentic RL 遇到“旧策略失忆”:重新理解 Off-Policy Correctio... 吃果冻不吐果冻皮 · 公众号 · · 1 月前 · |
|
|
从 nnScaler 到大规模训练:谈一谈对分布式训练系统边界的一些理解 吃果冻不吐果冻皮 · 公众号 · · 1 月前 · |