|
|
LLM 训练细节!预训练、单轮SFT、多轮SFT中的loss与mask配置 吃果冻不吐果冻皮 · 公众号 · · 9 月前 · |
|
|
听说,大家都在梭后训练?最佳指南来了 吃果冻不吐果冻皮 · 公众号 · · 10 月前 · |
|
|
DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day... 吃果冻不吐果冻皮 · 公众号 · · 10 月前 · |
|
|
一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后 吃果冻不吐果冻皮 · 公众号 · · 10 月前 · |
|
|
LLM显存占用分析:从MHA/GQA到MLA架构的内存优化、KV Cache演进与高并发部署策略 吃果冻不吐果冻皮 · 公众号 · · 10 月前 · |
|
|
LLM中如何添加special_token,并且尽可能保持原模型的训练效果 吃果冻不吐果冻皮 · 公众号 · · 10 月前 · |