|
|
[知识蒸馏][17] ExOPD:On-policy Distillation中学生模型如何超过教师... 偷星九月333 · B站投稿视频 · · 6 天前 · |
|
|
KIMI K3的三个核心架构:KDA、Attention Residuals和Stable Late... 偷星九月333 · B站投稿视频 · · 1 周前 · |
|
|
[Agentic RL][28] ECHO:改善Agentic RL长程任务上下文过长、奖励分配问题 偷星九月333 · B站投稿视频 · · 1 周前 · |
|
|
[知识蒸馏][16] Multi-teacher On-policy Distillation,将多... 偷星九月333 · B站投稿视频 · · 2 周前 · |
|
|
[Agentic RL][27] slime multi-agent rl,solver/rewri... 偷星九月333 · B站投稿视频 · · 4 周前 · |
|
|
GLM5.2 IndexShare/KVShare讲解,更长的上下文,更低的成本,更快的速度 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
[Agentic RL][26] slime coding agent rl,使用claude co... 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
[知识蒸馏][15] 改善OPD中教师监督不可靠问题(轨迹级、prefix级、token级等) 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
[Agent][08] Loop Engineering原理解读(以Codex Goal为例),简单... 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
[知识蒸馏][14] ROPD:闭源大模型作为教师模型如何OPD 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
学习多模态大模型必须掌握的1D/2D/3D RoPE,不同维度的旋转位置编码如何统一 偷星九月333 · B站投稿视频 · · 1 月前 · |
|
|
[RAG][02] 关于RAG流程上的几个常用优化点 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[知识蒸馏][13] slime里面的on-policy distillation的实现逻辑 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[知识蒸馏][12] 一个很容易被忽略但是很重要的问题:为什么OPD中一般不直接使用reverse ... 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[知识蒸馏][11] Uni-OPD:从教师学生双视角优化OPD,提升教师模型监督可靠性、学生模型探... 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
从分布视角看SFT、RL和OPD,解释为什么RL和OPD泛化性能更好 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[知识蒸馏][10] TCOD:将课程学习加入On-Policy Distillation,改善Ag... 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[Agentic RL][26] Optimal Token Baseline(OTB)理论推导,非... 偷星九月333 · B站投稿视频 · · 2 月前 · |
|
|
[知识蒸馏][09] on policy distillation(OPD)中的kl散度详解 偷星九月333 · B站投稿视频 · · 3 月前 · |
|
|
[数据合成][02] magpie: 不依赖任何种子数据集或人工指令构建的指令数据合成(SFT数据) 偷星九月333 · B站投稿视频 · · 3 月前 · |