|
|
模型持续训练后越来越难学新知识,实验显示扩参只能推迟塑性丧失 AI帝国 · 公众号 · · 1 周前 · |
|
|
MCP服务器怎么设计?15个样本归纳5种模式,Haiku在15个工具时准确率降至87% AI帝国 · 公众号 · · 1 周前 · |
|
|
GAT让GAN从S稳定扩到XL,ImageNet-256单步生成FID 2.18 AI帝国 · 公众号 · · 1 周前 · |
|
|
Google DeepMind Gemma 4的技术报告 AI帝国 · 公众号 · · 1 周前 · |
|
|
AI 自我改进的 harness 工程新帖 AI帝国 · 公众号 · · 1 周前 · |
|
|
agent的经验该写进提示词,还是训进模型?JERP把两条路合在一起 AI帝国 · 公众号 · · 2 周前 · |
|
|
模型推理离GPU极限还差多少?SOLAR从源码自动算运行天花板 AI帝国 · 公众号 · · 2 周前 · |
|
|
推理数据筛选太耗token?TEMP用前100个token先挑出难题 AI帝国 · 公众号 · · 2 周前 · |
|
|
同样配置的大模型为何有的开窍?关键可能是稀疏注意力模式 AI帝国 · 公众号 · · 2 周前 · |