|
|
微软开源Mage-VL:编解码器原生流式多模态大模型,砍掉75%视觉Token,推理提速3.5倍 我爱计算机视觉 · 公众号 · · 14 小时前 · |
|
|
TPAMI | 北大 & 清华 & 复旦 提出 SparseVLM+:修正注意力偏置,让「文... 我爱计算机视觉 · 公众号 · · 昨天 · |
|
|
Adobe提出Wonder:生成式视频世界模型新标杆,16 FPS实时漫游且记忆不塌陷 我爱计算机视觉 · 公众号 · · 2 天前 · |
|
|
ACM MM 2026 | 华南理工提出SPaTS:单个Visual Token就够好,基于强化学习... 我爱计算机视觉 · 公众号 · · 3 天前 · |
|
|
LLaVA直接涨了11.2%:一个无需训练的VQA提分方案 我爱计算机视觉 · 公众号 · · 1 周前 · |
|
|
1.13 亿巨量数据加持!华科开源 MonkeyOCRv2:用“文本生成+像素重建”的表征学习,刷新... 我爱计算机视觉 · 公众号 · · 1 周前 · |