|
|
多模态大模型真能看懂“细粒度”世界吗?FG-BMK 揭示 LVLM 细粒度视觉理解瓶颈 极市平台 · 公众号 · · 3 周前 · |
|
|
从图像到视频的任意分割:X2SAM让MLLM 真正看懂像素级时空世界 极市平台 · 公众号 · · 3 周前 · |
|
|
ECCV 2026|MoKus:跨模态知识迁移用于知识感知概念定制,每条知识绑定约 7 秒 极市平台 · 公众号 · · 3 周前 · |
|
|
ICML 2026|把位置编码扔了,旋转等变性反而更强了——REViT 计算量降低 67% 极市平台 · 公众号 · · 3 周前 · |
|
|
华科 × MiniMax|VTP:打破视觉 Tokenizer "越训越差"的诅咒,gFID 1.1... 极市平台 · 公众号 · · 3 周前 · |
|
|
清华x微软提出 STAR-PólyaMath,Apex基准超GPT-5.5 13.5% 极市平台 · 公众号 · · 3 周前 · |
|
|
高德开源 DreamX-World 1.0:5B 参数交互式世界模型,几何检索记忆解决转头穿帮,16... 极市平台 · 公众号 · · 3 周前 · |
|
|
ECCV 2026|LeCun、谢赛宁转发的世界模型与VLA共融方案 VLA-JEPA 极市平台 · 公众号 · · 3 周前 · |
|
|
ECCV 2026|UniStitch:统一几何与语义特征的图像拼接框架(代码开源) 极市平台 · 公众号 · · 4 周前 · |
|
|
腾讯混元×浙大最新开源:VLM 不只会聊天对话,还能原生输出像素级深度图 极市平台 · 公众号 · · 4 周前 · |
|
|
CVPR 2026|南京大学开源CoMo:从互联网视频中无监督学习连续潜在运动 极市平台 · 公众号 · · 4 周前 · |
|
|
小参数,大能力|星际视觉语言大模型再进化,0.8B轻量版正式发布 极市平台 · 公众号 · · 4 周前 · |
|
|
极市专访|北交大金一教授:做AI与铁路之间的"翻译官",在99.9%准确率之外,补一堂"踩坑"必修课 极市平台 · 公众号 · · 4 周前 · |
|
|
EBench具身操作榜更新:Qwen-RobotManip登顶第一 极市平台 · 公众号 · · 1 月前 · |
|
|
DeepSeek、Kimi、字节三大厂同时下手:Transformer最基础的残差连接要变了 极市平台 · 公众号 · · 1 月前 · |
|
|
具身问答与推理数据集汇总 极市平台 · 公众号 · · 1 月前 · |
|
|
CVPR 2026 Oral|剪枝不用重训练,还能反超基线?华科大开源NuWa算法:边缘部署算力成本... 极市平台 · 公众号 · · 1 月前 · |
|
|
ICML 2026|迈向细粒度鲁棒性:面向视觉语言模型推理的注意力引导提示调优 极市平台 · 公众号 · · 1 月前 · |
|
|
图片越糊越危险?西湖大学发现多模态大模型「攻击舒适区」 极市平台 · 公众号 · · 1 月前 · |
|
|
CVPR 2026 Oral|一个提示点+一个连续滑块,哈工大提出尺度可控 3D 点云零件分割新框架... 极市平台 · 公众号 · · 1 月前 · |