专栏名称: AINLPer
一个专注自然语言处理(NLP)方向的公众号。机器学习(ML)、深度学习(DL)、自然语言处理相关模型理解、热门论文(Paper)分享分析、pytorch、C++、Python、Java ...
TodayRss-海外RSS稳定源
目录
今天看啥  ›  专栏  ›  AINLPer

LLM“炒股”水平如何?谷歌怎样“教会”小模型?本周10篇精选论文分享

AINLPer  · 公众号  · 科技自媒体  · 2025-11-09 22:19
    

主要观点总结

本周AI领域有多篇重要论文发布,涉及LLM、Reg-DPO、Orion-MSP等主题。LLM在金融决策、表格数据学习、视频生成、视觉-语言-行动模型等方面都有新进展。其他论文涉及语音处理、多模态基准、监督强化学习等。本文对这些论文进行了简要介绍和总结。

关键观点总结

关键观点1: UIUC开始让LLM下场“炒股”,测试真实决策力

UIUC的论文提出实时交易环境LiveTradeBench,用于评估LLM代理在真实市场中的表现。结果显示静态评估与现实世界能力之间存在差距,激励了测试连续决策和实时一致性的基准测试。

关键观点2: 字节提升视频生成质量

字节的Reg-DPO方法利用真实视频作为正样本、模型生成视频作为负样本自动构建高质量偏好对,无需外部标注。并结合SFT损失作为正则项加入DPO目标,增强训练稳定性和生成保真度。

关键观点3: 高效VLAs全面综述

首次对高效VLAs进行综合综述,涵盖数据、模型、训练全过程,提出统一分类法,将技术分为三大核心支柱。为社区建立基础参考,总结代表性应用,阐述关键挑战和规划未来研究路线图。

关键观点4: CMU发布首个音素语音基础模型

CMU提出POWSM模型,能联合执行多种音素相关任务,实现音频、文本和音素间无缝转换。该模型性能优于或媲美类似大小的专用PR模型。

关键观点5: Meta构建多模态多轮全面RAG基准

Meta构建了CRAG-MM基准,包含单轮和多轮对话任务,涵盖多个领域。该基准为智能眼镜等可穿戴设备提供评估标准,并举办了KDD Cup 2025吸引众多参与者。

关键观点6: Google使用监督强化学习SRL提升LLM推理能力

Google提出监督强化学习(SRL)框架,将问题解决转化为生成逻辑‘动作’序列。该框架使小模型能学会此前SFT或RLVR学不会的难题,并提高了模型的灵活推理能力。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址 (快捷配置)
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照