来自该信源的全部动态 · 共 981 条
论文提出ComMem,用互补记忆系统改进视觉语言模型的测试时自适应。方法旨在避免现有TTA只做局部更新、难以长期积累知识的问题,并利用多模态信息提升动态真实环境中的鲁棒部署能力。
论文关注自动驾驶中行人轨迹预测模型的安全性,指出对抗攻击会显著降低预测精度并诱发危险驾驶行为,现有启发式防御难以抵御更强的定向攻击。TrajRS尝试为轨迹预测建立可认证鲁棒性框架,为安全评估提供更可验证的依据。
论文研究概念式可解释AI中细粒度概念标注不足的问题,评估中等规模多模态大模型在严格零样本条件下,对目标框区域进行对象级与部件级概念命名的能力,并提出可复现评测流程。
论文提出一种机制可解释性方法,通过在LLM残差流中识别与OCEAN人格特质相关的潜在方向,并直接干预这些特征来调控生成文本的人格表现。相比提示工程或微调,该方法更关注模型内部表征与可控性。
论文提出MedEvoEval,用模拟门诊临床过程评估医生智能体。不同于固定输入医学问答,它考察智能体在单次就诊中收集证据、调用检查与会诊资源、决定诊疗方案,以及跨病例通过记忆、检索、反思等机制持续改变行为的能力。
论文用演化博弈论建模竞争市场中,两类AI代理的采纳与福利结果:一种追求用户认可,另一种最小化伤害。研究在事后判断、同伴证词、伤害账本和社区反馈等假设下,后者能否取代RLHF式代理并避免群体伤害。
论文研究多模态情绪识别中显式推理的实际作用,发现基于MLLM的快速直接回答常比慢速链式推理更准。作者分析快思提升召回、慢思增强可解释性,并提出MER-R1以协同两种思维模式。
论文提出 NormAct 基准,评估多模态大模型在第一视角具身规划中能否遵守未明示的社会规范。该任务区分显式目标达成与隐性约束合规,关注模型在看似可行但不合礼仪或不安全行动中的选择能力。
论文提出将可训练转移预测器作为校验与约束模块,与LLM语言规划迭代结合,用NodeMSE、delta accuracy等指标衡量状态误差,目标是抑制世界模型滚动中的幻觉状态扩散。
论文提出「AI模型网络」概念,类比互联网以共享协作为核心,探讨大模型时代因训练成本、部署门槛和资源分散带来的应用瓶颈,并梳理当前发展状态与未来方向,重点关注模型互联、协作与能力复用。
论文关注RLVR虽能提升大模型竞赛数学等推理表现,但可能形成难读、混杂语言等难以被弱智能体和人类利用的推理模式,提出Tandem训练思路,旨在让可验证奖励优化更兼顾协作可用性与推理质量。
论文提出训练单一自回归模型,让LLM智能体同时用语言表达计划与未来结果模拟,内化类人「假如」推理,以改善长程序列决策中只对环境反应、缺少预演能力的问题。
论文提出Tree of Evidence,用于自动事实核查。框架将声明建模为分层证据推理过程,动态检索并聚合多源证据,提升对虚假新闻、AI生成误导内容及GEO投毒污染检索与LLM推理的可解释验证能力。
论文提出RelBall,用四元数旋转与关系球表示知识图谱补全中的多样关系模式,目标覆盖对称、反对称、逆关系、组合及语义层级等结构,改进RotatE类模型在层级与复杂关系建模上的不足。
论文提出 CalBrief 试点诊断基准,评估大模型在阅读一组相关论文后,能否生成与证据强度和适用范围相匹配的科学简报,并标注范围边界与证据缺口,聚焦研究助手的可靠性。
论文研究如何将提升推断用于关系域中的因果效应计算。作者提出参数化因果因子图,将因果知识纳入提升模型,利用对象不可区分性减少计算开销,同时保持精确查询结果,面向大规模关系型概率图模型的因果分析。
京东在arXiv发布Oxygen AI Item Center V1,面向数百亿SKU的商品理解与管理,结合LLM/VLM处理新概念发现、结构化知识生产和大规模服务,支撑电商搜索、运营与商家应用。
论文关注具身智能中的3D场景图生成视角鲁棒性:同一场景在不同偏航视角下,关系预测应按几何变换一致变化。作者提出变换感知解耦,将关系按变换行为建模,以缓解现有模型预测不稳定问题。
论文提出符号反馈驱动的迭代自优化框架,用符号验证或规划反馈指导LLM修正长程决策方案,缓解不可行与错误计划问题,重点提升规划任务的鲁棒性和可靠性。
论文提出用于脑部MRI异常检测的量子自编码器:将图像块经角度编码映射为量子态,通过变分编码器—解码器和辅助垃圾量子比特学习压缩正常模式,并以输入抵抗压缩的程度生成异常分数。