来自该信源的全部动态 · 共 981 条
针对金融多模态推理中Agent跨轮次无状态、重复发现推理策略与失败模式的问题,提出FinAcumen框架。该方法引入自演化经验记忆机制,使Agent能积累并复用跨任务的推理经验,改善工具路由、检索噪声和幻觉问题,提升在高风险金融场景下的数值计算、视觉解读与时序推理的可靠性。
该研究将经典AI安全网格世界框架改编为文本评估套件,将强化学习安全任务重新设计为面向语言智能体的测试场景。研究聚焦奖励黑客问题——AI系统利用目标规范漏洞获取高奖励却未满足真实意图,这在前沿系统中屡见但难以受控研究。新框架允许系统性地评估语言模型智能体在安全关键场景中的行为,为AI对齐研究提供可控实验平台。
该论文提出ChatPlanner框架,利用经微调的大语言模型结合检索增强生成(RAG)技术,从用户自然语言描述中提取路径规划参数,实现偏好感知的公共交通路线推荐。框架将LLM的语义理解能力与传统路径算法结合,解决了多样化用户偏好难以融入路由算法的问题。
论文提出针对多模态大模型级联推理系统的新型攻击面。级联系统通过弱模型置信度决定是否转发至强模型以节省算力,攻击者可操纵弱模型的置信度输出,强制触发对强模型的不必要调用,从而大幅增加对手计算开销。研究揭示了基于置信度路由机制的安全脆弱性,对LLM serving系统设计有警示意义。
arXiv发布CODA-BENCH基准,旨在评估代码智能体在真实开发场景中同时处理复杂代码与大规模数据(文件系统)的能力。现有基准通常将代码能力与数据处理能力分开评测,与实际开发存在明显差距。CODA-BENCH填补了这一空白,为衡量自主工程智能体在数据密集型任务中的综合表现提供统一评估框架。
提出一种基于LLM的地理空间数据检索框架,通过自然语言查询从云端目录中获取遥感数据。系统将用户意图转化为结构化API调用,集成三个Agent:Guardrail负责安全策略执行、General-QA进行意图解析、Recommender-Analyst生成模式感知的API请求。研究还包含初步对抗性评估,探讨该类系统的安全风险。
该论文提出可验证增长物理Transformer递归自改进系统(VGPT-RSI),应用于黎曼猜想相邻的两项认证任务:边界证书构造与有限Lagarias不等式的形式化验证。研究不声称证明RH,而是探索AI辅助推理系统能否产出可靠的、经形式化检验的局部进展,并显式定位剩余数学障碍。
现有电子病历基础模型将ICD诊断编码视为扁平token,忽略了编码系统内疾病家族、亚类及细粒度诊断间的层级关系。本文以ICD-10-CM层级结构作为通用归纳偏置,研究如何在EHR表示学习中显式利用该层级信息,以提升模型对临床诊断编码的理解与泛化能力。
针对时间序列预测中RAG检索仅依赖序列相似度在非平稳场景下不足的问题,提出多模态方法SERA,将语义信息融入检索过程以增强历史片段的筛选质量,从而提升预测精度。该方法结合文本语义与时间序列模式,改进了传统检索增强预测框架在分布漂移条件下的鲁棒性。
论文提出Metric Match方法,用于在有限人工标注条件下估计LLM裁判与人类评分者的相关性可靠度指标。该方法通过智能选择样本子集进行标注,以较低成本获得对LLM裁判对齐度的可靠估计,降低了评估开放式文本生成中LLM评判器所需的人工标注开销。
该研究提出Visual-Seeker框架,针对多模态大语言模型在复杂开放世界场景中事实性不足的问题,探索视觉原生搜索范式。不同于现有方法依赖语义明确的简单图像和纯文本证据,Visual-Seeker通过主动视觉推理机制,让智能体在搜索过程中充分利用视觉信息进行推理与验证,提升多模态搜索的准确性和可靠性。
该研究提出Mask-Proof流水线,旨在解决长篇数学证明中逐步推理评估缺乏可扩展、可复现方法的问题。现有评估多聚焦最终答案或依赖昂贵的专家评分,难以覆盖多来源长证明的步骤级推理质量。Mask-Proof利用LLM自动化处理数学证明数据,为构建可信赖的AI辅助证明验证提供基础设施支撑。
该论文从哲学角度探讨AI可解释性的基础问题:什么是好的解释。作者借鉴反事实解释的概念提出一套定义框架,并分析将其应用于大语言模型输出时面临的独特挑战。论文认为在为AI系统生成有效解释之前,必须先建立对「好的解释」的共识性理解,这对AI在关键场景的落地采用至关重要。
针对设备-云端协同推理场景,私有文档留存于边缘设备、公共知识存储在云端,隐私与政策约束禁止原始文档交换。CONCORD提出异步稀疏聚合方法,在文档隔离条件下实现高效的检索增强生成,兼顾隐私保护与检索质量,为端云RAG架构提供了新的技术路径。
论文提出关系结构因果模型(Relational SCM),将Pearl的结构因果模型扩展到对象及其关系可变的场景,使AI能同时进行因果推理(干预与反事实)和组合泛化(推广到未见过的对象组合)。研究形式化地分析了此类模型可学习的条件与方法,为构建具备环境因果理解能力的AI系统提供理论基础。
论文提出OSGuard基准套件,专门评估计算机使用Agent在正常用户指令下的安全性问题。该基准包含动作级别(用于本地护栏决策)和风险级别两种粒度,旨在检测Agent通过不安全捷径完成任务的隐患。研究聚焦于任务成功率之外的安全维度,填补了现有评测只关注任务完成而忽略执行路径安全性的空白。
该研究聚焦真实场景中普遍存在的不规则时间序列数据(异步观测、信息性缺失、变采样率),指出现有TSQA基准多假设规则采样,提出基于工具锚定推理的Agent方法来解决不规则时间序列问答问题,强调可验证性,为LLM和AI Agent在非理想数据条件下的能力评估提供新视角。
该论文构建了认知债务的形式化模型,将其定义为个体以AI替代而非补充第一性原理思维时累积的未验证推理义务存量。模型为每个智能体设定认知资本与认知债务两个状态变量,并引入乘法生产技术,其中认知资本作为决定AI采用回报的抵押品。研究建立了六项命题,分析了系统性脆弱性的动态演化机制。
针对Shapley值特征归因方法在复杂特征交互与因果关系场景中的不足,提出基于边干预的DAG特征归因框架。现有方法采用以节点为中心的视角,仅对单个特征分配重要性,无法同时捕捉特征的外部性与外生影响。新方法通过对图中边进行干预,更合理地解释特征间因果贡献,克服传统节点归因的局限性。
该论文提出AGO方法论,为智能体驱动的业务流程分析建立形式化框架。AGO从三个维度建模:谁在执行(Agents)、为何执行(Goals)、以及交互逻辑,旨在为自主决策和动态适应的智能体AI提供精确的实体定义与交互规范,解决当前业务流程自动化中缺乏形式化描述的问题。