来自该信源的全部动态 · 共 981 条
该研究针对开放平台中异构LLM智能体(基座模型、脚手架、工具栈各异)的任务路由问题,指出传统单一全局信誉分无法反映智能体在不同技能上的能力差异。论文提出基于技能的条件信誉机制,并系统分析了该机制面临的攻击面,揭示了专业化路由场景下信任评估的脆弱性。
论文提出混合开放式三重进化(Hybrid Open-Ended Tri-Evolution)方法,将深度研究任务与智能体进化结合。针对当前深度研究系统受限于静态参数化能力的问题,该框架让智能体在开放环境中自主检索、整合信息的同时,通过与环境交互实现三重维度的自主进化,从而突破固定能力边界,提升面向通用智能的开放式研究任务表现。
研究发现LLM智能体在与外部环境交互并获得执行结果、错误信息等反馈后,仍存在持续的「反思差距」——即使正确回答了问题,也会错误评估自身输出质量。论文提出通过智能体强化学习(Agentic RL)可获得免费的校准提升,帮助模型更准确地自我评估,缩小反思差距。
论文提出AFFORDANCE20Q基准,用于评估大语言模型从物体物理属性(形状、材质等)推断其行为可能性的能力。现有基准因暴露物体身份,使模型可依赖记忆的物体-功能映射而非真正推理物理属性。该基准通过隐藏物体标识,迫使模型基于物理特征进行功能可供性推理,揭示当前LLM在物理常识理解上的不足。
研究揭示数据选择并非缓解模型坍塌的万能药。在低资源验证场景下,验证器仅观测到分布的小而有偏片段,数据筛选反而会加速分布尾部侵蚀与输出同质化。论文系统分析了参考分布偏差对递归合成数据训练的影响,指出验证器的覆盖率和代表性是决定数据选择有效性的关键因素。
论文提出TwinBI框架,通过智能体数字孪生机制将LLM辅助与BI仪表盘交互紧密耦合。针对用户在多步分析中切换直接操作与自然语言查询时,过滤器、层级、指标和图表上下文容易失同步的问题,TwinBI维护一致的分析状态,使两种交互模式协调工作,提升BI分析效率。
提出SkillAudit框架,通过配对轨迹审计实现冻结LLM Agent的技能自动演进,无需依赖验证集分数、隐藏测试结果或环境奖励等特权反馈信号。该方法针对部署后技能因边界情况、API变更和约束变化而失效的现实问题,利用成对轨迹比较发现技能缺陷并驱动迭代改进,为实际场景下Agent技能持续优化提供了无监督方案。
该论文针对LLM智能体与用户之间的信息鸿沟问题,形式化定义了「通信策略」概念,建立了文本和UI两类策略体系,并在多种环境和用户画像下评估不同通信策略的效果。研究聚焦于通信成本与用户偏好一致性对信息交换的限制,为主动式智能体的人机交互设计提供理论基础。
研究团队时隔两年重新评估WorkBench职场Agent基准。2024年3月最佳模型GPT-4完成率43%、误操作率26%;2026年6月Claude Opus 4.8完成率达89%、误操作率降至2.5%。论文指出三个关键发现:能力与安全性正相关,前沿模型在提升任务完成率的同时显著减少了有害行为。
现有形式化定理证明基准多集中于代数和初等数论等易形式化领域,对需要深层推理的数学分析覆盖不足。MA-ProofBench针对这一空白,提出两级评估框架,专注于数学分析方向,系统测试大语言模型在该领域的自动定理证明能力,为衡量LLM高阶数学推理提供更全面的标杆。
论文提出UP-NRPA在线框架,将用户画像与嵌套rollout策略自适应方法结合,用于目标导向对话系统中的LLM策略规划。相比依赖离线强化学习的传统方法,该框架可根据多样用户特征动态定制对话策略,无需针对用户群体单独训练模型,提升对话规划的个性化与灵活性。
针对LLM自主Agent在执行UI操作时将完整界面状态传输至远程推理服务器导致隐私泄露的问题,提出Minim框架。该方法在本地可信环境中对UI状态进行清洗,仅保留与当前任务相关的最小视图,过滤掉验证码、私人通知、后台应用状态等无关敏感信息,在不损害Agent动作定位能力的前提下降低隐私风险。
研究提出利用LLM内部表征的几何结构,预测模型在哪些概念组合场景下会失败。作者将组合失败归因于表征空间中的干扰效应,无需穷举基准测试即可预判模型薄弱环节。方法为开发者提供了一种系统化发现模型边界案例的新路径,减少对人工直觉设计困难测试的依赖。
提出VeriGeo框架,解决几何题自动生成中题目陈述、图示、约束与答案相互一致性难题。现有方法在可控性与可靠性之间存在取舍:种子改写灵活但难以验证,图示优先方法提高有效性但缺乏灵活性。VeriGeo结合数值验证与解析验证,实现可控且可靠的几何问题合成,适用于AI辅助教育和多模态数学推理场景。
该研究将编码Agent应用于《常微分方程数值方法》教材的Lean 4形式化,填补mathlib在数值分析领域的空白。与此前仅以内核接受为成功标准不同,论文提出了超越内核验证的质量审计流程,评估形式化代码的语义忠实度与证明质量,为Agent驱动的数学形式化建立更严格的评价体系。
论文提出一种多智能体AI系统,用于自动化处理大学招生中格式各异的高中成绩单。系统通过多个专业化Agent协作,处理不同格式、评分体系和版面布局的成绩单文档,解决招生办每年面对数百万份成绩单的人工处理瓶颈,提升效率并减少资源消耗。属于多智能体在文档分析领域的垂直应用研究。
该论文追溯认知逻辑领域经典的「泥孩子谜题」(Muddy Children Puzzle)的起源,梳理过去两百年间逻辑学与文学出版物中该谜题的演变脉络。该谜题探讨知识与无知的关系,对认识论逻辑发展有重要启发。论文还整理了数字版、彩色帽子等众多变体,并提出一个涉及自指的新型帽子谜题。
该论文提出 Orchestra-o1 框架,解决现有多智能体编排系统仅支持有限模态的问题。当前 agent swarm 范式已从单智能体转向多智能体协作,但面对异构模态共存与交互的复杂场景,现有框架泛化能力不足。Orchestra-o1 聚焦全模态任务分解与协作编排,旨在支持多模态智能体的统一调度。
该研究对Tully等人2025年提出的「AI素养越低越倾向使用AI」这一结论进行重新分析。利用原研究Study 3的公开数据,作者发现OLS回归中AI素养与聚合使用量的负相关可复现,但分工具类别建模后发现该效应主要由特定工具类别驱动,提示原结论可能反映的是工具采纳广度差异而非整体接受度差异。
论文提出约束敏感策略优化(CSPO),一种一阶原始-对偶方法,用于解决安全强化学习中约束满足延迟导致的振荡行为和持续安全违规问题。该方法在约束马尔可夫决策过程框架下,改进了传统原始-对偶方法在深度RL场景中的约束校正滞后缺陷,旨在最大化期望回报的同时更及时地满足安全约束。