来自该信源的全部动态 · 共 981 条
该论文提出VeryTrace,一种零样本验证与修复框架,将自然语言推理链形式化为结构化可编译表示。框架引入领域特定语言(DSL),显式建模步骤依赖关系,使逻辑错误与幻觉可被编译器检测。针对CoT推理中早期错误静默传播导致最终结论错误的问题,VeryTrace可在无需额外训练的情况下定位并修复推理链中的逻辑缺陷。
该研究对比了多语言编码器与纯英语编码器在流式语音识别新语言适配中的表现。通过控制实验回答三个问题:多语言编码器在低数据量时的优势能持续多久、严格的流式延迟约束是否会放大该优势、以及部署量化是否影响结论。结果表明数据规模是决定性因素,而非推理延迟。
针对基于LLM的智能体AI系统暴露出超越传统LLM漏洞的新攻击面,现有安全评估多绑定特定实现或领域、难以跨异构系统统一对比。研究者提出RIFT-Bench,采用图表示驱动的动态红队方法论,支持对自主决策型智能体系统进行系统化、可比较的安全性评估,填补当前评测空白。
该研究提出「因果谨慎性」概念,即LLM在证据不足时应克制因果判断的倾向。实验发现,当模型处于决策支持等强调有用性的上下文中,其因果谨慎性会被系统性压制,倾向于给出超出证据支撑的因果结论。研究还探讨了这种压制的恢复条件,对LLM在商业与政策场景中的可靠性提出警示。
论文提出Neuro-Symbolic Drive框架,针对驾驶视觉-语言-动作(VLA)模型中思维链推理与规划动作因果脱节的问题,引入规则约束的神经符号监督机制,使推理过程每一步都锚定于交通规则语义,从而保证推理链与最终运动规划之间的因果一致性,提高自动驾驶决策的可解释性与安全性。
针对渐近统计理论形式化难题,提出基于假设规训的Lean 4形式化流水线,由一个管理者协调七个专业角色的多智能体系统完成。该领域涉及收敛性陈述、渐近展开、泛函分析及正则条件,与现有Lean 4基础设施差距大,论文通过多智能体分工协作弥合这一鸿沟,探索AI辅助数学证明形式化的新路径。
针对无法访问模型权重的黑盒LLM Agent在非平稳输入流、稀疏反馈场景下的持续适应难题,提出RIZZ框架。该方法将交互路由至近零干扰区域,避免不同任务间的灾难性遗忘与负迁移,克服了传统单一提示优化或无差别记忆方案在多用户、多任务、多模态流式环境中的不足。
该研究针对字符串约束求解器在多核架构上的并行化问题,聚焦cube-and-conquer方法中的分割启发式质量。字符串约束求解在程序分析中不可或缺,但许多实际约束不可判定且复杂度高。论文提出利用学习方法自动生成高质量分割启发式,以提升并行求解效率,改善现有求解器在复杂约束场景下的表现。
该论文针对LLM Agent技能评估中「任务成功不等于技能充分测试」的问题,提出skill coverage测试充分性指标,将技能制品本身作为被测对象。通过提取技能中可观测的结构化元素,衡量测试用例对技能各部分的覆盖程度,帮助开发者发现未被执行到的技能分支,提升Agent技能的可靠性与鲁棒性。
论文指出现代Agent系统存在「置信度洗白」现象:上游模块的不确定性在接口处被清洗为确定性中间结果传递给下游,导致局部模糊性被放大为系统级错误。作者认为这是Agent不确定性传播的接口瓶颈问题,主张不确定性需要通过潜在载体在组件间显式传递,而非依赖轨迹本身自然流动。
论文提出一种量子辅助的多智能体分布式人工智能框架,将微电网中可再生能源、储能与可调度单元的实时调度问题建模为二次无约束二值优化(QUBO),利用量子计算求解组合调度与联盟形成问题,以满足硬实时控制截止时限。该方法融合量子计算与多智能体系统,探索能源调度的新范式。
针对多智能体辩论中固定拓扑带来的位置偏差、不可靠Agent放大及角色分配敏感等问题,提出PEAR协议。该方法在推理时动态重构通信角色与稀疏拓扑,实现置换等变性,使辩论结果不受Agent排列顺序影响,提升多Agent LLM协作的鲁棒性与可靠性。
该论文指出AI Agent已作为一等成员参与软件开发生命周期,但缺乏用于表达人机责任边界、审批门控和治理约束的规范语言。现有方案将流程编码在提示词中易漂移,或仅覆盖访问控制等片段。研究提出一种协议语言,系统化定义人与Agent的协作边界,为AI辅助开发治理提供形式化基础。
针对计算机使用智能体(CUA)在动态交互环境中持续学习技能时面临的安全风险,提出SkillHarness框架。现有技能学习方法假设环境静态且安全,忽视了提示注入等对抗性交互和环境动态变化带来的威胁。该工作聚焦于如何在保持技能复用性的同时防御恶意攻击,为CUA的安全部署提供新思路。
针对LLM Agent在量化Alpha因子挖掘中面临的组合搜索空间爆炸、噪声非平稳反馈、冗余发现及过拟合等问题,提出AlphaMemo框架。该方法为Agent引入结构化搜索过程记忆,使其在自我演化中有效积累和复用探索经验,避免重复搜索与朴素复用历史成功带来的过拟合风险,提升因子生成效率与质量。
该论文以「苦涩教训」为指导,主张系统性移除人类先验、让智能通过与远超自身复杂度的「大世界」交互自然涌现。作者提出以移动端图形用户界面(GUI)作为开放环境载体,构建可自演化的移动智能体Darwin,为通用自适应Agent提供演进路线图。
论文从认知科学角度审视现代AI的成功,认为将AI视为人类学习模型可支持一种温和但真实的联想主义。核心发现是监督学习(由评价反馈驱动的学习)是当代AI系统的共同基础,从大语言模型到博弈智能体皆然,差异主要在于生成训练信号所需的工作量。该研究为理解人类认知提供了来自深度学习的新视角。
现有LLM Agent基准侧重执行成功率,忽视了自我认知能力——即判断问题是否需要调用外部工具还是依靠内部参数知识即可解决。研究者提出KAPRO(Knowing-Acting Quadrant PRObe)框架,从认知-行为四象限角度系统评估Agent的自我感知与决策一致性,填补了Agent元认知评估的空白。
研究者提出SPARC多智能体系统,针对电路图问答任务中多模态LLM数学推理能力不足的问题,将推理过程锚定在可执行的物理仿真程序上。系统由LLM智能体协作完成仿真程序的合成、执行与分析,实现83%准确率,相比基线最高提升58个百分点,显著提升了电路推理的可靠性。
研究提出一套无需人工干预的自主后训练系统,能自动完成数据选择、配方调整、训练启动、评估分析与决策的完整循环。该系统对30B参数的Nemotron模型进行四轮迭代训练,耗时数周,最终在NVIDIA Nemotron-Reasoning挑战赛的held-out评测中达到0.86分,接近人类最佳提交的0.87分,证明自主后训练可逼近人类专家水平。