来自该信源的全部动态 · 共 981 条
论文将提示组合智能体中修改一个提示模块却影响其他模块的现象形式化为组合行为泄漏。作者指出,共享上下文窗口下 Transformer 自注意力缺乏模块隔离,是跨模块干扰的结构性原因,并讨论其对智能体可靠性与提示工程的影响。
论文提出将AI系统解释为智能体的框架,结合哲学中的激进解释传统与机制可解释性方法,试图从计算事实推断系统的信念、欲望与意义,为理解模型目标、提升部署可信度和安全评估提供理论路径。
论文提出 AlgoEvolve,将大模型作为语义变异算子,用进化框架自动生成、评估并迭代算法交易程序。研究把程序发现从静态代码基准扩展到噪声强、非平稳、结果不连续的金融交易场景,探索 LLM 在复杂策略搜索中的作用。
论文讨论监督式深度学习在三段论推理中的上限,认为仅靠增加训练数据和训练时间无法达到无数据球面神经网络展示的符号级推理能力,并归纳两类方法论限制,挑战逻辑推理领域的规模定律假设。
论文指出,编码智能体生成复杂候选解已不再是主要瓶颈,可靠验证反而更难。现有验证器只是人类意图的代理,难以覆盖真实需求与边界条件,因而奖励设计、评测和自动化工程闭环需重新审视。
论文指出现有能源领域智能体评测多停留在静态知识问答,难覆盖实时数据检索、监管与市场知识、多步定量推理等真实需求。作者对工具增强LLM智能体在能源分析任务中的表现进行实证研究,为能源行业部署Agent提供评测依据。
该论文提出BrainAgent框架,利用大语言模型驱动多智能体协作,实现脑信号的自主理解与分析。针对当前脑机接口(BCI)领域技术门槛高、缺乏智能体能力的痛点,BrainAgent降低了对专业知识的依赖,使非专家用户也能完成脑信号解析任务,为BCI在临床健康和人机交互场景的落地提供了新范式。
该论文引入位置图(Position Graphs),一种基于位置空间形式化的图推理框架。该框架利用两个严格偏序关系分别表示水平和垂直方向的对齐与优先级,对离散token的相对位置进行建模。与一般定性空间演算不同,位置图受链条件和行列兼容性约束,适用于结构化文档和表格等场景的空间推理。
论文提出Agentic BKT管道,利用多智能体大语言模型架构,在严肃游戏中对玩家的金融素养进行隐性评估。系统处理2D平台跳跃游戏中的开放式事件,对齐OECD/INFE金融素养框架,通过四阶段流程从游戏行为中推断学习者能力,无需中断游戏体验即可完成评估。
研究提出一种从棋手走法历史中学习个人风格嵌入的方法,核心设计为残差公式:先用评分条件化的基础走法模型(Maia-3策略logits加Stockfish特征,在Maia-2候选上打分)捕捉典型水平下的走法分布,再用残差网络编码个人风格偏好。嵌入内积衡量风格相似性,同时与棋力(Elo)近似解耦,实现纯风格层面的棋手表征学习。
针对LLM智能体长期记忆更新中存在的信息遗漏、记忆损坏和幻觉内容写入问题,提出TRUSTMEM框架。该方法通过学习可信的记忆整合策略,确保写入、修改和删除操作的可靠性,避免错误信息在外部记忆中持久化为系统状态故障,从而提升智能体在长期交互和个性化辅助场景中的表现。
针对近期学习型容错控制(FTC)方法在航天器执行器故障场景中报告的高成功率,作者指出现有评估多依赖仿真、窄故障集和瞬态指标。论文提出以「稳定门」为核心的基准:要求姿态在0.2度精度内持续保持,针对训练中未见过的故障进行评估,为学习方法与经典控制方法提供了更严格、更真实的对比框架。
该研究提出一种基于回答集编程(ASP)的混合定量-定性方法,用于计算真实环境中受约束的分支运动轨迹模式。方法通过对环境图的约束遍历,将几何上可行的运动行为枚举为稳定模型,每个模型构成一种独立的轨迹模式,兼顾领域相关与领域无关因素。该框架具有通用性,可应用于机器人路径规划等场景。
论文聚焦AI从辅助建议向自主处方角色转变的监管与技术挑战。以美国H.R. 238法案和犹他州处方续签试点为背景,指出当前监管仅要求聚合性能指标,缺乏逐预测校准置信度、行动门控阈值及差异化沟通机制,提出临床否决权框架以平衡自主性、责任归属与不确定性管理。
针对马尔可夫决策过程(MDP)中概率参数未知的现实场景,提出基于置信序列的在线统计模型检验方法。相比传统假设精确概率已知的做法,该方法可在数据流式到达时持续更新验证结果,为网络物理系统和生物过程等不确定性建模提供有意义的统计保证。
针对约2B参数的小型GUI定位智能体,WinDOM提出两项关键方案:一是无需昂贵人工标注即可获取边界框训练数据,二是将监督微调与强化学习有效结合。该方法构建了54425条训练数据,目标明确聚焦于提升小模型性能而非简单扩大规模,适用于端侧部署、辅助工具和低成本迭代场景。
论文提出Heuresis框架,将自主AI科研流程抽象为一组通用可组合的原语,使LLM Agent在探索研究创意时能同时兼顾性能、多样性与新颖性。该框架超越单纯代码生成,支持开放式科学探索,旨在加速机器学习领域的科研进程。
研究发现基础模型智能体在多步骤说服等主观任务中存在严重的复合错误问题,多智能体辩论(MAD)在此类场景下会导致问题漂移和谄媚一致性。论文将标准RAG中的语义泄漏识别为可复现的故障触发因素,并提出基于分类策略检索的方法来诊断和缓解这些级联失败,改善长程轨迹的稳定性。
论文提出一种通用框架,支持在标准及模糊本体、知识图谱上执行模糊量化查询,目标是检索满足I型或II型模糊量化表达式的个体。该方法对量化器类型和底层评估方法完全无关,具备高度可适配性,可灵活集成不同模糊逻辑语义与推理引擎。
论文提出一种物理约束的多智能体科学发现引擎,通过进化知识图谱(Evolutionary Knowledge Graph)结构化历史科学创新,自主架构硬件兼容的计算系统。该框架旨在解决当前通用AI Agent缺乏物理接地、频繁生成与硬件不兼容设计的问题,将物理约束嵌入Agent推理循环,实现从算法抽象到硬件落地的闭环自动化设计。