来自该信源的全部动态 · 共 981 条
论文提出Long-Horizon-Terminal-Bench,包含46个长周期终端任务,用密集奖励评分记录中间进展与部分解,弥补现有基准只看最终结果、任务过短的问题,用于更细粒度评估Agent持续执行能力。
论文介绍开源系统OpenProver,用大模型驱动自动定理证明并接入Lean 4形式化验证。系统采用Planner-Worker-Verifier架构,规划器维护白板与知识库,将数学任务拆分给并行Worker执行,面向可交互、可验证的证明生成。
论文认为LLM系统可靠性不只取决于模型能力,还受推理时控制影响。CogniConsole将任务框定、上下文选择等控制外置为结构化接口,结合程序化协调与人机交互,为可验证、可调试的LLM应用提供架构抽象。
论文提出ARCANA,用多智能体协作解决ARC-AGI-2任务,在严格测试时间与硬件限制下,将推理拆为感知、假设生成、符号执行和反思优化。系统通过对象中心场景图、DSL程序候选与验证机制提升抽象推理能力。
论文面向智能工厂、仓储和服务机器人等场景,研究异构LLM驱动的具身智能体团队协作。作者提出基于数字孪生的协调机制,旨在计算力网络资源受限时减少多轮自然语言通信开销,并提升多智能体协同的可靠性。
论文提出面向虚构世界构建的多智能体LLM协作框架,通过分层上下文压缩控制长流程信息膨胀,并引入迭代评审机制平衡创意多样性与一致性,尝试自动化质量保障,适用于游戏设计和叙事内容生成研究。
论文将Vlasov方程平均场推导的研究结果在Lean 4中形式化,并把数学家指挥AI把LaTeX转为Lean的过程定义为「形式化游戏」。胜利条件包括代码可编译、无sorry、目标定理仅依赖Lean基础公理,并引入复用性作为额外检验。
论文提出GATS智能体规划框架,将基于UCB1的树搜索与分层世界模型结合,目标是在推理阶段减少或消除LLM调用,降低LATS、ReAct等方法在多步规划中的计算成本与随机性。该工作面向高效、可控的Agent规划算法研究。
论文研究线性高斯网络中潜在混杂对贝叶斯因果发现的影响,不只停留在不可识别性结论,而是刻画后验在有向无环图结构上的偏移与失效模式,帮助理解因果发现模型在隐藏变量存在时的结构性风险。
论文提出ConceptSMILE,一个模型无关的扰动式审计框架,用于评估基于概念的可解释AI输出是否可靠。它将SMILE从特征或区域归因扩展到概念层解释审计,关注概念级结论的稳健性与可信性。
论文提出Agora,用拍卖式任务分配协调不同专家模型与工具,解决现有Agent框架仅按功能粗粒度调用API、忽视性能波动与成本效率的问题。该方法旨在让功能相近的模型和工具按能力、成本等因素竞争执行子任务,从而提升LLM Agent推理质量与资源利用。
论文提出面向对抗鲁棒性的理论框架,将多层感知机分类器的鲁棒性认证转化为格遍历问题。格中每个元素对应包含输入点的轴对齐区间,用于系统性验证扰动范围内分类稳定性,为神经网络形式化安全认证提供新视角。
论文提出 ProofCouncil,一个面向开放数学问题的 LLM 智能体,采用作者—批评者架构模拟数学研究流程,并作为 FirstProof 第二批挑战提交,旨在提升大模型在复杂证明与探索任务中的表现。
论文提出面向LLM科研智能体的假设演化协议,要求显式记录假设、实验检验、证据与信念更新过程,以解决当前智能体科学推理链条埋在上下文中、难以审计和复现的问题,为自主科研系统提供可追踪框架。
论文讨论拆除前评估中的AI辅助:城市采矿审计更重视决策可辩护性,而非单纯预测精度。作者认为可解释AI与领域知识图谱可互补,帮助审计员追溯来源、理解依据并接受质疑。
论文提出KV-PRM,面向多智能体测试时扩展中的过程奖励模型瓶颈。传统PRM需反复从头编码完整轨迹,长序列评分成本高;该方法通过KV-Cache转移复用中间状态,降低长rollout评估开销,提升多智能体推理扩展效率。
论文提出描述AI系统输出的语义框架,强调输出并非事实本身,而是工程化表征。框架区分领域知识、参考来源与系统可用信息,用于精确定义外推、误引等常见失效,并评估表征正确性。
论文针对多轮工具调用生成代码的Agentic LLM系统提出共享选择性持久记忆,避免每次会话从零开始,同时不保存完整历史。方法聚焦保留配置选择、领域约束、数据模式与工具使用经验,以提升跨会话效率并减少无关上下文干扰。
论文提出LongMedBench,基于真实电子健康记录评测医疗智能体的长程临床决策能力。相比短上下文问答和工具调用测试,该基准强调跨多次就诊、检查与治疗变化整合证据,更贴近真实医疗场景。
论文指出,当前AI在推理、编程、定理证明、工具使用和长期研究任务中,通常依赖预设的概念词汇、搜索空间和成功判据。作者将这一限制概括为词汇缺口与验证器缺口,讨论其对开放式AI能力扩展的约束。