来自该信源的全部动态 · 共 981 条
论文提出面向城市区域画像的多智能体协作推理方法,引入工具增强证据来补足传统多模态表征学习的可解释性与推理能力不足。任务覆盖人口估计、经济评估、环境监测等城市计算场景,强调异构城市数据与外部工具证据的联合利用。
论文关注交通管理中心在异常检测、事故报告、出行信息等任务中部署LLM与VLM的成本优化问题,提出在共享硬件预算下为不同功能选择模型与部署模式的组合框架,用于平衡性能、成本和资源约束。
论文提出「主动共享上下文图」,将科学团队成员的假设、实验背景、隐性知识与AI推理过程结构化连接,弥补单一模型或单用户数字科学家范式的不足,探索面向团队协作的AI科研基础设施。
论文提出Experience Memory Graph,用图结构记录智能体执行轨迹中的状态、动作、观察与失败经验,在后续任务中检索相关错误并进行一次性纠正,旨在降低提示反思带来的迭代、时间和API成本,提升长程任务恢复能力。
该论文借鉴认知心理学中的集合转换范式,提出评测LLM智能体在会话中面对工具可靠性暗中变化时的适应能力。基准构建含冗余工具的技能库,多种工具可完成同一任务但隐藏可靠性不同,并通过分支调度设置可靠工具组切换。
论文提出面向智能体AI部署的保险数学框架,将自治水平、操作权限、外部工具调用、治理成熟度等纳入风险状态,用于承保、定价和合约设计,并讨论端到端自动化保险流程。
论文提出 Safety Sentry,用于降低 LLM Agent 工具调用风险。它不再将动作简单判为安全或危险,而是结合用户上下文,在执行、询问人类、拒绝之间路由,以区分动作本身危害与情境不适配问题。
论文指出SLM从SMILES零样本预测分子性质时易忽视图拓扑信息,提出Context-Augmented Prompting:推理时调用GNN专家给出带置信度的预测提示,并提取样本级结构上下文,以增强小模型判断。
论文通过5项实验、3132名参与者检验AI建议对人类判断的影响。研究将问题设计为AI建议必然错误,发现仅能访问AI就显著降低参与者选择「不知道」的意愿,即使准确性有奖励,显示AI流畅回答可能诱发过度自信与错误采纳。
论文提出AIMO可解释性挑战赛,面向前沿数学语言模型,通过内部机制区分稳健推理与伪相关捷径。作者指出传统推理基准只看最终答案,难以揭示模型是否依赖稳定机制,为数学模型评测提供新的可解释性任务。
论文将开源项目中的机器人视为团队成员而非工具,分析2991个GitHub项目在采用机器人前后两年的交互记录,考察其参与PR、代码评审和合并后,对项目组织结构、协作规范与制度稳定性的影响,为评估AI Agent进入软件团队提供实证视角。
这篇立场论文指出,自动形式化不应只把单个自然语言命题翻译成可验证形式语言,而应面向完整理论,连同公理、定义、引理及依赖关系构建统一形式知识库,为目标定理陈述与验证提供基础。
论文指出,现代AI Agent能力很大程度取决于负责构造提示、管理状态、调用工具和编排执行的harness。作者聚焦生产级harness随模型、API与需求变化而难以定位行为实现的问题,提出Harness Handbook以提升可读、可导航和可编辑性。
论文提出用归纳逻辑编程解释强化学习智能体策略,面向可解释强化学习缺少统一评价指标的问题,将轨迹和行为抽象为紧凑、可读的逻辑规则,以提升安全关键和以人为中心场景中的透明度与可验证性。
论文提出OriginBlame,用于在AI训练数据处理流水线中传播作者身份,实现记录级与Token级数据溯源。该系统面向数据贡献者撤回请求,可定位需遗忘的具体训练样本,避免现有文件或数据集级溯源导致的大规模误删。
论文提出一种由大语言模型驱动的智能体系统,用于从生物系统数据中自动发现常微分方程。方法结合符号回归、领域先验与迭代建模,目标是从单纯拟合走向可解释机制模型生成,面向自动科学发现场景。
论文将智能体记忆定义为长程智能体的系统问题,强调企业部署需跨会话保存任务状态、用户事实与偏好,并从历史结果积累流程知识。作者提出记忆层需处理持久化选择、作用域划分、检索时机与治理约束,超越传统文档检索范式。
论文介绍R包cayleyR,用于求解排列类TopSpin谜题。方法在对称群Cayley图中从初始与目标状态进行迭代双向随机搜索,通过检测循环交集构造连接路径,并用距离引导桥接缩小搜索。
论文提出DROPJ,在环境动力学未知且缺少奖励函数的安全关键场景中,用人类偏好与理由替代传统强化学习信号,结合世界模型学习安全策略,目标是在训练和部署阶段同时降低危险行为。
论文提出将「隔离」作为LLM Agent系统安全的一等原则,梳理概念、分类、挑战与未来方向。作者认为安全不只关乎模型输入输出对齐,还涉及系统行为和现实执行结果,并用统一框架解释提示注入等失效。