来自该信源的全部动态 · 共 981 条
论文研究语言目标条件下的紧凑世界模型如何 grounding 空间关系,发现高达0.90的关系读出准确率可能来自指令转录而非感知理解;去除目标后性能崩塌。作者提出无目标动力学修正,以减少泄漏并更可靠评估空间关系表征。
论文提出 MIRA-Math,用于评估模型在数学题中识别并请求唯一缺失原子事实的能力。不同于提供完整条件的传统数学基准,也区别于混合工具调用与长对话的交互评测,该基准聚焦最小信息请求与后续推理的诊断能力。
论文提出 Reasoning Consistency Scanning,用于在事后审计 AI 安全评估中的思维链文本。相比直接验证思维链是否忠实于模型内部过程,该框架转向检测其陈述推理是否与输出、规则和上下文逻辑一致,为评估记录提供更可操作的有效性筛查方法。
论文提出 Physics-Audited Agentic SciML(PA-SciML),针对LLM智能体自动发现替代模型时仅依赖误差指标的问题,引入验证优先流程,审计边界条件、叠加性、刚度缩放、因果性等力学约束,以避免低误差但物理不可靠的模型被选中。
论文指出,工具型LLM智能体可能在调用格式正确、任务看似完成时,执行违反业务策略的状态变更,如取消预订或绕过核验处理理赔。作者提出以确定性门控校验关键状态转换,减少依赖模型自我反思,提升合规与安全性。
论文从理论上分析大模型在推理时的上下文搜索:将模型反复生成、批判、修订答案视为对推理轨迹的近似推断,基座模型提供先验,自我反思作为反馈更新后验,并研究推理阶段采样复杂度及其有效条件。
论文研究动态人机协作中隐性社会规范的作用,认为规范是交互双方共享的默契预期。随着大语言模型等AI智能体进入日常场景,学习这些规范可提升与人的协调效率、体贴性和自然度。
论文研究RL后训练是否只是放大基座模型已有技能,或能将原始技能组合成更高层策略。作者在可完全观测的重写语法环境中预训练Transformer,并用仅含二元最终反馈的Trace推理任务后训练,以审计生成链条和策略形成。
论文探索ARC-AGI-1的第三种解法:在严格预算下使用开源权重DeepSeek V3.2非思考模式,不依赖重型测试时计算或针对ARC微调,评估智能体框架对抽象推理与泛化的提升,关注成本、架构与基准适配性。
论文研究无模型强化学习智能体能否比传统模型法更有效识别并利用价格操纵机会。实验设定单资产市场,价格遵循带非线性永久冲击和线性临时冲击的Almgren-Chriss框架,对比其在噪声参数估计下的表现。
论文提出ImagingBench,用20项计算成像任务系统评估VLM与智能体AI,覆盖射线/波动光学、图像信号处理、逆问题重建、计算传感和标定等类别,关注模型能否处理成像物理与反问题,而非仅语义视觉理解。
论文提出QANTIS,将量子处理器作为经硬件校准的信念更新服务,用于部分可观测自主系统。系统接收先验和观测模型,估计罕见事件证据项,并向经典规划器返回后验;实验考察其能否在IBM Heron硬件上跨Tiger POMDP序列复用而不破坏推理。
论文关注LLM智能体工具使用中的静态、原子化问题:现有框架常让智能体反复重建低层流程,增加推理开销与失败率。作者提出迭代工具优化思路,将高频原子动作组合沉淀为类似标准作业流程的工具能力,支持智能体自我演化与复用复杂工作流。
论文研究自进化智能体中的技能淘汰机制,指出其有效性依赖无偏奖励;在需用大模型裁判的无参考任务中,评判偏差不只是噪声,而会悄然关闭淘汰坏技能的约束,导致技能库退化并低于无技能基线。
论文提出「制度化红队」评测方法:固定智能体、目标与任务状态,仅改变单一部署规则,从集体行为变化中归因规则影响。作者构建 IABench-CA,覆盖228种情境、5类规则、7种模型群体和33924场博弈,用于衡量多智能体安全中的规则因果作用。
论文提出 SkillCenter,面向自主 AI Agent 的大规模源依据技能库,包含 24 个领域包、216,938 个结构化技能;其中 114,565 个由 SkillGate 过滤管线从同行评审来源生成,目标是提升任务输出的正确性、安全性与可维护性。
论文提出Pyligent训练与推理框架,将复杂推理建模为对部分解链的验证式搜索。模型可先探索可能分支,在验证器发现延迟失败后回退到仍可完成的前缀,再继续生成,旨在提升多步推理中的纠错与恢复能力。
论文提出「Harness Effect」:企业智能体成本膨胀的关键不在模型单价,而在编排层如何组装上下文、暴露工具、安排轮次和委派任务。作者认为优秀的编排设计可抑制「token maxing」,让每次任务的Token消耗与业务价值更匹配。
论文指出,多智能体LLM安全评测常把直接提示与规划-执行流水线差异归为单一「pipeline effect」,但其中混合了意图被操作化重构、规划器拒绝或改写、执行器因委托提示默认已获批准等机制,需拆分评估以定位风险来源。
论文研究面向数据科学工作流的可复用「技能文件」:将清洗数据、写SQL、选择统计检验、格式化结果等任务指导打包,比较LLM自动生成与专家编写技能在组件消融中的作用,评估其能否减少人工维护瓶颈并提升代理执行质量。