来自该信源的全部动态 · 共 981 条
NeSyCat Torch基于范畴语义框架NeSyCat,提供PyTorch可微张量实现,将经典、模糊、概率和神经等多种符号语义统一在以强单子和聚合结构为参数的单一归纳真值定义下。此前NeSyCat缺乏对神经网络学习谓词和函数的支持,NeSyCat Torch补齐了这一环节,使神经符号系统可端到端可微训练。
针对部分可观测环境中自主导航的多模态信念空间建模难题,提出基于生成模型的预测规划方法。传统基于神经网络的信念近似方法难以处理高维感知混淆场景下的多模态分布,该工作利用生成模型捕获信念空间的多模态特性,结合模型预测控制实现更鲁棒的导航决策。
该研究针对大模型在科学工作流(问答、文献分析、实验规划、自主发现等)中的安全问题,提出SciRisk-Bench基准。该基准不仅评估模型的科学能力,还系统考察模型能否识别和规避高风险科学场景中的危险,弥补了现有AI4Science安全数据集在风险维度覆盖上的不足。
该论文指出当前对话式AI系统多以孤立模块(情感建模、记忆检索、人设条件化)处理社会行为,缺乏解释长期人机交互中稳定社会关系与社会智能涌现的统一框架。作者提出人类-AI共演化动力学的形式化理论,试图从理论层面统一描述长期交互中社会智能的生成机制。
研究者提出R2D-RL,将RoboCup 2D足球仿真(RCSS2D)封装为兼容现代Python多智能体强化学习(MARL)工作流的环境接口。RCSS2D具备部分可观测、合作对抗交织、稀疏奖励和长时序策略等挑战,但其竞赛导向的服务器-客户端架构难以直接用于主流MARL框架。R2D-RL降低了该平台的使用门槛,便于研究者在高复杂度场景中开展多智能体算法研究。
研究将深度神经网络与可解释AI(XAI)方法结合,用于分析欧洲电力市场价格形成的驱动因素及跨区域相互依赖关系。DNN虽有强预测能力但缺乏可解释性,本文通过XAI技术揭示高维非线性系统中影响电价的关键变量与区域间交互机制,为市场参与者和政策制定者提供决策支持。
论文提出解耦搜索落地(DSG)架构,将LLM Agent的实时搜索检索策略、供应商选择、证据注入、成本延迟控制与生成行为从模型提供商的单一边界中分离,使搜索落地过程可检视、可调优、可复用、可迁移。该方法还解决了搜索引发的冗余输出问题,避免破坏严格的输出格式约束。
论文提出Xcientist研究框架,将AI科学家系统中隐含在模型推理内部的研究综合与实验验证逻辑外部化,形成可检查、合约治理的显式流程。该框架组织文献证据、想法状态、实现计划和消融记录,使AI驱动的科研工作流中从证据到结论的推理链条透明可追溯,提升自动化科研的可信度与可复现性。
研究者提出CEO-Bench基准,专门评估语言模型智能体在长时间跨度、不确定环境下的综合决策能力。该基准聚焦四项核心技能:长周期不确定性导航、噪声环境中的信息获取、适应动态变化的世界、以及协调多个子任务达成整体目标。现有Agent多擅长短周期孤立任务,CEO-Bench旨在揭示其在真实复杂场景中的不足。
针对多轮工具调用强化学习中静态数据集信息样本快速耗尽的瓶颈,论文提出RODS方法。研究发现GRPO梯度信号集中在rollout奖励方差最大的任务上(Popoviciu上界的结果),即Agent能力边界附近成功与失败大致均衡的样本贡献了最大策略梯度。RODS通过在线合成处于能力边界的训练数据,持续为策略优化提供高信息量样本,提升多轮工具使用Agent的训练效率。
研究团队推出TxBench-PP基准,专门用于评估AI智能体在小分子临床前药理学决策中的实际表现。该基准是更广泛TherapeuticsBench计划的首个切片,覆盖药物发现各阶段,提供可验证的评估框架,旨在为AI Agent在药物研发流程中的可信部署建立标准化测试基础。
该研究首次提出基础模型编排的碰撞安全设计工作流,针对行人保护场景,利用代理模型辅助探索解决碰撞仿真中高度非线性接触动力学、材料非线性及离散状态转换等难题。与空气动力学不同,碰撞事件对数据驱动代理模型构成特殊挑战,该方法将基础模型与工程仿真结合,实现更高效的安全设计空间探索。
论文提出AI智能体性能本质上是系统工程问题而非纯建模问题。模型能力通过Agent harness实现,但模型假设与harness行为之间存在「意图-执行」鸿沟——模型意图与harness实际执行不匹配,反之亦然。作者对此进行形式化定义,并通过智能体轨迹分析来诊断和弥合这一差距,为提升Agent整体表现提供系统性框架。
该论文探讨大语言模型在数学发现中的分布外泛化能力,核心问题是模型能否超越训练数据,自主假设出全新的、逻辑上更强的数学结构。研究以「零」的发现为案例,考察神经网络是否具备从已有数学对象中生成genuinely新概念的能力,对理解AI辅助数学发现的边界具有理论意义。
该论文研究分布式通用智能体网络,即异构Agent在开放对等网络中协作的架构设计。针对单一Agent受限于本地数据、工具权限、运行环境和治理边界的问题,提出了多Agent点对点协作的体系结构与核心机制,并给出原型实现,探索如何让自主Agent跨边界协同完成多步骤任务。
现有视觉语言模型在网页生成评测中多局限于短页面、单屏和静态场景。LongWebBench提出长页面生成基准,包含490个真实长网页用于结构保真度评估,以及507个目标导向交互任务用于功能性评估,填补了长视野网页生成评测的空白,为VLM在复杂网页理解与生成方面提供系统化测试框架。
该研究针对LLM Web Agent在Mind2Web、WebArena等基准中因低级原语动作导致的长序列、高延迟问题,提出将重复交互片段封装为可迁移的Web技能工具。核心贡献在于技能不再绑定特定网站域名,而是抽象为可跨域复用的交互模式,从而缩短决策视野、降低推理成本并提升泛化能力。
现有购物Agent基准将用户意图完整暴露且仅评判最终选择,无法反映真实场景中需求分散在查询、用户画像或交互追问中的情况。EComAgentBench针对这一缺口,提出包含分布式隐含意图的长程购物任务基准,能评估Agent在多轮交互中逐步发现并满足隐性需求的能力,并可定位具体遗漏的需求环节。
针对免训练verbal强化学习中LLM智能体在非平稳环境下的留存-遗忘困境,提出从经验提取到洞察治理的闭环框架。该方法让智能体从动态任务结果、市场收益等客观信号中提取语言规则并注入上下文,无需参数更新即可调整行为,同时通过治理机制淘汰过时洞察以避免负迁移。
该研究探讨大语言模型作为消费者产品发现渠道时的品牌竞争动态。以护肤品为实验品类,在GPT-4o-mini、Claude Sonnet、Gemini 3 Flash三个商用LLM上测试发现,LLM推荐存在显著的在位品牌偏见,知名品牌获得系统性推荐优势。研究还分析了认知操纵机制,为理解AI推荐对市场竞争格局的影响提供了实证依据。