来自该信源的全部动态 · 共 981 条
论文关注网络物理物联网系统中的可解释性,提出一种物理启发的结构归因思路,从图结构与梯度信号刻画变量间因果影响,强调回答干预问题而非仅做相关性标注,以提升复杂系统诊断与决策解释的稳健性。
论文报告一项预注册两阶段实验,使用Claude Opus 4.8构建小型市场经济体,检验多智能体耦合下财富增长的信息容量边界,以及激励、控制杠杆对群体错位的均场残差缩放规律,为Agent经济仿真和对齐评估提供量化框架。
论文提出 AgoraSim,用于面向场景的社会反应分析。框架可将文本或多模态材料解析为可编辑的 ABM 配置,并运行按比例控制的人群,混合 LLM、视觉语言模型与规则智能体,以提升社会模拟的可解释性和可比较性。
论文提出面向长篇小说创作的叙事世界模型,强调用叙事学结构组织作家记忆,以回答秘密知情时间、事件与叙述顺序、伏笔回收、关系变化等多跳问题,弥补通用检索和智能体记忆难以定位故事状态证据的不足。
论文研究大语言模型能否为投射技术生成合成消费者数据,以替代成本高、难扩展的真实调研。作者跨多个投射任务、模型与提示设置测试生成回答,评估其在消费者联想、情绪、需求挖掘中的可用性与局限。
论文提出 Onnes,用物理前向模型叠加真实稀释制冷机噪声指纹,构建量子计算低温基础设施数字孪生,并接入多智能体 LLM 运维层,用于从阈值告警走向可解释故障诊断。
论文提出 SearchEyes,面向多模态搜索智能体的多跳推理训练。作者指出现有流程将数据构造、搜索环境与奖励信号割裂,导致结构元数据浪费、外部搜索不可复现、强化学习奖励稀疏。SearchEyes 试图通过搜索世界模拟统一训练闭环,提升可控性与可复现性。
ArtisanCAD提出面向工业级零部件建模的CAD智能体,通过专家知识蒸馏增强长流程程序建模、特征依赖、可编辑参数化几何与B-Rep执行能力,针对模糊或高层设计意图提升文本到CAD生成的可靠性。
论文研究工具增强大模型为何会不必要地调用外部工具,提出从模型内部提取与工具使用决策相关的稳定表征,并通过标题特定的激活引导向量进行干预,以更精细控制不同上下文下的工具调用行为。
论文提出CSTutorBench,用于评测小语言模型在K-12积木式编程教学中的导师能力,回应大模型在隐私、成本和专有依赖上的部署顾虑,并帮助教育场景选择更合适的本地或轻量模型。
论文提出 NapMem,将长期用户记忆从被动检索上下文改为结构化动作空间。系统把用户历史组织为多粒度链接记忆金字塔,使对话智能体学习主动浏览、选择和利用记忆,以提升个性化交互能力。
论文提出将好奇心视为生态系统的玩具框架:单个智能体的提问策略取决于即时不确定性降低、成本、延迟收益及保持问题开放的价值;这些权重会随经验变化。框架也可扩展到多智能体人机互动,用于分析探索行为与知识生成。
该论文综合2023至2026年27篇基准、分类与审计研究,覆盖19个智能体评测,归纳LLM智能体在工具使用、多步规划、多智能体协作和长程任务中的共性失效模式,指出排行榜提升可能掩盖稳定性与可靠性问题。
论文研究动态在线多车辆路径规划问题,结合VRP与定向越野问题,车辆需在固定时间内随新任务到达持续重规划并最大化累计奖励。作者提出奖励密度启发式,重点评估其性能与计算效率,适合关注物流调度与在线优化的研究者参考。
论文提出PolyWorkBench,用于评测多语言长程LLM智能体在规划、工具调用与外部环境交互中的表现。其关注真实应用中输入、推理、调用和输出跨语言混合的场景,弥补现有单语基准不足。
论文研究将记忆读写从每轮一次的外部查询移入语言智能体的观察、推理、行动循环,使每一步都可检索和更新记忆。核心问题是网络化存储带来的高延迟,作者聚焦进程内检索以降低循环内记忆成本,探索更接近工作记忆的智能体架构。
论文提出AgenticAI-Supervisor,一个由API和UI驱动的RL Gym环境,用于替代静态评测,支持LLM智能体多步决策训练。框架将环境创建与规模化执行解耦,基于可验证执行结果生成高保真轨迹,并进行多维奖励塑形,以缓解奖励黑客等问题。
论文提出Akashic,一种面向LLM智能体长程交互的低开销记忆系统。其核心MemAttention避免每次请求重放完整历史,缓解长上下文带来的预填充成本、上下文窗口限制与相关证据被噪声淹没问题,目标是在提升服务效率的同时改善输出质量。
论文提出一种面向人机协同决策的反思式架构,旨在缓解用户对大模型建议的过度或不足依赖。该框架强调将人类期望、偏好与风险感知纳入决策循环,通过更透明的反馈与校准机制提升安全关键场景中的协作质量。
论文关注算法追索在高风险机器学习决策中的个性化建议问题,指出近邻反事实和预设用户因果结构会忽略个体情境与特征交互,提出人在环思路以更好建模用户因果关系并生成干预方案。