来自该信源的全部动态 · 共 981 条
该研究针对世界模型规划中预测误差累积和目标定义困难的瓶颈,提出从语言预测潜在目标(Latent Goal Prediction from Language)方法。视觉目标提供精确局部梯度但远程引导差,语言灵活但受跨模态对齐噪声或大型生成模型依赖限制。该方法在潜在空间中将语言指令转化为可优化目标,适配模型规划的高采样需求,兼顾远程引导与局部精度。
论文提出PathLab,一个自主Agent框架,可将自然语言描述的病理学研究目标转化为可执行、可验证的计算病理工作流。该框架通过结构化组合领域特定技能与工具,降低计算病理对编程能力的要求,使更多病理研究者能利用基础模型进行分析,推动AI病理学的普及应用。
随着企业大规模部署生成式AI代理自动化业务流程,其非确定性行为带来治理困境。论文提出「Agent行为挖掘」治理框架,将流程挖掘方法应用于AI代理行为监控与规范,旨在平衡代理灵活性与业务流程管理所需的控制和标准化,解决「不可见的自主性风险」问题。
该论文研究人类在AI辅助下进行决策的场景,例如医生依据AI推荐的诊断测试做判断。核心问题是当不同特征(如测试结果)存在相关性时,AI应推荐哪些测试以平衡短期决策质量与长期人类学习效果。研究发现,当特征相关时,先前关于平稳策略最优的结论不再成立,需要动态推荐策略。
论文提出将主动推断中基于期望自由能(EFE)的规划问题重新形式化为变分自由能(VFE)优化框架。EFE统一了工具性目标与认知性目标,但现有方法依赖专用优化程序,难以扩展和分析。该工作证明EFE规划可被等价表示为变分推断,从而可复用成熟的变分方法工具箱,降低算法设计门槛并便于理论分析。
该研究提出一种面向乘客的可解释自动驾驶框架,将深度强化学习(DRL)用于自适应驾驶控制,同时引入大语言模型作为解释模块,向乘客实时传达智能体的决策行为。DRL智能体基于Dueling Double DQN在仿真环境中训练,LLM负责将驾驶策略转化为乘客可理解的自然语言解释,旨在提升公众对自动驾驶的信任度。
该研究指出,即使LLM在训练阶段已完成价值对齐,其推理过程仍可能无法最大化对齐后的价值函数。作者将这一差距形式化为「理性价值风险」,即模型实际推理策略与理性最优策略之间的效用差异,为理解对齐后模型的推理缺陷提供了新的数学框架。
该研究提出DrugBench基准,用于评估大语言模型在医疗问答场景中的安全性。针对LLM输出错位可能导致严重患者伤害的问题,论文引入AI控制协议作为外部安全护栏,系统性地测试其在缓解药物相关危害方面的有效性,为安全关键型医疗AI部署提供评估框架。
该研究分析了协同自适应人机系统中的可辨识性问题,证明闭环编码器估计无法唯一识别用户适应行为,其反映的是联合系统的整体属性而非单独的用户变化。作者讨论了这一发现对行为适应解释的影响,并提出了实现可辨识性的条件,对脑机接口等闭环系统的设计与评估具有理论指导意义。
该论文提出DEMM-Bench基准,基于决策证据成熟度模型(DEMM),评估智能体运行时系统产生的traces、账本、溯源图、策略日志、委托令牌等记录是否足以回答特定决策的治理问题。基准覆盖八种证据制度,为Agent系统的合规审计与治理能力提供量化评测框架。
该论文将Agent Skills定义为可发现、可激活、可被LLM解释的持久化行为知识制品,提出其在运行时的架构职责——包括技能选择、上下文绑定、权限约束、随机性解释与运行证据记录。作者将此运行时关系形式化,给出一套技能中介型LLM Agent的架构模式与参考架构,为技能复用与组合提供系统化设计指导。
论文研究多目标最短路径(MOSP)算法中的启发式设计问题。传统单值启发式(SVH)仅为每个状态关联单一可容许代价向量,无法捕捉Pareto前沿的权衡结构,搜索引导能力弱。多值启发式(MVH)将状态映射为代价估计集合,能更丰富地逼近可能的Pareto前沿。本文建立了MVH与降维技术之间的理论联系,为改进多目标搜索效率提供新视角。
该研究系统评估了两种代表性Tree-of-Thought方法(包括基于蒙特卡洛树搜索的DPTS)在不同计算预算、模型规模和问题难度下的表现。研究发现ToT搜索策略在计算资源分配上存在「非弹性」特征,即增加推理计算并不总能带来相应性能提升,为实际部署中的资源规划提供了重要参考。
研究将信息率-失真理论与程序归纳结合,提出带局部/全局库的层次适配器文法(HAG),刻画有限认知资源下人类如何从序列经验中构建可复用的抽象知识。模型揭示先验知识如何降低未来结构编码成本,为理解人类归纳偏置与认知约束的交互提供计算框架。
CombEval 提出一种动态基准框架,用于评估大语言模型的组合计数能力。该框架将每道题表示为类型化的 Cofola 规范,涵盖实体、组合对象、对象依赖与约束,可控生成自然语言计数问题并由求解器验证答案正确性。与静态题集不同,CombEval 支持对象类型、实体规模和约束的系统化变换,避免数据泄漏并实现细粒度能力诊断。
该研究在REVEAL框架基础上提出REVEAL++,引入可微分表型分组机制,将视网膜眼底图像与结构化临床风险叙述配对,通过视觉-语言对齐改进阿尔茨海默病早期风险预测。核心创新在于将表型分组从离散设计转为端到端可微分优化,使模型能自动学习最优的患者亚群划分策略,提升对神经退行性疾病细微视网膜结构模式的捕捉能力。
针对金融监管场景中图表问答的可审计性与本地部署需求,提出AgentFinVQA多智能体流水线。现有图表QA系统多依赖专有API且缺乏透明度,该方案首次在不显著牺牲准确率的前提下,同时实现答案可审计溯源与完全本地化部署,满足机构客户数据不出域的合规要求。
该研究提出BrainG3N,一种兼顾临床信息保留与高质量解码重建的双用途分词器,用于可控3D脑部MRI生成。传统潜在扩散模型的分词器面临编码器嵌入需保留临床信息与解码器需高保真重建之间的矛盾,BrainG3N通过双重设计同时满足两方面需求,可用于扩充稀缺队列数据、模拟疾病轨迹及隐私保护数据共享。
研究提出跨模型归因分歧方法,通过对比Qwen 2.5 7B与XGBoost在临床结构化数据预测任务上的特征归因差异,检测LLM的认知盲区。旨在量化LLM在表格任务中的认识论不确定性,揭示模型不知道自己不知道什么的问题,为临床决策场景下的可靠性评估提供新视角。
该论文对多智能体LLM协商机制进行建模分析,指出智能体在多轮交流修正答案时存在「隐性锚定」现象。研究借鉴人类群体决策中的从众效应与个体内在信念之间的张力,将经典意见动力学模型(DeGroot、Friedkin-Johnsen)扩展到LLM场景,揭示了协商有效性背后的机制及其局限性。