来自该信源的全部动态 · 共 981 条
该研究针对临床决策支持中药物对特定疾病生效的条件识别问题,指出现有生物医学信息抽取方法多仅关注药物与疾病的二元关系,忽略了关系成立的上下文条件。作者提出「适用条件抽取」新任务,旨在从文本中提取使药物-疾病治疗关系成立的具体前提条件,为精准医疗和临床指南解读提供结构化支持。
针对可穿戴健康设备算力与能耗严格受限的问题,研究如何降低用于EEG脑电信号分析的深度学习模型复杂度。论文探索在IoT场景下部署神经网络的轻量化方案,使心电/脑电等生物信号的自动化处理能在资源极度有限的边缘设备上运行,属于边缘AI与模型压缩的交叉方向。
针对大模型作为Agent调用大规模工具目录时的检索瓶颈,提出ToolSense诊断框架。该框架用于审计LLM以参数化方式(将工具编码为虚拟token)记忆和检索工具的能力,覆盖记忆与检索SFT两阶段的知识质量评估,帮助研究者定位嵌入式检索语义捕获不足等问题。
论文提出AgentBuild框架,将科学Agent的构建视为工作流的一个阶段。科学家通过编写「合约」(含版本控制的评分规则、难度分级课程等)来指导Agent生成,避免微调或强化学习等方法掩盖科学家的专业判断。以Rietveld精修为应用场景,探索了确定性科学流程向LLM Agent迁移的可控路径。
该论文提出心智理论效用框架(ToM-U),在计算层面形式化了心智推理问题——即推断他人信念需追踪信息来源、顺序及可信度。ToM-U通过构建局部认识论世界模型(LEWM),明确定义了心智化「计算什么」及「为何计算」,不依赖具体算法或神经实现,为Agent的信念推理与多智能体交互提供理论基础。
论文提出WISE框架,针对Minecraft等开放世界中LLM增强的层级式具身智能体低层控制器反复执行失败的瓶颈问题,指出关键不仅在于缺乏情景记忆,更在于what-where-when记忆与which-why推理的脱耦。WISE将因果推理与记忆系统耦合,提升长时域任务的执行成功率。
该研究揭示LoRA微调中缩放因子α与学习率功能本质不同,α是有效优化的主导驱动力,其带来的增益无法通过单独调整学习率复现。论文通过理论分析与实验验证了α在优化动态中的独特作用机制,为LoRA超参数调优提供了新的理解视角。
该论文系统梳理了世界模型的两大范式:显式世界模型通过学习结构化动态实现基于推演的推理与规划,隐式世界模型则在可扩展的学习表征中编码预测结构。论文阐述了两者如何互补地支撑物理AI在预测、推理和决策方面的能力构建,为理解当前具身智能和世界模拟器的技术路线提供了统一框架。
研究面向AI辅助学习系统的程序性推理评估数据集构建方法。基于TMK(Task-Method-Knowledge)模型,比较三种问答生成策略对数据集质量的影响:严格从TMK模型生成、先转录再事后TMK锚定,以及混合策略,探索如何在问题自然性、知识锚定度和多跳推理覆盖之间取得平衡。
该论文指出现有AI Agent基准测试难以反映真实科研场景的复杂性与异质性,科学任务基准又多为静态直接问题,缺乏交互式评估支持。研究者提出一套跨尺度的科学挑战基准框架,用于系统评估AI Agent在扩展推理、多步骤科研流程中的实际能力,填补当前评估体系的空白。
该论文提出一种零资源约束下的LLM幻觉检测方法,无需访问模型内部状态或外部知识库,仅依赖文本问答对即可完成检测。核心思路是模拟人类判断幻觉时使用的多维标准进行探测,适用于黑盒场景下的事实性验证,对LLM安全部署具有实际意义。
该论文提出 Pythagoras-Prover,一个面向实际算力预算的开源 Lean 定理证明器家族。针对形式化证明数据稀缺、推理链过长导致监督微调与采样成本高昂的问题,通过增强 Lean 形式化方法提升计算效率,覆盖两种生成范式,在有限资源下实现有竞争力的定理证明性能。
Arbor 是一个多智能体框架,将结构化树搜索引入自主智能体的认知层,用于处理大规模有状态动作空间。与此前无状态评估的优化系统不同,Arbor 维护一棵显式的评分假设搜索树作为多智能体间的共享工作记忆,随每次测量动态演化,并将失败视为诊断信号加以利用。
该论文提出 DailyReport 评测基准,专门针对搜索Agent在真实日常搜索场景中的表现进行评估。现有基准多聚焦于专业化任务且依赖粗粒度评分标准,导致评测与实际用户需求脱节、可解释性不足。DailyReport 采用开放式设计,覆盖日常信息检索场景,旨在更细粒度地衡量Agent的网络探索与信息综合能力。
研究指出此前关于LLM自我报告与行为不一致的结论存在方法缺陷:依赖大五人格等宽泛特质本身在人类中预测力就弱,且会话隔离和上下文不匹配放大了偏差。论文提出更精细的心理测量框架,探讨在何种条件下低成本问卷探针能可靠预测LLM实际行为倾向,为安全部署前的行为评估提供方法论改进。
该研究提出PersonaDrive框架,通过检索增强的视觉-语言-动作(VLA)智能体为闭环驾驶仿真中的非自车交通参与者赋予多样化人类驾驶风格。不同于现有方法依赖后验标签或LLM推断奖励权重作为风格代理信号,PersonaDrive直接从观测数据中检索风格一致的驾驶示范,使仿真环境中的交通智能体行为更接近真实人类驾驶多样性。
论文提出 Evoflux 框架,针对小型语言模型在 MCP 风格工具调用中的不足(工具发现、schema 满足、依赖追踪等),通过推理时演化策略生成可执行的工具工作流。该方法让紧凑模型无需大参数量即可完成多步工具编排,降低部署成本与延迟,同时保证工作流在真实工具目录上可验证执行。
该论文提出六项基于组合模型的「遏制原则」,系统评估当前用于构建自主Agent系统的主流框架在架构层面是否提供结构性安全保障。研究发现,这些框架在工具调用、持久记忆、多步规划等环节普遍缺乏安全约束,而此类系统已部署于政务、医疗分诊、金融咨询等公共领域,存在显著风险敞口。
该研究针对临床LLM系统提出以部署为中心的评估框架,关注用户实际接受度而非静态基准的正确率。传统评估依赖密集标注数据集且以聚合指标衡量性能,存在盲区。该工作在查询级别预测用户拒绝风险,帮助识别临床场景中LLM输出可能被否决的情况,为医疗AI系统的实际部署质量控制提供新思路。
该研究提出首个针对环境地理空间分析Agent的基准测试GeoNatureAgent Benchmark,包含93个任务,评估LLM Agent通过结构化工具调用与生产级地理空间API交互的能力。覆盖前沿闭源与开源模型,填补了此前缺乏真实API调用场景验证的空白,旨在解决环境科学家过多时间花在数据整理而非分析的问题。