来自该信源的全部动态 · 共 981 条
该论文提出SEAGym评估环境,专门针对自进化LLM智能体的改进过程进行系统性评估。现有评估往往将智能体进化简化为孤立任务分数或单一序列曲线,无法判断更新是否产生可复用改进、是否过拟合近期任务、是否增加成本或损害旧行为。SEAGym围绕智能体harness层(提示词、记忆、工具、中间件、运行时状态及模型-工具交互循环)设计多维度评估框架。
该研究提出一种多角色智能体模拟基准,评估大语言模型在高管决策场景中的表现。不同于传统聚焦推理或知识检索的孤立认知任务评测,该基准要求LLM在信息不对称条件下整合来自不同利益相关方的冲突建议,完成战略资源再分配决策,更贴近真实企业高层决策的复杂性。
针对建筑管理系统(BMS)因厂商差异导致的点位标准化难题,提出Brick-DICL方法,利用动态上下文学习将BMS点位自动映射到Brick schema标准本体类别。该方法解决了Brick类别空间庞大、点位命名不规范、标注数据稀缺三大挑战,为建筑数据集成与能效优化提供可扩展的自动化分类方案。
提出DecoSearch,一种无需训练的Text-to-SQL框架,通过将查询路由到不同推理深度来应对复杂SQL生成问题。框架先用轻量Schema Selector剪枝数据库模式至相关表和列,再根据查询复杂度分配推理资源,并引入计划级修复机制处理多步数据感知推理中的错误,提升复杂查询的生成准确率。
研究揭示LLM代码推理存在内部生命周期:模型先在深层「酝酿」答案(多层前即可线性恢复),再分化为四种解析结局——已解析、过度处理、错误解析、未解析。该框架解释了为何模型能追踪变量却在语义等价循环上失败,为理解模型推理能力差异提供了超越准确率的机制性视角。
该研究指出大语言模型在多步演绎推理中常通过不稳定或矛盾的路径得出相同答案。现有方法主要通过输出分散度评估可靠性,忽略了模型对竞争性推理候选的排序一致性信号。论文提出结构性不确定性框架,从推理路径的排序稳定性角度量化LLM逻辑推理的内在一致性,为评估模型推理可靠性提供新维度。
现有LLM长期记忆评测通常以问题行或会话为单位独立计分,无法揭示同一事实在条件变化时的行为表现。MemTrace提出以「知识点」为基本度量单位,追踪单条类型化事实在多轮交互中的状态演变,弥补聚合准确率掩盖的细粒度缺陷,为长期记忆系统提供更具诊断性的评估视角。
研究者发布SpeechDx,一个大规模临床语音AI基准,涵盖12个数据集、27项任务,覆盖神经、运动、呼吸、发声等多系统健康状况。该基准旨在解决当前临床语音AI研究各自为战、结果难以比较、泛化能力难以评估的问题,为多任务统一评测提供标准化框架。
该论文提出SkillChain-Gym基准环境,将劳动力技能认证维护与再培训纳入生产库存控制的决策变量。现有运营基准通常将劳动力视为外生变量,而含技能学习的劳动力规划模型缺少可复用测试平台。该工作填补了这一空白,为中断场景下的技能约束生产调度研究提供标准化评估工具。
该论文提出FllumaOne数据集,面向可编辑CAD研究。数据集中每个模型由基于Flluma(Qt/C++ OpenCASCADE内核)的可执行Python程序生成,同时暴露建模操作、参数及特征依赖关系,并提供经内核验证的几何结果。数据集兼具代码、几何、构造历史三种模态,为参数化CAD生成与编辑研究提供高质量基准。
研究提出将认知科学与经济学中的数学决策模型引入大语言模型的人类行为模拟。论文指出当前LLM在安全评估和训练中模拟人类时,未能覆盖人类决策的多样性——如贝叶斯更新、动机推理等偏差。通过整合认知模型,可提升LLM在策略交互场景中对不同人类行为类型的模拟准确度。
论文提出一种在线自适应临床决策支持AI框架,整合治疗效果估计、患者数字孪生模拟及强化学习三大模块。系统先在历史医疗数据上预训练,再通过数字孪生模拟治疗轨迹,结合强化学习进行序贯决策,实现在严格安全约束下对患者动态病情的实时响应与治疗方案优化。
该论文针对高风险考试场景,提出一种基于课程标准的可配置LLM-as-Judge评分流水线。系统将模型输出系统性地锚定于官方课程文件和评分标准,而非仅依赖提示工程,旨在提升自动评估在教育领域的可靠性与合规性,为LLM在正式考试评分中的落地提供工程化方案。
该研究针对大语言模型在地图服务中的应用提出MapSatisfyBench基准,聚焦用户日常查询中未明确表达的隐含决策因素。用户在非专业场景下表述模糊,许多关键需求未被说出,而反复澄清会增加负担。该基准通过行为锚定的隐含决策因素评估地图智能体在理解和满足用户真实意图方面的能力。
研究提出机器学习共病指数MLCI,将诊断编码映射为单一风险评分,克服Charlson和Elixhauser等传统共病评分两大局限:仅以死亡率为中心且难以适配其他临床结局,以及线性规则结构无法捕捉非线性、结局特异性风险关系。MLCI可针对不同临床结局灵活建模,提升患者分层与风险调整精度。
论文提出DeepInsight框架,解决物理AI栈中评估跨度超三个数量级的难题——从单次基础模型解码到数千次物理仿真tick的全身控制。现有方案需拼接多个独立测试工具,缺乏统一运行时与评分体系。DeepInsight提供跨模态、跨奖励语义和资源配置的一体化评估基础设施,统一覆盖物理AI各层级。
研究面向生产-库存系统中人力技能约束的闭环模型预测控制方法。系统中合格工人产能取决于当前培训决策,认证会衰减且培训与生产争夺同一工时资源。论文提出在每个班次求解有限时域混合整数规划,联合优化生产排程与工人培训计划,以提升制造供应链的弹性与资源利用效率。
研究发现智能体搜索在广度扩展(并行采样)时因首轮查询高度冗余而收益递减:各线程检索到重叠证据,后续推理被相似上下文锁定。论文提出多样化查询初始化策略,在首轮即生成差异化检索请求,使并行轨迹覆盖更广信息空间,从而有效提升测试时计算的扩展效率。
针对法律案例检索中语言复杂性和精确词汇对齐难题,提出一种无需参数训练的自进化规则驱动查询重写框架。该方法增强BM25检索能力,利用Agent自主学习和迭代规则,在保持BM25作为强基线的同时提升检索精度,为法律领域稀疏检索提供了低成本高效方案。
针对大语言模型在长程逻辑推理中因自回归机制导致早期微小认知扰动沿马尔可夫决策流不可逆传播、引发级联崩溃的问题,提出动态认知熵协调的可擦除强化学习框架。该方法通过监测推理链中的认知熵变化,允许模型在检测到错误传播时进行局部擦除和重生成,从而打破自回归诅咒,提升长链推理的鲁棒性。