来自该信源的全部动态 · 共 981 条
针对BPE分词对物理量、数字、单位及符号表达式的语义盲区问题,提出TOTEN框架,以工程实体形式本体(OEE)为基础,用声明式分类替代统计派生,实现对结构化技术实体的语义感知分词。该方法面向巴西葡萄牙语工程文本,旨在提升技术领域NLP任务中token的语义完整性。
该论文针对LLM驱动的自主智能体系统在安全、隐私与合规方面的新挑战,提出基于义务逻辑(deontic logic)的运行时治理框架。智能体可调用工具、操作数据、安装软件并跨组织协调,仅靠认证和访问控制已不足,需以企业治理全结构来约束其行为,明确规定智能体的许可与禁止操作边界。
该论文指出现有Agent基准测试增长迅速但覆盖维度有限,聚合了迄今最大规模的基于MCP的工业Agent基准协调深度研究:涵盖14项并行实验,包括多模态视觉扩展、新资产类别、替代编排策略、检索策略、推理模式和基础设施优化等。作者主张以预测效度取代静态排行榜作为评估框架,使基准分数能反映真实部署表现。
本文回顾了AI与系统工程(SE)交叉领域十年发展历程,将其划分为基础期、应用期和LLM拐点期三个阶段。文章源于2020年INCOSE INSIGHT关于AI与SE的特刊——该刊史上下载量最高的一期,由此催生的研究社区年度研讨会已吸引超250名注册参与者。作者基于核心文献梳理,阐述了对该领域未来方向的见解。
论文提出ITNet,将卷积网络、循环网络和Transformer视为同一数学对象——可学习积分变换——的特例。作者证明局部性、序列记忆和内容相关交互等归纳偏置并非本质不同的信号处理方式,而是对单一积分变换的不同截取。该框架为统一架构设计提供了理论基础。
该论文研究了将SAT/SMT等形式化求解器嵌入大语言模型推理管道时存在的「叙述鸿沟」问题。求解器本身能提供可靠且可验证的答案,但在模型与求解器的交互过程中,这种可靠性保证可能丧失。论文聚焦于混合系统中模型对求解器输出的解释与转述环节,分析了安全关键场景下形式保证断裂的风险。
该论文针对将生成式模型嵌入传统计算系统时面临的不确定性风险,提出「接地推理」基础框架。作者定义了四种AI混合架构原语,旨在对生成模型进行确定性封装,使其输出可控、可验证,从而降低AI集成的系统性风险,为工程实践提供理论基础。
该研究针对LLM偏好对齐训练中的数据标注效率问题,提出在固定标注预算下,与其为每个提示生成少量补全并标注所有对,不如生成更大的补全池,仅选择信息量最大的比较对进行标注。论文探讨了最优配对选择策略,旨在用更少的人工标注获得更好的对齐效果,为偏好数据收集提供了新范式。
论文指出推荐系统中冷启动物品比热门物品更易受隐式反馈噪声(如标题党点击、位置偏差)影响,现有去噪方法忽视了该问题。作者提出面向冷启动场景的隐式反馈去噪框架,旨在识别并缓解新物品交互信号中的噪声样本,提升冷启动推荐质量。
论文提出针对智能体式自动评审系统的评估框架,对两个开源系统(OpenAIReview、coarse)和一个商用系统(Reviewer3)及零样本基线进行基准测试,覆盖六种前沿与高效LLM,在ICLR/NeurIPS论文上检验AI评审评分与论文实际质量的一致性,为解决AI辅助研究激增带来的同行评审压力提供量化评估手段。
论文提出DeXposure-Claw,一种面向去中心化金融(DeFi)监管的Agent系统。针对通用LLM Agent在高风险金融场景中过度解读弱证据、频繁误报的问题,该系统通过结构化证据路由LLM决策,引入DeXposure-FM预测模型,为监管者提供与其目标对齐的评估框架,降低误警率并提升信用风险监控的可靠性。
该研究提出ORAgentBench基准,用于评估大语言模型智能体在真实运筹学(OR)任务中的端到端执行能力。现有OR评估通常将建模与求解分离,依赖预形式化或纯文本实例,缺乏从运营数据到验证决策的完整工作流测试。ORAgentBench在可执行环境中考察智能体处理多步骤OR任务的全流程表现,填补了该领域系统性评估的空白。
提出一种人机协作流水线,从主题覆盖、能力层次和认知深度三个维度量化本科计算机课程与外部知识体系的对齐程度。以一个经认证的BSc项目为例,纵向比较ACM/IEEE CS2013与CS2023两版课程指南的覆盖变化,为课程评估提供可复现的定量方法。
针对RLVR训练LLM推理时面临的优化不稳定问题——均匀token更新导致熵坍缩(过早收敛至次优策略)与过度香农熵最大化导致熵爆炸(盲目探索产生不连贯推理链)的矛盾,本文提出基于token级分布偏差的学习方法,旨在替代传统熵正则化策略,实现更稳定的强化学习优化过程。
论文研究了基于单边退出-加入决策的去中心化联盟形成动态过程。智能体使用Aumann-Dreze值评估局部移动,在当前联盟内计算收益而非依赖全局协商。该模型将合作博弈的收益分配与非合作最优响应行为联系起来,终止划分恰好对应联盟稳定结构,为多智能体系统中的分布式协作提供了理论基础。
埃森大学医学院部署ACIE系统,利用Agentic RAG从数百份异构患者文档中提取结构化临床信息。研究指出标准RAG在时间推理、跨文档依赖和缺失元数据场景下失效,提出基于智能体的本地化解决方案,并系统分析了哪些环节有效、哪些容易出错及其原因。
论文将测试时推理的额外计算视为部署层的资源分配问题,提出 SEVRA(Selective Verification for Reasoning Allocation)控制器,在服务层决定是否保留初始答案、重新推理或延长思考。该方法无需训练新验证器,通过判断额外推理的边际收益来避免对已正确答案的浪费计算或有害答案翻转,实现预算感知的推理分配。
该研究提出GLARE,一个基于LLM的交互式界面,允许用户通过自然语言查询黑盒图像分类器的全局解释。传统全局解释因复杂且静态难以实际使用,GLARE将其转化为可针对性提问的动态系统,使用户能按数据集、类别和决策上下文灵活探索模型行为,降低可解释性工具的使用门槛。
该论文提出一种在线对齐技术,为大语言模型增加「良知步骤」,让模型审查自身推理与输出是否偏离人类伦理,并在训练损失中引入基于直接偏好优化(DPO)的对齐分量,引导模型远离非伦理输出。方法无需离线标注偏好数据,可在广泛应用场景中实现自我纠偏。
该研究针对交互式LLM Agent场景,指出经典的偶然性/认知性不确定性框架不足以支撑智能体的主动澄清行为。论文提出一种面向欠规约感知、可分解且可通信的不确定性表示方法,旨在让Agent能识别用户意图模糊之处并主动发起澄清对话,同时兼顾黑盒API调用、交互延迟等实际部署约束。