来自该信源的全部动态 · 共 1250 条
针对近期学习型容错控制(FTC)方法在航天器执行器故障场景中报告的高成功率,作者指出现有评估多依赖仿真、窄故障集和瞬态指标。论文提出以「稳定门」为核心的基准:要求姿态在0.2度精度内持续保持,针对训练中未见过的故障进行评估,为学习方法与经典控制方法提供了更严格、更真实的对比框架。
该研究提出一种基于回答集编程(ASP)的混合定量-定性方法,用于计算真实环境中受约束的分支运动轨迹模式。方法通过对环境图的约束遍历,将几何上可行的运动行为枚举为稳定模型,每个模型构成一种独立的轨迹模式,兼顾领域相关与领域无关因素。该框架具有通用性,可应用于机器人路径规划等场景。
论文聚焦AI从辅助建议向自主处方角色转变的监管与技术挑战。以美国H.R. 238法案和犹他州处方续签试点为背景,指出当前监管仅要求聚合性能指标,缺乏逐预测校准置信度、行动门控阈值及差异化沟通机制,提出临床否决权框架以平衡自主性、责任归属与不确定性管理。
针对马尔可夫决策过程(MDP)中概率参数未知的现实场景,提出基于置信序列的在线统计模型检验方法。相比传统假设精确概率已知的做法,该方法可在数据流式到达时持续更新验证结果,为网络物理系统和生物过程等不确定性建模提供有意义的统计保证。
针对约2B参数的小型GUI定位智能体,WinDOM提出两项关键方案:一是无需昂贵人工标注即可获取边界框训练数据,二是将监督微调与强化学习有效结合。该方法构建了54425条训练数据,目标明确聚焦于提升小模型性能而非简单扩大规模,适用于端侧部署、辅助工具和低成本迭代场景。
论文提出Heuresis框架,将自主AI科研流程抽象为一组通用可组合的原语,使LLM Agent在探索研究创意时能同时兼顾性能、多样性与新颖性。该框架超越单纯代码生成,支持开放式科学探索,旨在加速机器学习领域的科研进程。
研究发现基础模型智能体在多步骤说服等主观任务中存在严重的复合错误问题,多智能体辩论(MAD)在此类场景下会导致问题漂移和谄媚一致性。论文将标准RAG中的语义泄漏识别为可复现的故障触发因素,并提出基于分类策略检索的方法来诊断和缓解这些级联失败,改善长程轨迹的稳定性。
论文提出一种通用框架,支持在标准及模糊本体、知识图谱上执行模糊量化查询,目标是检索满足I型或II型模糊量化表达式的个体。该方法对量化器类型和底层评估方法完全无关,具备高度可适配性,可灵活集成不同模糊逻辑语义与推理引擎。
论文提出一种物理约束的多智能体科学发现引擎,通过进化知识图谱(Evolutionary Knowledge Graph)结构化历史科学创新,自主架构硬件兼容的计算系统。该框架旨在解决当前通用AI Agent缺乏物理接地、频繁生成与硬件不兼容设计的问题,将物理约束嵌入Agent推理循环,实现从算法抽象到硬件落地的闭环自动化设计。
论文探讨AI智能体在辅助用户完成任务时,因能访问通信、数据和API而带来的监控风险。雇主或国家可能利用智能体监视用户,而用户可能无权控制其数据访问行为。研究提出针对这种智能体监控的规避策略,揭示了AI代理广泛部署中隐私与安全的深层矛盾。
该研究关注LLM驱动的GUI自动化Agent在遇到用户敏感信息屏幕时的安全问题。当前主流Agent通常被微调为无视安全隐患地完成任务,导致实际部署困难。论文提出一种引导式探索方法,使Agent能识别含敏感信息的界面并适时将控制权交还用户,提升GUI Agent在真实场景中的可部署性与安全性。
研究发现低比特训练后量化虽不显著降低推理模型的最终准确率,却会导致模型生成更长的思维链,即便答案正确也会多产出大量token。这种「token膨胀」现象在数学推理、代码生成和科学问答等任务中普遍存在,使得量化带来的每token延迟优势被总token数增加所抵消,揭示了仅看准确率和单token延迟来评估量化效果的盲区。
针对多领域强化学习可验证奖励(RLVR)训练中课程采样比例固定或手动调优的问题,提出自动化课程方法。该方法不仅关注策略当前在哪个领域提升最快,还建模推理技能在数学、编程、科学等领域间的不均匀迁移效应,动态调整各领域采样频率,以实现通用推理能力更高效的跨域泛化。
该研究针对神经模型在关系结构推理中的泛化评估难题,提出利用大语言模型自动化生成基准测试的方法。核心问题在于难以事先判定哪些实例对模型更难,传统固定基准无法充分暴露泛化缺陷。Auto-World通过LLM自动构造难度递增的问题实例,系统评估模型将训练知识迁移到更难场景的能力,为关系推理研究提供可扩展的评估框架。
研究将四种经典视觉搜索范式(特征搜索vs.联合搜索、空间构型搜索、枚举、倾斜/垂直搜索)应用于视觉语言模型,以推理token数量类比人类反应时间,考察VLM是否表现出与人类一致的平行搜索与串行搜索行为特征,为理解VLM内部注意力机制提供认知科学视角。
研究发现当前面向情感的全模态多模态大语言模型存在多模态线索利用不足和模态幻觉两大问题。论文提出OPPO(Omni-Perception Policy Optimization)强化学习框架,显式优化多模态感知能力,改善模型在情感推理任务中对视觉、音频等多模态信号的忠实利用,减少跨模态幻觉现象。
针对多智能体离线数据集中技能提取与复用问题,现有方法依赖启发式设计的固定大小技能库,在任务顺序出现且技能空间指数增长的场景下面临分布偏移、灾难性遗忘和可塑性丧失。本文提出基于技能划分与复用的框架,通过动态管理技能库实现任务间协调技能的高效共享,提升持续学习效率。
arXiv发布一本面向实践者的Agentic AI综合参考书,覆盖从LLM底层(Transformer架构、GPU系统、SFT/LoRA/MoE训练微调)到生产部署的完整技术栈。核心论点是构建优秀的智能体系统需要理解流水线每一层而非仅专注单一环节,内容组织从第一性原理出发,系统性梳理自主AI系统的设计与工程实践。
研究针对多智能体RAG中文档评估的高计算开销问题,对7B-9B指令微调模型进行无需训练的干预实验。发现模型能力存在明显分界:弱模型受益于逐文档隔离评估机制,强模型则更适合评分机制。据此提出模型自适应评估策略,可在不牺牲检索质量的前提下大幅降低多智能体系统的推理成本。
研究提出TSJ(Theater-Stage-Judge)纵向评估框架,通过角色驱动的用户模拟进行长期交互测试,揭示大模型驱动的AI伴侣在与儿童和青少年长期互动中可能累积的认知发展风险。现有安全评估多依赖单轮或短会话测试,无法捕捉长期交互中浮现的隐患,该框架填补了这一空白。