来自该信源的全部动态 · 共 981 条
论文面向约束规划中的传播开销问题,提出SEER,用监督学习在搜索过程中选择是否启用计算昂贵但剪枝能力强的能量推理传播器。目标是在不同实例和搜索阶段动态权衡剪枝收益与运行时间,提升约束求解效率。
多智能体LLM常由Planner拆解任务,再交给Executor和Critic执行审计。论文提出PlanFlip,利用规划阶段的一次提示注入即可放大为级联污染,同时影响所有下游子任务,揭示该架构在规划上下文中的新攻击面。
这篇综述系统梳理了基于GNN的链接预测研究,重点覆盖不同GNN架构、图结构类型、常见建模技巧及其在推荐、知识图谱和社交网络中的应用,并总结了数据稀疏、可扩展性与评估标准等核心挑战。
论文提出通用本体归纳框架 GOI,可从文档语料中自动抽取实体、维度、属性、关系和约束,生成适合下游管线使用的结构化蓝图,缓解知识密集型 AI 中本体工程依赖人工和固定 schema 的瓶颈。
论文指出,基于可验证奖励的推理RL在困难任务上会因自采样语义冗余而陷入同一错误推理盆地。作者提出借助辅助分支进行弱到强的离策略训练,用更少样本改善覆盖与优化效率,在多项任务上可缓解这一瓶颈。
论文聚焦LLM智能体的长期记忆问题:现有平面存储难保留关系与时间上下文,且依赖LLM分类代价高、延迟大。作者讨论如何以更轻量的结构化与验证机制提升记忆准确性,并避免记忆冲突。
该论文面向长上下文推理中的KV缓存膨胀问题,提出SelKV。方法按token决定合并或丢弃,并加入注意力补偿,缓解粗粒度合并带来的表示退化和attention sag,在压缩缓存的同时尽量保持生成质量。
论文指出,长链路 AI 智能体虽更强,但与用户的交互仍然稀薄。作者提出一种始终在线的语音中介层,让智能体持续可被用户打断、追问和接管,弥补当前代理系统中缺少实时可达界面的空白。
这篇综述梳理强化学习策略验证的研究脉络,聚焦神经网络策略在安全关键场景中的行为保证难题,统一总结了现有验证方法、适用假设、评估指标与未解问题,可作为后续研究和落地部署的入门地图。
文章重读 Edmund C. Berkeley 与 Heiserman 的机器思想,认为其核心不只是把符号逻辑引入计算,而是把逻辑当作机器设计语言,用于获取信息、保留状态、适应环境并组织长期行为。作者将其视为具身智能仍未穷尽的架构线索。
这篇论文提出面向扩散式大语言模型的训练免费加速框架 LaCache,利用精确缓存与精度自适应推理,避免在去噪过程中重复计算序列中不变的前缀和被掩码后缀,从而降低算子级冗余并提升推理效率。
论文提出通用控制器 Generalist Controller,通过带掩码的注意力式动态状态空间表示,单个神经网络即可一次训练后适配不同阶次和动力学系统,目标是提升跨系统控制泛化能力。
论文提出 FST.ai 2.5,用于奥运与残奥跆拳道的裁判决策支持、运动员数字孪生和协会级分析,并强调可解释性与不确定性建模,试图把分散的训练监测、竞赛管理与裁判辅助整合起来。
论文指出,现有语言模型评测多聚焦于已明确任务,但真实用户需求常常含糊、探索性甚至自相矛盾。作者提出任务对齐问题,并给出将其建模为POMDP的通用框架,用于先澄清意图再执行任务。
提出一种将图像、视频和文本统一表示为原子命题袋的多模态语言表示法,并用全局语义码本映射到共享词汇,使不同模态进入同一可解释空间,覆盖细粒度事实到高层概念,便于对齐与推理。
论文研究智能体如何学会在快速反应控制与慢速推理规划之间切换,将前者视为直接映射状态到动作的策略,并探索用强化学习或模仿学习训练这种元推理能力,以提升复杂任务中的泛化与决策效率。
论文提出跨领域框架,将风险信念与决策分离,测试6个代表性LLM和100名人类参与者。结果显示,部分模型在不确定条件下呈现稳定且可重复的风险偏好,为评估模型行为与对齐提供新指标。
论文提出 PPO-HSC,一种基于高阶采样覆盖的探索式强化学习框架,用于缓解 LLM 微调中的模式坍塌。方法在强化高奖励轨迹之外,扩大策略覆盖并保留探索性,提升对未知解的搜索能力。
论文提出一套基于 MATLAB 的开源框架,用于在可变形、带多通道触觉传感的软绒陪伴机器人上训练和验证轻量级 1D CNN,以识别人类抚触中的情感信号,兼顾部署效率与分类鲁棒性。
论文指出,负责任AI实践虽已形成风险识别与缓解方法,但市场缺乏奖励可信性的机制。作者主张引入独立认证,使企业能向消费者、监管者和股东证明其系统在安全、公平、监督等方面超越最低合规要求。