来自该信源的全部动态 · 共 981 条
该研究聚焦个性化内容生成问题:用户往往无法精确描述视觉需求,导致生成器与用户意图错位。论文提出将用户交互历史转化为可执行的生成指令,核心挑战在于将行为编码为语言模型可理解的形式,并与下游图像/视频合成管线对齐。为此构建了从行为建模到指令生成的完整框架,探索交互信号驱动的个性化AIGC路径。
论文提出一种分层多智能体强化学习框架,通过约束流形控制将学习方法与控制理论结合,高层策略用RL优化协调性能,底层利用约束流形保证理论安全性。该方法突破了现有学习方法缺乏安全保证、控制方法过于保守的困境,在安全关键多智能体场景中实现性能与安全的统一。
该研究提出T2D-Bench,一个针对2型糖尿病场景的LLM输出评估框架。核心思路是构建多层临床-生活方式知识图谱,将指南约束和生活方式相关血糖声明转化为可图验证的证据要求,检测LLM生成的建议是否满足循证约束而非仅流畅表达。框架可复现,旨在弥补当前LLM临床评估缺乏结构化证据门控的短板。
该研究聚焦工业5.0背景下以人为中心AI(HCAI)对企业特质风险的影响。特质风险通过剔除系统性因素、隔离企业层面股票波动,反映投资者对企业差异化AI战略的反应。研究整合情境AI理论,分析HCAI实践如何影响企业层面的金融风险,为企业在技术变革中管理财务风险提供理论依据。
论文针对扩散生成大模型的强化学习训练效率瓶颈,提出基于扩散并行和训练器辅助生成的分布式RL系统。现有veRL等系统主要服务于自回归LLM,而DanceGRPO、FlowGRPO等算法将RL扩展至视觉/流式生成领域后缺乏高效系统支撑。该工作填补了扩散生成模型RL系统层面的空白,提升训练吞吐与资源利用率。
该论文系统介绍因果强化学习(Causal RL)的基本框架,将因果推理的反事实推断能力与强化学习的策略优化方法相结合。因果推理允许在缺乏实际数据时回答「如果现实不同会怎样」的问题,而强化学习则在环境中学习最优策略。论文梳理了两者结合的原理、工具与应用场景,为研究者提供入门参考。
现有多模态虚假信息检测基准多局限于单图、短文本或二分类场景,难以应对真实社交媒体中多语言长叙事、多图混合来源及文本-图像框架偏差的复杂帖子。本文提出 ReMMD 基准,聚焦多语言、多图像条件下的智能体证据搜索与验证流程,为评估 Agent 在现实虚假信息检测中的表现提供更贴近实际的测试环境。
本文研究理性闭包(Rational Closure)非单调形式主义在DL-Lite核心与Horn变体上的应用,分析实例检查与合取查询(CQ)应答问题,提出插件式架构,将可废止推理与CQ应答解耦为多个标准DL-Lite推理任务的组合,保持了可处理性(tractability),为轻量级描述逻辑处理不确定知识提供了实用方法。
现有地图平台如OSM仅记录路径位置,缺乏路面实际通行体验信息,对轮椅用户构成信息壁垒。OmniPath提出从被动制图转向主动环境审计的多模态智能体框架,融合网络拓扑与多模态感知数据,对路径的轮椅可达性进行系统化评估,为无障碍出行规划提供更精准的决策支持。
论文在概率测度的Wasserstein空间上建立统一几何框架,将扩散模型解释为自由能的梯度流(对应Fokker-Planck方程),将流匹配解释为该空间中的测地线(最优传输插值)。通过Otto的形式黎曼流形结构,揭示两类生成方法共享的数学本质,为理解和设计新型生成模型提供理论基础。
论文从哲学与技术双重视角审视当前LLM系统中「Agent」概念的滥用问题。作者区分了自动化与真正能动性的界限,批判性分析了「编码Agent」「AI共同科学家」等营销话语,同时回应了关于机器脱离人类控制的「存在性风险」推测,为业界提供更严谨的Agent定义框架。
该研究探讨语言模型Agent能否辅助机械可解释性中的电路解释问题。作者提出AgenticInterpBench基准,包含84个半合成Transformer电路,用于评估LM Agent对已定位电路功能的自动化解释能力。研究旨在降低电路解释的人工成本并推动标准化,为可解释性自动化提供新思路。
该论文针对LLM Agent在长任务中多轮迭代修改工作区状态的问题,提出LemonHarness框架。Agent通常只能观察工具输出和日志片段,而实际状态变化发生在文件系统中,缺乏显式工作区边界会导致文件写入和临时产物分散。LemonHarness通过显式工作区管理机制,约束和追踪Agent的状态变更操作,提升长任务执行的可控性与可复现性。
针对联邦图学习中真实数据长尾分布导致全局模型偏向多数类、少数类节点被异质邻域结构性孤立的问题,提出能量引导的双解耦方法。该方法从模型偏差和图结构两个层面同时解耦长尾效应,在保护数据隐私的前提下提升少数类节点的分类性能。
论文提出Prob-BBDM,一种基于布朗桥扩散模型(BBDM)的图像到图像翻译方法,用于MRI多模态序列合成。该方法针对临床中获取多种成像模态耗时耗资源的问题,利用布朗桥过程建模源图像与目标图像间的确定性映射关系,实现跨模态MRI图像的高质量生成,降低重复扫描需求。
针对多模态驾驶规划中评分方法受限于固定动作词表、锚点方法仅依赖单条真值轨迹的矛盾,提出FlowR2A框架,将基于仿真的奖励信号从判别式标签重构为生成式分布学习目标,实现动态动作生成与密集奖励监督的统一,为自动驾驶规划提供了新范式。
该论文研究强化学习(RL)在现实场景中训练有益行为时,能否产生广泛且持久的对齐效果。针对RL可能引入的奖励黑客、欺骗等意外失对齐问题,作者在多种高风险部署环境中验证RL对齐的泛化能力,探讨训练域外的对齐持续性,为构建可靠AI系统的对齐方法提供实证基础。
研究团队发布大规模开源对抗攻击数据集PHANTOM,专门针对视觉语言模型(VLM)。数据集覆盖10个高级类别和55个子类别的有害意图,提供预生成的对抗样本,旨在降低对抗研究的计算成本门槛,为社区提供多样化、具代表性的安全评估基准。
针对推荐系统因单一优化即时互动而导致过滤气泡和语义同质化的问题,提出多目标强化学习框架Semantic Pareto-DQN。该框架在平台留存、信息多样性和供给方公平性之间进行帕累托权衡,超越传统DQN的单目标局限,为推荐系统引入社会价值导向的多目标优化能力。
针对大模型推理蒸馏中「轨迹模仿导致记忆而非泛化」的问题,提出策略引导的策略优化方法SGPO。该方法将蒸馏目标从模仿具体解题步骤提升到学习可迁移的推理策略,使弱模型获得「如何推理」而非仅「回答什么」的能力,从而提升在新问题上的泛化表现。