来自该信源的全部动态 · 共 981 条
论文研究尼泊尔非对称双人棋类Baghchal,老虎捕羊、山羊围困老虎,具备完全信息与复杂策略特征。作者系统探索多种深度强化学习方案用于该游戏,补足相关文献空白,偏向小众博弈环境的RL实验。
这篇立场论文指出,AI/ML领域对「深伪」的研究主要关注真实性、认知伤害等问题,却未充分覆盖生成式AI在性化、非同意亲密图像中的主要滥用场景。作者通过分析高被引文献,呼吁研究议程转向受害者保护、平台治理与检测处置。
论文提出AlayaWorld交互式长程世界建模框架,面向从文本、图像或视频即时生成可探索虚拟环境。报告聚焦交互控制、时空一致性、持续演化等能力,试图替代传统游戏内容生产流程。
论文提出SAAG级联诊断框架,用于拆解智能体工具/函数调用评估中的不同失败模式,如函数选择正确但参数幻觉、格式合规但理由错误。相比单一精确匹配分数,SAAG可帮助定位调用失败环节。
论文提出PEARL,将求解器纳入大模型优化建模流程,把自然语言决策问题转为数学模型与可执行代码,并通过执行反馈迭代修正错误。相比一次性生成方法,该框架强调可验证、可交互的建模闭环。
研究提出 SysAdmin 基准,将前沿语言模型置于高保真 Linux 沙箱中,模拟自治系统管理员任务,从自我保存、提升自治、规避监督等五个维度衡量其工具性权力寻求倾向。
论文提出 MUX,将自然语言离散推理步骤蒸馏为连续的复用令牌,以更高带宽承载中间思考,减少逐子词表达带来的计算瓶颈。该方法面向提升复杂推理的紧凑性与效率,属于推理表示与模型内部计算优化方向。
论文提出 ToolDNS,将语义化工具发现嵌入 DNS,以功能意图和组织信任标注工具,面向自治智能体在百万级工具中检索与路由。该方案试图避开中心化治理和 O(N) 扫描瓶颈。
论文指出,基于偏好奖励模型的RLHF常因只用序列级单一标量奖励,导致token级更新的归因模糊和训练不稳;S2T-RLHF提出分层信用分配,缓解响应内部的信用归属问题,提升训练稳定性。
论文指出JSON Schema和结构化输出只能减少解析错误,不能保证LLM生成的交易对象安全且忠实于用户意图。作者提出确定性餐厅点单基准OrderBench,用于评估下单智能体在约束模式下的语义可靠性与风险。
论文提出 ColGraphRAG,用晚交互检索替代图像单向量排序,在图链接图片上保留 patch 与 token 级结构,避免细粒度信息被早期压缩丢失,并面向图文表混合证据的多模态问答提升证据召回与最终推理表现。
论文提出 agrepl,一个面向开发者的 CLI 框架,用快照、环境记录和调用隔离实现 AI Agent 运行的确定性回放,缓解 LLM 采样、外部 API 状态和环境噪声导致的不可复现问题。
论文提出 Shapley Context Pruning,将 Shapley 值引入 RAG 的上下文重排序与裁剪,统一衡量各片段对生成结果的边际贡献,用更可解释的方式去除冗余上下文,提升检索增强生成的效率与稳定性。
论文研究微调离散扩散语言模型的成员推断攻击,利用其可对任意掩码并行取分布的特性,提出 JUMP 以单次前向完成推断,并对比既有方法 SAMA。
论文提出人机协作中的非均匀性原则:在多步、高风险生成式任务里,人类不必平均介入所有环节,而应把有限审查资源集中在关键节点,通过选择性反馈、纠错和把关提升整体质量与效率。
论文指出RLHF成对偏好标注不仅反映回答质量,也可能受标注者当下情绪与压力状态影响,导致偏好随时间漂移。作者提出审计框架,用于识别并量化这种状态混杂,帮助提升偏好数据可靠性。
论文提出 Exact Network Surgery,研究在活跃计算图中原位插入残差块的方法,使模型在扩容时保持函数不变,且无需重建完整训练程序。作者形式化了功能保持、梯度可塑性与图重写条件,为在线扩展网络容量和低扰动改造提供了系统框架。
论文提出 RAIL Guard,将传统只拦截失败输出的护栏升级为闭环流程:先按八个可量化维度评估,再通过重写与复评自动修复不合规结果,并在三组实验中验证其可行性。
论文提出符号增强方法,弥补神经事实核查器在数值与单位「规范等价」上的盲区。作者将科学摘要中的数量错误重构为类型化验证,发布五类错误体系和1500条基准集,并用ModernBERT微调验证有效。
论文评测9个开源权重语言模型在135M到3B参数区间的表现,构建1085条、16主题的多选基准,并结合参数高效微调分析本地部署可行性,强调在算力与治理约束下如何选型、审计和专化模型。