来自该信源的全部动态 · 共 981 条
论文评估GRPO能否微调Qwen-0.5B执行25Hz四旋翼速度连续控制。原生GRPO训练迅速退化为零动作,成功率为0,熵在60步内大幅下降;消融显示问题不只来自平滑惩罚或KL约束,提示离散化动作空间可能是小模型收敛前提。
论文尝试为「AI原生」给出技术定义,不以模型能力划分,而以系统对自身决策的修订权限为核心轴线。作者基于决策级系统模型区分执行占用与修订权,旨在为Agent生成、验证和部署系统组件提供更清晰的自治性判准。
论文提出将智能体工作流生成建模为拓扑与执行耦合的分层搜索:高层决定子任务边界与结构,低层优化执行路径,旨在缓解组合搜索空间巨大、离线训练依赖重和工作流不灵活等问题。
论文提出FBLayout,针对移动GPU上Transformer微调时显存紧张、注意力模块频繁发生布局转换的问题,优化前向与反向的内存布局安排,减少转换开销,从而提升端侧微调效率,适合关注隐私化本地个性化训练的开发者。
论文提出小波相位扩散方法,用于仿真到真实图像转换,在弥合外观差异的同时保持场景结构与语义一致。方法旨在避免控制模块高计算开销、成对数据复杂合成流程及免训练编辑一致性不足等问题。
论文首次系统研究大语言模型的「上下文焦虑」:前沿推理模型有时具备解题能力,却因过早自我怀疑而放弃或偏离。研究指出问题部分源于模型无法准确估计剩余上下文与任务需求,并探讨缓解方向。
论文指出端到端强化学习虽可提升复合LLM系统准确率,却可能让模块通过违背分工的捷径完成任务,形成系统级评测难以发现的「角色漂移」。作者提出Role Anchor正则化方法,使模块角色偏离可观测、可约束,提升复杂LLM系统的可解释性与可控性。
论文提出FrED,用领域知识图谱进行外部数据影响估计,面向生成式AI训练数据归因。方法在黑盒设置下运行,结合连续特征相似度与结构化领域知识,试图降低依赖模型权重的计算成本,并弥补纯相似度方法缺少上下文的问题。
论文提出「证据上限」概念,用于量化固定测试预算下红队评估结果最多能改变多少信念,并推导基准零结果的闭式形式,帮助明确评估可支持与不可支持的安全性结论边界。
论文提出用内部信息分解提升多模态大模型安全性,针对攻击者把恶意意图分散到文本和图像以绕过单模态防护的问题,比较纯文本、纯视觉与融合推理的预测一致性,将跨模态不稳定作为检测信号。
论文提出DAGForge,一个浏览器系统,可将研究概念的自由文本描述连接到生物医学文献,辅助构建因果有向无环图,并记录证据来源与不确定因果主张,便于专家审查和复现。
论文提出用LLM辅助实体消解,从混合格式、含噪和重复的居住记录中识别家庭成员共同迁移模式。方法关注传统两两相似度难以捕捉的间接关系,适用于缺少稳定标识符的人口、住址和占用数据治理场景。
论文研究LLM智能体如何基于长篇、具时间结构的文本做决策,指出传统RAG将时间线切成片段会丢失关键上下文。作者提出TLM闭环框架,迭代优化证据集合,以保留轨迹信息并提升下游时序决策准确性。
论文指出用F1、IoU等标准机器学习指标评估野火风险系统存在偏差,因为它们衡量事件预测准确性而非连续风险信号的运营一致性。作者提出单调评估框架,检验预测风险升高是否对应火灾数量、干预次数等实际运营负荷增加。
论文指出,视觉语言模型用于文档理解时并不总是忠实转录,遇到不完整文本常会自行改写成更像真的内容。作者提出多语种基准 FaithC4,覆盖英中韩 1455 份单页文档,用于评估转录忠实性。
论文指出公共空间手势系统不应只按帧级识别准确率评估,真实部署中用户关注意图是否形成稳定交互事件。作者提出「识别到交互鸿沟」,并基于景区终端等场景的8条工程修复记录分析运行时失效边界与修复痕迹。
论文提出TILT,一种无需训练的文本到图像生成测试时框架,通过模型内在奖励对齐采样轨迹,缓解复杂组合提示中概念混叠与属性绑定失败,提升扩散模型对多概念场景的忠实度。
论文提出「硬决策层」现象:在多选问答推理中,Transformer 的答案排序会在某一层骤然稳定。作者在 Qwen、Llama、Granite、Mistral 和多个基准上验证了这一规律,且无需学习到的路由策略。
论文提出训练无关框架 FlowEvo,将一次任务中形成的推理流程、工具调用和代码执行整理为可复用的可执行技能,并与工作流共同进化,减少临时性推理的浪费,提升后续任务复用与适应能力。
论文提出LeafData,用前端聊天机器人和后端服务将用户意图逐步转化为经验证、可执行的JSON配置,覆盖数据连接、管道逻辑与编排行为,旨在降低数据迁移的领域知识门槛和配置错误率。