来自该信源的全部动态 · 共 321 条
针对多轮智能体训练中早期错误逐步累积的问题,提出SAGE-OPD方法。该方法在在策略蒸馏(OPD)框架下,通过选择性地在关键转折点引入教师模型干预,避免学生模型因错误传播导致轨迹偏离。相比传统单轮蒸馏和密集token级监督,SAGE-OPD更适合多轮交互场景,可有效缓解曝光偏差并提升Agent训练效率。
针对多智能体LLM系统中重试策略无法区分「有依据但不完整」与「完全无依据应停止」两类失败的问题,提出Argent信令协议。该协议为智能体间通信引入结构化信号机制,使人类监督者能判断重试是否合理,或系统是否应中止,从而缓解语义漂移并提升多智能体系统的可信度。
DeepSeek发布V4系列预览版,包含两款MoE模型:DeepSeek-V4-Pro(1.6T参数,49B激活)和DeepSeek-V4-Flash(284B参数,13B激活),均支持100万token上下文。架构升级包括混合注意力机制(结合压缩稀疏注意力)等关键优化,旨在实现高效长上下文智能。
该研究探索使用Google Gemini和Gemma等大语言模型集成方法,替代系统文献综述中耗时且不一致的人工筛选流程。针对报告健康相关生活质量(EQ-5D)数据的研究进行分类,评估LLM在需要临床解读能力的文献筛选任务上的表现,为自动化系统综述提供新思路。
该研究针对大语言模型在不同语言中数学推理表现差异显著这一现象,提出跨语言机制分析方法,定位并比较支持数学推理的模型参数,探究这些差异源自语言特定参数还是共享机制在不同语言中的不同表现,为理解LLM内部多语言数学能力的组织方式提供新视角。
研究指出现有神经元级别记忆缓解方法仅通过置零激活值来干预,但激活值只控制神经元是否参与计算,真正写入残差流的是输出向量,且通过叠加编码多种特征。论文提出输出向量编辑方法,采用约束优化框架,在输出向量层面精确干预记忆化序列的再现,可更好地平衡隐私安全风险与模型能力保留。
研究指出密集检索将长文档压缩为单向量时,关键短片段的信号会被稀释,导致召回失败。论文提出「证据稀释指数」(EDI)量化文档级表示与最强块级证据之间的差距,并引入块证据聚合方法改善长文档检索效果,为RAG及长文档场景下的检索质量提升提供新思路。
针对长文档RAG中检索粒度与上下文连贯性的平衡难题,提出SproutRAG方法。该方法结合注意力引导的树搜索与渐进式嵌入,避免了现有方案依赖昂贵LLM调用、单层级上下文聚合或摘要信息损失等缺陷,在多粒度上下文聚合方面实现改进,适用于长文档场景下的高效检索增强生成。
该研究提出RegMix-D方法,将静态数据混合选择扩展为动态方案。核心思路是利用小规模代理训练产生的完整损失轨迹(而非仅终点损失)来训练回归模型,从而在LLM预训练过程中动态调整各数据源的混合比例,进一步优化预训练效果。方法简单有效,是RegMix框架的自然延伸。
该论文提出对Decoder-only Transformer的KV缓存采用双维度表示策略。核心假设是局部Token(紧邻预测目标)对下一词预测的影响远大于远距离Token,因此二者对表示容量的需求不对称。方法为局部Token分配更高维度的Key/Value表示,远距离Token则使用较低维度,从而在不增加总体计算量的前提下提升注意力机制的表达效率。
论文提出一种完全本地化的AI级联方法,用于教育对话中的个人身份信息(PII)去标识化。该方法解决了教育对话转录中PII与课程内容纠缠的难题(如「Riemann」可能是学生姓名也可能是数学概念),无需将学生数据发送至商业LLM,在保障数据治理合规的同时维持高识别准确率,兼顾了隐私保护与研究可用性。
针对大语言模型在语用推理中倾向字面解读的短板,研究者提出PragReST自监督框架。该方法通过构造语用QA数据并生成反事实推理样本,实现模型自我强化训练,无需人工标注即可提升LLM对隐含意义的推断能力,弥补其在数学和逻辑推理之外的语用短板。
该论文研究大语言模型对齐过程中出现的「失准对齐」问题——模型在避免不安全推理时,可能过度或错误地应用安全约束,导致输出偏差。研究提出量化与定位这类失准行为的方法,旨在推动更有原则性的高级对齐技术发展,而非否定对齐本身的必要性。
论文提出一个面向企业场景的多智能体系统统一框架,旨在解决基于大语言模型的多智能体在生产部署中遇到的领域定制需求、高延迟与推理成本等核心挑战。框架涵盖定制化流程与高效部署策略,试图为复杂推理和任务执行场景提供可落地的工程方案。
论文提出BCL框架,首次将粒子滤波与贝叶斯更新引入大模型上下文学习(ICL)的系统优化,用于信息抽取任务。该方法旨在解决现有ICL方案在不同模型规模下性能不一致、缺乏系统性优化与泛化能力的问题,为IE任务的示例选择与提示构建提供概率推断视角的通用优化路径。
针对计算机使用Agent(CUA)在长时程任务和未见软件上表现不佳的问题,提出VISUALSKILL方法:一种层级化多模态技能表示,为每个目标应用定制,以中心索引组织各主题文件。与纯文本技能库不同,该方案将GUI交互的视觉信息纳入技能表征,提升Agent在复杂桌面操作场景中的泛化与复用能力。
该研究评估了42个商用及开源LLM在阅读理解评估中估计题目区分度的能力。题目区分度是教育测评的核心心理测量指标,用于衡量试题能否有效区分不同水平的学生。研究发现,尽管已有工作探索了LLM估计题目难度的能力,但在捕捉区分度方面LLM表现不佳,揭示了其在教育评估自动化中的局限性。
针对土耳其语黏着语特性,提出 Morpheus——一种基于神经网络的形态素边界模型,可作为无损、形态感知的分词器。现有子词分词器(如 WordPiece)依赖语料统计切分,常破坏携带语义的后缀且无法无损还原原文。Morpheus 在分词粒度上对齐语言学形态素边界,兼顾分词准确性与可逆性,为土耳其语等黏着语的语言模型预处理提供新方案。
论文针对智能家居场景中用户对话随共享上下文积累而逐渐省略的现象,提出PEC-Home基准与方法。现有家居助手难以准确理解省略式表达,论文系统定义了渐进式省略命令问题,并借助大语言模型探索上下文补全与指令消歧策略,以提升多轮对话下智能家居指令的准确执行。
研究提出PhysAssistBench基准,首次将临床知识、EHR系统交互和患者沟通三项能力整合到同一评测场景中,模拟医生发出模糊指令、患者描述含混症状、EHR系统要求精确工具调用的真实诊疗环境,检验LLM作为医生助手而非替代者的实际协调能力,填补了当前医学LLM评估只测孤立能力的空白。