来自该信源的全部动态 · 共 321 条
论文指出大型音频语言模型(LALMs)在训练中隐藏状态逐渐偏向文本生成,导致语音细节、韵律等声学信息丢失。研究提出「连续音频思维」方法,使模型在推理过程中持续保留和利用丰富的声学内容,而非仅依赖文本对齐表征,从而提升语音转录、音乐分析等多种音频理解任务的表现。
现有法律基准仅评估孤立子任务,忽略诉讼各阶段间的因果依赖。LegalWorld构建了一个以中国民事诉讼为场景的全生命周期交互环境,将起诉、举证、庭审等阶段因果连接,使Agent在前期起草的文书会实质影响后续庭审走向,从而更真实地评估法律Agent的跨阶段推理与决策能力。
该论文针对RAG系统中文档分块粒度与检索精度的矛盾,提出MCompassRAG方法:为每个段落级分块附加主题元数据作为语义指南针,在不扩大搜索空间的前提下提升细粒度检索的精确度。该方法缓解了大块语义噪声多、小块候选集膨胀的两难问题,为深度检索场景提供了新的分块与索引策略。
该研究从数据中心视角审视大语言模型机器遗忘问题,提出PreUnlearn框架,在执行遗忘操作前预先评估遗忘集对相关及远端知识的传播影响。由于模型内部知识高度纠缠,目标遗忘往往导致非目标知识附带损伤,该方法可量化这种损伤范围,帮助研究者在遗忘前做出更审慎的决策。
针对个性化对话智能体在消费级硬件(如8GB显存设备)上部署长期记忆的瓶颈,提出CoreMem框架。该方法用黎曼流形检索替代传统余弦相似度,并引入Fisher信息引导的上下文蒸馏机制,为记忆检索与压缩提供统一理论基础,旨在低资源环境下实现跨会话连贯交互。
研究提出针对临床文本中诊断不确定性保留的评估基准。LLM在摘要、改写等任务中可能将「可能肺炎」等表达不确定性的措辞改为确定性描述,从而误导后续诊疗决策。该工作系统探测LLM在处理临床文本时是否正确保留证据强度信息,填补了当前评估体系在语义忠实度方面的空白。
该论文针对大模型对齐中忽视文化多样性的问题,提出可调控文化偏好的奖励模型优化方法。现有对齐研究多基于特定地区标注者的统一偏好,难以服务全球不同文化社群。该工作旨在构建具有全球视野的对齐模型,使其能够准确表征不同文化子群体的偏好,实现对奖励模型文化倾向的灵活调控。
蒙特利尔强制对齐器(MFA)自2016年发布以来已成为研究和工业界最广泛使用的强制对齐工具。论文记录了MFA 3.0的开发进展,包括扩展多语言和方言覆盖、使用更大规模开源数据集、统一IPA词典、模型自适应、跨语言音素映射及支持工具等重大改进,并总结了语音-文本对齐领域十年来的技术演进。
现有PII(个人身份信息)脱敏基准将信息提取机制与隐私语义混为一谈,忽略了上下文对隐私判定的决定性影响。RedactionBench提出新评测框架,强调信息是否构成隐私侵犯取决于持有者、目的和场景,为大模型在敏感领域的PII编辑能力提供更贴近真实隐私需求的评估标准。
研究提出用激活引导(activation steering)替代传统少样本提示来生成低资源语言合成数据。传统方法依赖目标语言示例做few-shot推理,成本高且因词汇锚定降低多样性。激活引导通过在模型内部表征层面施加方向性偏移,无需额外示例即可引导生成目标语言文本,有望降低推理成本并提升数据多样性。
研究者基于台湾法律体系的公开官方语料构建了TW-LegalBench基准,用于评估大语言模型在台湾法律推理任务上的表现。该工作填补了现有法律基准偏重英美法系英文语料及大陆法系简体中文语料的空白,为繁体中文司法管辖区的LLM法律能力评测提供了标准化工具。
论文提出 JetFlow 方法,针对推测解码在增大草稿预算时接受率下降、加速收益触顶的问题,通过并行树草稿策略绕过自回归草稿器面临的因果性-效率两难困境。该方法允许多条候选路径并行生成并验证,有效突破先前基于头部方法的扩展上限,为大模型推理加速提供新思路。
该论文针对中文方言间的语言辨识任务,探索语音驱动特征替代传统文本特征的有效性。研究系统评估了MFCC语音特征在CNN模型上的方言区分能力,并设计了端到端辨识框架,旨在解决相似语言和方言间文本方法效果不佳的问题。
该研究提出LLM-as-Environment-Engineer框架,让当前策略模型自行分析失败轨迹及上下文信息,自动提出训练环境配置的修改方案,取代人工在各训练阶段间启发式调整环境的做法。框架引入多智能体推理机制,使LLM从被训练者转变为训练环境设计者,有望降低强化学习流程对人工干预的依赖。
研究探索双语微调对低资源语言自动语音识别的影响,覆盖九组语言对,涉及多种语系和书写系统。训练时在输入文本前添加语言识别标记以区分两种语言,推理时模型联合预测语言类别与转写结果。实验评估了该方法在跨语言迁移中的有效性与泛化能力。
该研究提出MemSlides框架,为个性化演示文稿生成Agent引入分层记忆机制,将长期记忆与工作记忆分离,使Agent能在多轮修改中保持用户偏好的稳定性,同时支持新增约束的动态融入与可靠的局部编辑。框架旨在解决现有方法仅依赖当前提示或模板、无法跨任务保留个性化设置的问题。
该论文针对语言间意义无法直接保留的「不可译性」问题,提出了一套结构化本体分类体系及补偿策略分类法。不可译性在语言学中已有深入研究,但在NLP领域仍被忽视。随着机器翻译系统在标准基准上持续进步,其局限性日益集中于无法归结为一对一等价的翻译场景。该框架为系统化评估和改进MT系统处理此类难题提供了可操作的理论基础。
研究探讨生产环境LLM助手在工具目录扩展时路由准确率的退化问题。基于一个包含110个Agent、584个工具的企业生产力助手,评估三个前沿模型在10到110个Agent规模下的单步路由表现。结果显示,面对描述不充分的请求,路由F1分数下降16-23个百分点。论文通过oracle分析分解退化原因并提出恢复策略。
针对大型推理模型生成过长思维链导致计算开销膨胀的问题,本文提出「最小充分思维链」(MSC)概念,定义为满足正确推理的最短前缀。基于此提出SuCo框架,通过连续自适应机制动态判断推理何时已充分并及时终止,避免离散模式切换或固定预算分级的局限,在保持推理质量的同时显著降低token消耗。
研究基于450份胸部X光报告,通过EHR摘要、标准化改写和教学案例三种任务生成LLM合成版本,量化分析AI改写过程中实体信息丢失、临床不确定性表达消解及跨模态对齐退化问题。结果表明LLM标准化处理在提升格式一致性的同时系统性地削弱了原始报告的临床细微信息,为AI辅助文档工具的部署敲响警钟。