来自该信源的全部动态 · 共 321 条
论文针对LLM配对评估中的不可传递性问题提出基于提示扰动的方法。通过对同一prompt生成多个变体进行比较,构建比较图并聚合判断结果,从而缓解单次比较中的随机性和偏差,提高整体排名的可靠性与一致性,为开放式任务的模型评估提供更稳健的框架。
该研究系统考察了大语言模型在机器翻译任务中对自身输出置信度的可靠性。研究指出,翻译错误和置信度可在token、词、片段等不同粒度上衡量,而基于预测概率等内部信号的无监督方法可能具有误导性,因为它们反映的是候选项之间的确定性而非翻译质量。论文探索了LLM口头化表达置信度的方式及其局限性。
该研究针对大语言模型在医学3D体积图像(CT)报告生成中的适配难题展开探索。由于体积数据计算复杂度高、存在体积依赖性以及视觉特征与临床术语间的语义鸿沟,直接微调LLM效果有限。论文系统研究了模型扩展策略与诊断先验知识的引入对3D CT报告生成质量的影响,为医学多模态AI提供新思路。
英伟达推出Nemotron 3 Ultra,总参数550B、活跃参数55B的MoE混合Mamba-Attention语言模型。该模型在20万亿文本token上预训练,上下文扩展至100万token,并通过SFT、强化学习及多教师在策略蒸馏(MOPD)进行后训练。模型面向智能体推理场景设计,采用开放路线,是英伟达迄今最强模型。
论文提出 Spokes 方法,针对预训练数据选择中的多样性优化难题。多样性是集合级属性,依赖数据点间的交互而非单个样本,现有方法多依赖代理指标或近似策略,难以保证子集充分多样。Spokes 直接优化多样性目标,在固定数据预算下通过减少冗余和重复提升模型性能。
该研究在WESAD数据集上系统评估了LSTM、TCN和Transformer三种深度学习模型在多模态情感识别中的表现,使用腕部和胸部传感器信号进行压力与情绪识别。通过消融实验评估各模态的独立贡献,并探索集成融合策略以提升识别性能,面向健康监测和情感计算应用场景。
论文提出将认知图谱与大语言模型结合,基于评价情绪理论建模恐慌情绪唤起过程,用于在恐慌表现之前预测个体情绪唤起时机,以支持主动应急干预。研究指出现有方法虽纳入认知要素但未显式建模情绪唤起过程,提出BDEI认知路径框架解决该问题。
研究指出当前多语言大模型常用的字节级BPE分词器在结构上偏向高资源语言和拉丁文字,导致东南亚等低资源语言推理成本膨胀、跨语言能力差距扩大。论文通过实证分析量化了这一偏差,并探讨在保持效率的前提下提升分词公平性的方案,为多语言模型的分词策略优化提供参考。
大型推理模型在英语外常出现「语言坍缩」,即推理过程不自觉切换为英语。现有强化学习方法虽加入语言忠实度奖励,但仍面临准确率下降、推理链中途切码和token浪费等问题。本文提出AdaMame两阶段训练方案,针对多语言数学推理场景,在保持准确率的同时有效缓解语言坍缩与代码切换现象。
针对现代语言模型中混合架构(全注意力+滑动窗口注意力/循环序列混合器)的能力形成机制,本文从扩展行为、机制分析和架构设计三个视角展开系统研究,探讨高效注意力模块如何影响模型能力,为混合架构的设计选择提供理论依据与实验指导。
该研究提出 AmchiBias,首个针对印度果阿邦多元文化背景下社会文化刻板偏见的评测基准。数据集覆盖多个果阿身份群体,包含313组英语与孔卡尼语最小对句对,用于量化NLP系统在次国家级社会文化维度上的偏见表现,填补了现有偏见评测多聚焦国家层面而忽视地方多元结构的空白。
针对大语言模型子词分词器在非拼接形态学语言上系统性错位的问题,研究者提出 PACUTE 诊断基准,包含 4600 个任务,专门评估模型对菲律宾语词形变化中音韵、词缀及字符层级结构的理解能力。该工作揭示了当前分词方案对低资源、形态复杂语言的局限性,为改进多语言模型形态学建模提供量化评测手段。
针对基于RL的LLM遗忘方法(如RULE)在训练中反复采样简单样本导致效率低下的问题,本文提出离策略重放机制,识别并优先重训难样本,跳过已快速收敛的简单案例。该方法在保持遗忘效果和模型通用能力的同时显著减少计算开销,为安全对齐中的知识移除提供更高效的训练策略。
该报告介绍Ling-2.6和Ring-2.6模型家族,旨在万亿参数规模下实现高效可扩展的智能体能力。Ling-2.6专注低延迟即时响应与高单token能力输出,Ring-2.6则面向深度推理场景优化。两者在训练、服务与部署上均追求实用性,试图在响应速度与推理深度间取得平衡。
研究指出当前LLM Agent通过经验积累自然语言技能的系统存在缺陷:技能生成(创造性判断)与技能有效性验证(需跨任务实证)被混为一谈,全部交由LLM自身判断。论文提出将两者解耦,通过经验性度量评估技能是否真正有助于任务完成,并据此修复无效技能,提升Agent整体表现。
现有社交智能体基准多为纯文本,忽视面部表情、姿态、注视等视觉社交信号。本文提出一项多模态社交模拟基准,包含240个场景、585个角色实例,系统评估多模态智能体利用视觉线索引导社交互动的能力,填补了该领域评测空白。
该研究在固定推理Token预算下重新评估了Web Agent常用的在线增强模块(AWM、ASI、ReasoningBank等)。这些记忆、工作流和技能模块虽能提升性能,但每次任务都会消耗额外Token,而这一成本此前鲜少被报告。研究将增强Agent与Token匹配的vanilla基线对比,揭示在预算受限条件下,在线增强模块的实际收益可能被高估。
研究测试了LLM在二语英语发音反馈中的诊断是否基于语音证据而非预训练先验。实验覆盖1800条L2-Arctic语音、六种母语背景、三个音频LLM、四个发音维度及五种证据条件。结果表明模型诊断显著受母语背景刻板印象驱动,而非依据实际语音输入,揭示了LLM在教育场景中的公平性隐患。
现有同声语音翻译(SimulS2ST)评估多针对短句或预分段语音,难以适用于长文本连续输入场景且难以复现。本文提出一种面向长文本SimulS2ST的实用评估方法,利用源语音、预分段转录文本等信息构建可复现的评测流程,解决端到端系统在真实长语音条件下缺乏标准化评测手段的问题。
现有语法纠错(GEC)模型在上下文轻微扰动或扩展时性能大幅下降,表明模型未真正理解变化语境中的错误模式。本文系统研究GEC任务中的反事实样本——对上下文做细微改动即可改变纠错结果,提出CoCoGEC方法通过反事实数据生成增强模型对语境变化的鲁棒性,帮助GEC系统在多样化输入下保持稳定表现。