来自该信源的全部动态 · 共 321 条
该研究探讨训练规模与UTF-8生成可靠性之间的关系,使用355M参数模型在80B token的英日韩中多语言平衡语料上训练。研究引入多种评估协议来隔离UTF-8结构有效性问题,发现字节级分词虽能处理任意Unicode输入,但在遇到罕见或未见字符时可能生成无效UTF-8序列。该工作为字节级模型的鲁棒性评估提供了新视角。
提出论文图表到讲解视频的新任务:给定一张科学图表及其所属论文,自动生成带旁白、逐区域高亮的分步讲解视频。研究团队构建了 MINARD 框架,填补了当前视频生成系统在论文图表理解与可视化叙事方面的空白,并建立了相应基准。该工作对学术传播和科研教育场景有潜在价值。
针对阿拉伯语社交媒体心理健康障碍检测中方言变体、非正式语言、标注资源匮乏及类别不平衡等难题,提出基于MARBERT的领域自适应预训练加两阶段微调框架,实现多类别心理障碍分类。该工作填补了阿拉伯语多类别心理健康NLP的研究空白。
研究团队发布EDEN语料库,包含约400万条来自意大利医院急诊科的完全匿名化临床笔记,覆盖患者急诊就诊各阶段。另有约6000条笔记经临床专家手动标注。该语料库为意大利语医疗NLP研究提供了稀缺的大规模真实数据资源,可用于临床文本挖掘、命名实体识别等下游任务。
针对大语言模型生成内容缺乏创造力和多样性的问题,研究者提出细粒度评估指标GENIE,从任务特定特征维度衡量模型输出的新颖性。该方法不再笼统判断「是否有创意」,而是拆解具体任务特征,分析生成内容在哪些维度上具备或缺乏新颖性,为提升LLM创造力提供可操作的诊断视角。
论文将谚语展开为叙事故事的任务定义为「受限语义解压缩」,以波斯语谚语为测试场景,研究大语言模型从抽象语义到具体叙事的生成能力。作者构建了谚语-叙事配对数据集 PAND,评估 LLM 在保持文化语义忠实度前提下的故事生成质量,为低资源语言的文化理解与生成提供了新基准。
现有搜索智能体基准(如BrowseComp)已快速饱和,最强模型准确率超90%。作者指出人类标注者缺乏全局实体统计视角,无法系统性地最大化搜索空间与结构复杂度,导致难度天花板。为此提出LoHoSearch基准,通过算法化构造长程搜索任务,突破人类出题难度上限,为评估搜索Agent能力提供更具区分度的测试集。
该论文提出 PRISM 框架,针对共情语音对话中级联管线丢失声学线索、端到端模型缺乏可解释情感控制的问题,采用多智能体架构将语音感知、情感推理与韵律生成解耦。框架在语义响应之外显式建模情感对齐的韵律表达,兼顾知识整合与情感可控性,为语音对话系统的共情能力提供了新思路。
该研究聚焦大语言模型与多模态LLM在学术同行评审中的对抗性风险。作者指出当前AI评审鲁棒性研究几乎只关注文本,忽略了论文图表同样承载核心证据这一事实。论文系统探讨了针对多模态AI审稿系统的攻击手段与防御策略,填补了该领域在视觉维度上的安全研究空白。
论文提出首个针对多轮对话式购物助手的综合评测基准Shopping Reasoning Bench,填补了现有基准在开放式多轮推理、领域专业知识和质量评估维度的空白。购物推理需平衡主观偏好、预算约束等复杂因素,区别于事实问答或代码生成任务,该基准由专家编写,为电商AI对话系统提供标准化评测框架。
研究者提出Polar基准,包含4026道多选题,通过选项级似然而非生成式提示来衡量LLM的政治偏见。该基准覆盖两个意识形态轴和八个议题类别,源自Manifesto Project,支持跨语言并行评估,旨在提供可复现的政治偏见度量方法,解决当前评估在政治和语言语境间一致性不足的问题。
该论文提出 SENTINEL 方法,针对工具调用型语言模型智能体的强化学习训练难题,通过失败驱动的任务分布调整策略来提升训练效率。核心思路是在训练过程中动态聚焦于智能体当前失败的任务,避免固定任务分布导致的学习瓶颈,使智能体在多轮工具交互场景中获得更稳健的泛化能力。
研究发现当关键信息分散在多轮对话中时,LLM准确率最高下降65%,即使完整上下文可用也无济于事,作者将此称为「Lost in Conversation」退化。论文提出用紧凑滚动记忆替代不断增长的历史注意力机制,并设计低成本分片管线将单轮QA数据集转化为多轮训练数据,结合记忆增强强化学习进行可扩展训练,显著改善多轮推理表现。
该论文发布 LEDGER 基准数据集,针对大语言模型在超长上下文金融文档中的检索与信息抽取能力进行评估。现有金融评测多局限于纯文本 SEC 10-K 文件配少量 QA 对,LEDGER 以企业年报为语料,提供更严格、更贴近真实场景的长文档理解测试,填补金融领域长上下文评估空白。
研究团队发布 AfriSUD,首个覆盖撒哈拉以南非洲九种语言的大规模句法标注树库集合,基于 Surface-Syntactic Universal Dependencies(SUD)框架构建,涵盖多个主要语系。该资源旨在填补非洲语言在 NLP 研究中的数据空白,为模型在低资源非洲语言上的句法解析能力评估提供标准化基准。
该研究用多智能体仿真模拟语言中形态交替现象(如英语 go/went)的涌现与持续机制。形态交替既不利于沟通也不利于学习,却能存续数百甚至数千年。模型探讨了语音变化和词汇替代两种路径如何在群体交互中产生并维持词干与屈折交替模式,为计算语言学和语言演化研究提供了新的仿真框架。
研究针对LLM常被诟病的两大局限——无法捕捉人类回答的完整分布、对措辞变化判断不稳定——提出简单提示策略加以缓解。实验覆盖美国代表性道德场景(144条)及ISSP家庭信念(38条)两个数据集,证明经过提示优化后LLM可更好地拟合人类群体判断,为用LLM做社会调查代理和对齐评估提供了实用方法论。
针对级联语音翻译系统中ASR错误传播问题,本文首次系统分类越南语ASR错误的语音学成因,利用线性混合效应模型量化各类替换错误对下游神经机器翻译的影响,并提出基于语音学信息的数据增强方法PiDA,增强NMT对ASR噪声输入的鲁棒性。
针对电商平台图像AI助手面临的多意图冲突问题(商品搜索、风格推荐、视觉百科、工具调用等),提出SkillChain框架,通过为每种用户意图设定独立的行为约束、响应格式和工具调用规范,形成技能演化闭环,解决LLM系统在异构模式下混淆响应的问题,提升领域专业性。
针对真实事件摘要随上下文演变而过时的问题,提出局部忠实性修复任务:仅更新摘要中不再被支持的片段,保留仍有效内容。方法 DETECT-REMASK-REPAIR 借鉴扩散编辑思路,先检测不忠实片段,再对其重新掩码并修复,避免全文重新生成带来的信息丢失和变更不透明问题。