来自该信源的全部动态 · 共 1241 条
论文针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语训练五个GPT-2架构因果模型,比较各自32K词表的单语模型与联合多语模型,评估低资源达罗毗荼语在多语建模中的能力保留与取舍。
论文研究LLM扩展为多模态模型时语言能力退化的问题,发现预训练神经元在多模态学习中的可塑性差异明显。作者提出NeuPAT,按神经元对语言保持的重要性分配调优强度,试图在获得感知能力的同时减少语言智能损失。
DocAtlas将长文档理解建模为可变状态交互,让系统在阅读多页版面、表格、图表时持续更新证据状态,而非依赖静态检索索引或仅靠提示词驱动的封闭模型。论文面向跨页证据整合与复杂文档问答,探索更可控的Agent式文档处理范式。
论文提出用于抽象摘要的关系级幻觉评估框架,聚焦实体与事件之间关系被伪造或扭曲的问题。方法将关系幻觉拆解并锚定到源文档证据,以提升评估粒度和可解释性,面向高风险场景中摘要忠实性检测。
论文研究多语监督对谚语中比喻语言识别的贡献,基于742个谚语概念和七种语言的6787个翻译实例,评估多语编码器与指令微调大模型在逐步增加语言混合训练数据下的表现,分析跨语言迁移与翻译监督的作用。
论文研究语言模型如何区分助手、角色扮演人格与叙事角色等说话者身份。作者基于情绪文本及模型回复,在轮次边界和代词位置提取稀疏自编码器特征,分析不同生成设置中的内部表征差异,为模型人格、角色一致性与可解释性研究提供证据。
论文提出WuYuEval,用于评估大模型在固体废物管理中的能力,覆盖基础知识、领域推理和专家决策等层级,强调工程、环境与政策约束下的专业判断,弥补通用基准难以衡量垂直行业决策能力的问题。
论文研究掩码扩散语言模型解码中分类器自由引导的实际必要性,通过比较部分输出后继续使用CFG与仅用基础模型完成约束的概率差,定义剩余引导价值。结果显示引导依赖高度受提示词影响,可为自适应关闭CFG、降低推理成本提供依据。
论文提出Archer,用于扩散语言模型推理中的高效回滚。它自适应复用缓存隐藏状态,避免每次去噪更新都重新计算提示词和响应上下文,降低因全局上下文变化带来的推理开销,面向DLM部署效率优化。
论文提出考试式评测框架,考察推理语言模型在共享令牌预算下如何跨多个问题分配测试时算力。结果显示,模型虽会增加单题思考量,但难以按题目难度和收益合理调度预算,暴露出现有逐题评测未覆盖的资源分配缺陷。
论文提出AraSSM,面向阿拉伯语掩码语言建模的双向Mamba状态空间编码器,旨在替代Transformer自注意力在长文本上的二次复杂度瓶颈。研究聚焦阿语NLU预训练骨干的线性时间建模能力与效率。
论文研究大模型转向向量带来的安全退化问题,指出其安全成本来自向量中一个可分离成分:该成分会扰乱模型安全机制,却对目标行为控制贡献有限。作者据此提出缓解思路,可在保留转向效果的同时降低有害请求服从率。
论文提出 SurveyReview,用于评估大模型作为学术综述评估器时与人类审稿人的一致性。研究关注现有 LLM-as-a-judge 缺乏系统对齐的问题,构建基准与量化框架,以衡量模型在综述质量判断中的可靠性和审稿偏好匹配度。
论文研究「even」「only」等焦点小品词是否在人类与大语言模型中诱发一致的标量推理,比较不同语境下对意外性、极端性和排他性的判断,检验模型是否具备可泛化的结构化语义表征。
论文提出将可解释性直接纳入语言模型训练流程,而非事后解释黑盒模型,并与语言建模目标共同优化。研究在跨三个数量级算力、不同任务设置下评估该方法,探索可解释约束是否能随规模提升同时保留模型能力。
论文提出PoVisLE,用于评估视觉语言模型在波兰语及本土文化场景中的理解能力,覆盖图像描述、视觉问答和区域特定符号等任务,指出英语中心训练数据会削弱模型对文化语境、象征含义和视觉线索的解释能力。
论文提出用于立法委员会听证文本的自我介绍检测与姓名抽取流程,目标是改进政府会议中的说话人识别。研究基于五个州立法机构的154万条发言构建训练数据,并使用机器学习方法识别相关片段。
论文提出Search-G1,用基于表示的内在奖励训练搜索增强语言智能体,使其仅在必要时检索外部信息,并将回答扎根于证据。方法试图替代依赖稀疏结果奖励、人工过程标注或LLM裁判的训练信号,降低成本并提升检索决策质量。
论文提出面向多模态大模型的统一幻觉模糊测试框架,用系统化生成与评估替代静态基准,覆盖更广幻觉类型,衡量模型在变化真实场景中的鲁棒性,旨在缓解现有评测饱和和覆盖不足问题。
论文发布APEX-VW,一个医疗领域英西文档级机器翻译译后编辑数据集,面向真实CAT工作流中术语和词汇修正跨句传播问题。其价值在于弥补现有APE语料多为句级或合成数据的不足,支持研究文档级一致性与专业翻译辅助。