来自该信源的全部动态 · 共 321 条
研究对比了两项此前结论矛盾的工作——关于大型视觉语言模型能否协调生成高效指称表达。通过控制任务差异并直接比较隐式与显式提示风格,作者复现了模型在显式提示下可协调高效指称表达的结论,表明提示策略而非任务设计差异是关键因素。
论文提出MODE-RAG框架,针对多模态检索增强生成(M-RAG)中跨模态幻觉、因果捏造和迎合性问题,利用流形异常诊断和基于能量的评估方法进行检测与缓解。该方法解决了现有干预管线的矛盾:静态规则会干扰正确生成,而无引导推理则导致错误级联放大,为多模态RAG可靠性提供新思路。
研究发现基于LLM的自动语音识别(ASR)在多语言场景下常出现输出语言误判,影响转录准确性。论文将此定义为「语言一致性缺失」问题,提出一种软提示方法,在不严格约束输出的前提下暗示可能的口语语言,从而兼顾灵活性与代码切换能力,改善多语言转录质量。
随着LLM推理能力增强,欺骗性行为成为重要安全隐患。现有检测方法仅评分可见文本或提取标量探针分数,缺乏可解释证据。本文提出STATEWITNESS,一种激活解释器框架,通过独立解码器读取目标模型隐藏状态来审计欺骗行为,为可疑响应提供可检视的解释性证据,提升AI安全审计的透明度。
该研究分析了全由自主AI智能体构成的在线社区Moltbook中4434篇帖子和50338条评论,探究AI智能体之间是否存在类似人类拟社会互动的关系线索。研究基于依恋/亲密语言、互惠请求和对原帖作者的自我认同三种理论指标进行文本分析,考察AI智能体社区中从脚本化拟社会互动到持续双向关系的演化现象。
该研究指出大语言模型在代码翻译任务中虽然功能正确性显著提升,但生成程序的运行效率常低于人工编写版本。在摩尔定律放缓的背景下,运行时效率对程序质量愈发重要。论文系统分析了LLM翻译代码效率低下的原因,并探索弥合功能正确性与运行效率之间差距的方法。
该研究揭示现有LLM遗忘方法易被微调或少样本提示逆转的根因:它们修改的表示与保留集及攻击者可恢复子空间重叠。论文提出RepSelect方法,通过选择性地定位仅与遗忘目标相关而不与保留能力共享的表示进行干预,实现更深层、更难逆转的知识遗忘,同时保持模型通用能力不受损。
该研究从形式语言理论出发,利用有界深度文法作为分析工具,探讨深层Transformer如何通过逐层构建层次化表示来获得表达能力。论文形式化了早期层捕获局部句法模式、深层编码复杂从句依赖的直觉,为理解Transformer层次组合性提供了理论框架。
研究提出AIPatient Arena框架,以真实电子病历(EHR)为基础,从八个临床能力维度评估大语言模型在完整问诊流程中的表现。该框架针对现有医学评估多为静态单轮或仅关注结果的局限,模拟了真实诊疗中的多轮交互、信息不确定性和顺序推理特性,为LLM临床应用提供更贴近实际的评测基准。
针对LLaDA2.1的Token-to-Token编辑模块,研究者发现其训练时使用随机词表corruption,但推理时面对的是模型自身生成的流畅高置信度草稿错误,存在训练-推理不匹配问题。论文提出self-generated T2T方法,通过无梯度草稿生成填充掩码位置,再监督模型恢复正确token,有效弥合分布差距,提升block-diffusion解码中的编辑质量。
MLLP-VRAIN研究组描述了其参加IWSLT 2026同声语音翻译赛道的系统方案。该系统采用Parakeet和Qwen 3.5模型构建级联式长文本同声翻译方案,通过自适应「黑盒」策略及其松弛变体实现质量与延迟之间的权衡优化,相较去年方案有所改进。
该研究探讨大语言模型在生成文化适应性回复方面的能力缺陷。研究者提出CAPRI数据集,包含不同文化线索强度的对话,评估模型能否根据用户文化背景使用当地度量单位。实验表明LLM虽能推断用户文化语境,但在实际生成回复时未能有效应用这些信息,仍偏向西方主流文化表达,揭示了模型文化多样性方面的系统性短板。
该研究探讨Word2Vec在极端小词汇量语言中的表现。研究者使用人造语言Toki Pona(仅约130个词)的140万句语料(795万token)训练Word2Vec模型,检验其能否在极度精简的词汇空间中捕捉语义关系。此前Word2Vec几乎只在大词汇量自然语言上验证过,该实验为理解嵌入模型的基本能力边界提供了新视角。
论文提出 PromptMN,一种伪提示词语言,旨在将自然语言提示中隐含的角色、目标、约束和预期输出结构化表达。研究指出大量智能体失败源于上下文歧义而非模型能力不足,PromptMN 通过显式语法减少首次交接时的误读,降低错误在多步工作流中的传播风险。
研究针对200至800集长篇连载音频剧场景,构建结构化叙事基准NarrativeWorldBench,对21个LLM进行评测。结果显示所有闭源前沿模型在情节节拍F1上饱和于0.78-0.81区间,且在长时间跨度(horizon)下F1下降约0.20,暴露当前模型在长程叙事连贯性上的系统性不足。论文同时提出潜在世界模型方法以改善长程共创能力。
随着LLM越来越多被用作偏见判断工具,研究者提出「二阶偏见」概念,即LLM在评判社会偏见内容时自身表现出的隐性偏见。论文借助认识论中的「认知权利」框架,设计新型推理任务系统性检测这类偏见,揭示现有评估方法无法捕捉的判断层面的社会偏见问题。
研究基于AMI会议语料库,构建了发言对象检测、话轮转换预测和下一位发言者预测三项任务的评估框架,对比了监督模型、纯文本LLM、多模态LLM及人类被试的表现。实验表明LLM在下一位发言者预测任务上优于监督模型和人类,为多方多模态对话中的话轮管理研究提供了新基准。
研究揭示模型剪枝带来的隐蔽风险:经过剪枝压缩的大语言模型在多项选择基准测试中仍表现良好,但在开放生成场景下却无法产出正确答案。作者通过多语言问答任务探究剪枝究竟是擦除了正确知识,还是使正确答案难以被生成为首选输出,对当前基准评估方法的可靠性提出质疑。
该论文提出OPD-Evolver框架,解决现有记忆型智能体仅能存储轨迹或积累技能却缺乏整体进化能力的问题。框架采用慢-快协同进化机制,使智能体具备选择有用经验、据此行动、编写可复用知识并维护增长型知识库的综合能力,通过在策略蒸馏实现自我持续进化。
该研究通过叙事相似性框架考察LLM生成故事的多样性。研究者采用对比学习框架,基于Reddit r/WritingPrompts的人类故事与提示数据集,收集叙事相似性数据,评估LLM输出是否倾向于产生同质化内容。研究聚焦模型生成多样性这一关键问题,对理解LLM创意写作能力的边界具有参考意义。