来自该信源的全部动态 · 共 321 条
该研究提出ReportQA,一种基于问答(QA)的放射学报告评估框架。针对现有自然语言生成指标临床相关性不足、临床效能(CE)指标仅覆盖有限实体且依赖人工标注难以扩展等问题,ReportQA通过QA形式评估报告中的医学发现,能更灵活地覆盖多种临床实体和属性,减少对人工标注的依赖,为自动化放射学报告生成的评估提供新思路。
论文提出DiSan框架,作为Intern-Shannon多智能体协作系统的内置组件,解决分布式智能体跨组织边界交换文本时的隐私泄露问题。该方法不仅处理显式标识符,还针对格式惯例、词汇选择、句法模式等分布式特征签名,采用双流编码器对文本进行因子化解耦,实现语义保留与隐私属性分离的净化效果。
研究面向多跳问答的上下文压缩方法,提出Telegraph English——一种将检索段落改写为结构化实体-关系陈述的可读符号格式,在更低token开销下保留推理证据。在MuSiQue、TwoWiki和HotpotQA三个数据集上,Telegraph English在匹配预算条件下优于字符删除、截断及摘要三种压缩基线,揭示了压缩策略间的本质差异。
该研究指出现有LLM逐层非均匀稀疏分配方法主要依赖局部信号(激活异常值、权重谱等)估计层重要性,忽略了网络层间扰动吸收能力对剪枝后性能的影响。论文提出从层间扰动传播与吸收的全局视角重新理解稀疏分配,为高效模型压缩提供了新的理论框架与分配策略。
因果Transformer通过自回归分解联合分布实现高效左到右解码,但无法对任意条件(如基于前后文的中间文本块)进行可处理的采样或评估。本文提出简化方案解决这一问题,避免此前方法引入新架构带来的次优建模缺陷,为灵活条件生成提供更实用的路径。
该研究关注英中语音到语音翻译(S2ST)中词汇重音的跨语言迁移问题。当前S2ST系统在语义准确性和语音自然度方面进展显著,但重音作为强调和说话人意图的关键线索,其跨语言传递仍未被充分探索。研究团队构建了带重音标注的中文数据集,并针对声调语言缺乏可靠自动评估指标的问题展开探索。
现有深度研究Agent评测多假设查询与证据同语言,忽略了跨语言场景。本文提出XBCP(Cross-lingual BrowseComp-Plus)基准,专门评估Agent在用户查询与支撑证据语言不一致时的搜索、检索和推理能力,填补了跨语言浏览评测的空白,为多语言Agent系统的实际部署提供量化参考。
针对仇恨与宣传类迷因的多模态内容审核问题,提出基于强化学习的后训练方法,结合思维链监督提升多模态大语言模型的分类性能与可解释性。该方法利用图文交互中的隐含有害意图进行推理,弥补了现有思考型MLLM在迷因审核场景中的空白,同时生成基于参考的解释以增强结果透明度。
该研究关注大模型思维链推理中置信度与推理过程的对齐问题——高置信度答案可能由不完整或缺乏支撑的推理链产生。作者提出基于GRPO强化学习的框架CoRA,联合奖励答案正确性与承诺答案概率,使模型的置信度能真实反映推理质量,从而在CoT推理中实现更可靠的校准与决策。
针对大型推理模型(LRM)链式思维过程中的「过度思考」问题,提出一种免训练、无需精心设计提示的注意力状态自适应生成方法。该方法通过监测模型内部注意力状态判断继续推理是否仍有收益,在冗余推理产生前主动终止生成,从而减少无效token输出并提升准确率,兼具低计算开销与即插即用的优势。
该研究关注数学证明自动形式化(将自然语言非形式证明翻译为Lean 4形式证明)的鲁棒性问题。现有评估多基于精心整理的数据集中格式良好的非形式证明,作者指出鲁棒的自动形式化器应在面对偏离标准写法的非形式证明时仍保持忠实性,并对此进行了系统性评估。
该论文提出PhoneHarness框架,针对当前手机智能体评测仅关注GUI操作(点击、滑动)的局限性,构建了融合图形界面、设备端命令行和结构化工具调用的混合动作评测体系。框架要求智能体在真实移动工作流中自主决策何时使用哪种交互方式,并以任务完成状态而非单步动作准确率为评分标准,更贴近实际手机使用场景。
论文提出CHILLGuard,一个针对中文大模型的细粒度安全护栏系统,构建了5大类31小类的风险分类体系,适配中国监管政策、文化语境和语言特性。研究提出可扩展的数据构造方法和模型感知的偏好对齐策略,解决现有英文或多语言安全护栏在中文场景下分类粒度不足、本土化缺失的问题。
论文探讨将语言学奥林匹克竞赛题目(LOPs)作为语言学研究语料库的可能性。LOPs是自包含的语言谜题,包含缩小规模的语言现象语料,求解者需推导语言规则并翻译新元素。2025年国际语言学奥林匹克已有43个地区参与,论文分析该题库在计算语言学研究中的潜在价值。
论文报告了PSL团队参加QIAS 2026共享任务的结果,该任务评估大语言模型处理阿拉伯伊斯兰继承案例的能力,涉及法律解释、多步推理和精确数值计算。研究在统一提示策略下对比了商业模型与开源模型在结构化法律推理中的表现,为LLM在特定领域复杂推理场景的能力边界提供了参考。
论文提出一种自动合成数据生成方法,用于微调小型LLM完成Text-to-Cypher(自然语言转图数据库查询语言)任务。该方法基于知识图谱的接地数据生成,无需大量人工标注即可构造高质量训练对。实验覆盖所有主流Text2Cypher基准,验证了小模型经微调后可实现精确的属性图查询解析,为图数据库对话接口提供了低成本方案。
该研究探讨文本LLM和ASR模型是否以整体方式存储多词单元(如动词+up短语),而非仅依赖抽象规则生成。研究通过探测模型内部表征,考察语言模型在存储表征与生产性规则之间的权衡能力,填补了多词单元整体存储在LLM研究中关注不足的空白。
研究提出WebDecept,一个轻量可配置的插件框架,可向现有Web环境中受控注入欺骗性界面模式(dark patterns)。在电商场景下实例化七种欺骗模式,系统评估自主Web Agent面对诱导性UI时的安全表现,为Agent安全对齐与鲁棒性研究提供可复现的测试基准。
论文提出「顺从不对称性」(Compliance Asymmetry)双向诊断指标,衡量LLM在面对用户反驳时是否选择性地抵抗压力。现有评估多为单向——只测模型能否拒绝有害请求,却忽略模型是否同样容易放弃正确立场。研究发现模型在道德判断中存在方向性盲区,面对施压时无差别顺从,无论原始回答正确与否。该指标为对齐研究提供了新的评估维度。
论文针对大语言模型驱动的生成式推荐(GR)中语义ID(SID)破坏预训练推理接口的问题,提出隐式推理方法。现有GR系统用SID表示物品,但这些token在预训练阶段未见过,导致LLM难以有效调用世界知识。该工作分析了SID与自然语言推理之间的断层,并探索在不改变SID表征前提下增强LLM推理能力的路径。