来自该信源的全部动态 · 共 321 条
针对从非结构化电子健康记录中提取结构化临床信息的难题,提出一种完全本地部署的两阶段LLM流水线方案,用于CL4Health 2026病例报告表填充任务。该方法兼顾隐私保护、推理成本控制与减少幻觉生成,避免将敏感医疗数据传输至外部API,适用于临床环境下的信息抽取场景。
研究者对苹果M4 Max GPU上Metal 4.1暴露的张量计算路径进行逆向工程分析。苹果MPP matmul2d接口虽有文档,但硬件行为刻意隐藏,包括是否硬件加速、物理执行位置、累加器位宽及矩阵分片策略等均未公开。该工作通过实验揭示了cooperative_tensor fragments的底层硬件实现细节,为在苹果芯片上优化AI推理提供参考。
该研究揭示AI同行评审系统的一种新型脆弱性:攻击者无需使用提示注入或隐藏指令,仅通过修改论文的表述层内容(如摘要措辞、段落组织等),不改动方法、实验、图表或数值结果,即可显著影响AI审稿评分。这一发现对当前将AI评审嵌入学术基础设施的趋势提出了严重的政策层面警示。
论文对潜在推理模型(LRM)的可解释性提出质疑。此前研究将 Coconut、CODI 等模型隐状态中出现的 BFS 前沿、可解码算术计算等模式视为内部推理机制的证据。作者通过因果-几何分析,在缺少关键递归或课程设计的对照模型中同样观测到这些模式,且这些模式并不总是因果地影响模型行为,表明「可观测≠可解释」。
提出MARD方法,通过镜像增强推理蒸馏实现机制级药物-药物相互作用(DDI)预测。该工作不仅判断两药是否相互作用,还识别涉及的酶或药效学轴向及方向。构建了包含7大类/147子类的结构化分类体系,设计了防泄漏冷启动划分协议和可审计推理评估指标,为药理学预测提供可复现的标注与评估框架。
研究揭示提示中无关数字如何在语言模型内部产生锚定效应,影响数值推理判断。作者设计受控多选实验,定义logit差异指标追踪锚定敏感信号在模型各层的传播路径,并通过归因方法定位关键组件,为理解和缓解LLM数值推理偏差提供机制层面的解释。
该论文探讨使用直接偏好优化(DPO)微调大语言模型的方法。实验表明DPO可简化训练流程、提升计算效率并达到有竞争力的性能。评估采用BLEU、ROUGE及余弦相似度指标,显示模型有效学习与收敛,但仍需进一步研究以解决现有局限。整体为DPO技术的基础验证工作,无显著新颖贡献。
该研究聚焦多语言RAG系统中检索证据相互矛盾的问题,尤其是中英文证据支持不兼容答案的场景。研究者构建了X-RAMDocs-ZHEN基准,包含300道受控中英文冲突样本,用于系统性诊断RAG在跨语言证据冲突下的表现,为多语言RAG的鲁棒性评估提供了新工具。
该论文针对RAG系统在安全合规场景(如SOP、HR政策等组织文档)中自由改写易引入幻觉的问题,提出以「抽取」替代「改写」的策略。研究评估了抽取式方法在完整性与简洁性之间的稳定性,旨在为安全关键环境下的LLM应用提供更可靠的文本生成范式。
论文提出HieraRAG框架,系统研究RAG基准测试构建中的粒度问题。通过定义「最优粒度」为最大化区分力(生成质量标准差)的层级,为从业者提供实证指导:在构造合成问题时应在哪些维度、以何种细粒度进行变化,从而更有效地评估和比较不同RAG系统的性能差异。
研究对比了Phi-3-mini(3.8B)、Qwen2.5-3B和Mistral-7B三个小模型经QLoRA在SciFact和HealthVer上微调后的生物医学声明验证能力。结果显示Mistral-7B QLoRA在F1上超过GPT-4o和GPT-5最多12个百分点,成本大幅降低。这是首个将QLoRA小模型与GPT-4o及微调BioLinkBERT编码器系统对比的研究,同时探讨了数据集结构捷径与跨域泛化问题。
研究发现,大模型在使用思维链推理时,当推理步骤超过特定任务阈值后,模型会出现系统性过度自信——即对错误答案赋予过高置信度,校准性能下降。这意味着更长的推理链并非总是更好,存在一个与任务相关的最优推理预算,超出后反而损害不确定性表达质量,对安全部署构成隐患。
现有LLM道德基准多考察模型对单一道德行为或价值的偏好,难以反映现实中需综合多重道德信号的判断场景。本文提出Moral Trolley Arena,采用两阶段盲评ELO机制,基于229个场景语料库先校准单项道德行为,再评估模型在同一选项中组合多种道德证据的能力,为前沿LLM的复合道德推理提供量化测量框架。
针对社交媒体上AI生成图像/视频泛滥带来的虚假信息与欺诈问题,该论文提出基于多模态语言模型的检测流水线,旨在解决现有AIGC检测方法泛化性差、依赖单一模态、缺乏可解释性等痛点,通过持续学习机制适应新生成模型。
论文提出一种可审计的分阶段晋升协议,用于微预训练场景下的超参配置筛选。在Windows A100和Linux L40S两种异构硬件上,从12个预筛配置出发,依次通过2分钟、5分钟、10分钟、60分钟、12小时的递增预算阶段,以冻结的晋升规则逐步淘汰弱配置,降低实验成本同时避免小预算下的过度推广偏差。
研究发现 RAG 系统中注入内容的格式(而非语义相关性)会独立扭曲 LLM 的注意力分配。作者提出「结构注意力税」概念:知识图谱三元组因其关系分隔符和重复槽模式,每个 token 获得的注意力是语义等价散文的 2-3 倍,导致模型偏向结构化片段而非真正相关内容,揭示了 RAG 检索格式对生成质量的隐性干扰机制。
该研究针对音频语言模型(ALM)在语义推理层面的不足,构建了跨口音、跨领域的评估基准。重点考察口音变化、领域迁移及语义过度推断对模型推理能力的影响,覆盖五类语义任务,揭示当前ALM在非转录类深层理解上的短板,为多口音场景下的语音理解研究提供系统性评测框架。
针对大模型安全训练集中于主流语言、多语言越狱攻击防御薄弱的问题,本文提出学习语言无关的意图表示方法,使越狱检测器能跨语言泛化。研究聚焦多语言对齐监督稀缺导致的安全漏洞,为全球化部署场景下的LLM安全防护提供新思路。
针对大模型监督微调(SFT)中优化不稳定和泛化受限的问题,本文在动态微调(DFT)基础上提出兼容性感知改进方案。DFT通过token级梯度缩放纠正病态梯度问题,但假设所有示范数据同等适合作为学习目标。本文指出大规模数据集的强异质性违反该假设,引入兼容性度量动态调节训练信号,提升微调稳定性与泛化能力。
该研究指出LLM常反映训练数据中的同质化价值观,传统直接提问式评估易引发中性或安全对齐回答,无法揭示模型潜在偏好。作者提出一种基于场景的框架,沿Inglehart文化维度探测和引导LLM中的潜在文化表征,为多文化部署场景下的价值对齐提供新思路。