来自该信源的全部动态 · 共 321 条
该研究针对法庭文书中人口走私网络信息提取难题,提出FineREX流式处理框架。现有通用大模型无法适配该领域特定的实体与关系定义,FineREX通过对命名实体识别和关系抽取模型进行领域微调,从非结构化法律文档中自动构建知识图谱,提升对走私网络的情报挖掘能力。
研究指出临床NLP领域利用电子健康记录(EHR)检测自杀行为时,数据集构建过程中的操作化定义——包括数据作者身份、事件边界划定及歧义消解方式——会深刻影响模型对自杀倾向的识别结果。论文以ScAN数据集为案例,论证EHR数据并非中立的「金标准」,呼吁研究者反思数据构建假设对下游检测系统的隐性塑造。
该论文探讨利用LLM生成合成临床人设来模拟多语言心理健康对话数据的方法局限。研究发现,仅通过设定国籍和语言来本地化人设,难以产生文化适切的心理健康对话数据,现有验证人设多依赖英语语境,缺乏跨文化有效性。论文为多语言心理健康AI系统的数据构建提供了批判性反思。
研究在7个大语言模型(4B至671B参数)上以阿拉伯语微调,零样本评估闪米特语系及非闪米特语系的阅读理解表现。结果表明,跨语言迁移效果与语言亲缘关系无关:弱基线模型在所有语言上均大幅提升,强基线模型则普遍仅有边际增益,该结论在密集和MoE架构上一致成立。
论文针对上下文学习(ICL)中预测对提示设计和上下文理解高度敏感的问题,提出将偶然不确定性与认知不确定性进行分解的方法。现有不确定性分解技术多为传统模型设计,难以直接适配ICL场景。该工作提供了一种更鲁棒的LLM预测置信度度量框架,帮助区分失败究竟源自数据固有属性还是模型能力局限。
研究以2026世界杯西班牙0-0佛得角比赛为案例,对40岁门将Vozinha在24小时内从5万粉丝增长至820万的现象进行多语言计算话语分析。构建了葡、西、英、法四语种语料库,提出九帧叙事分类体系与基于线索的标注方案,设计了LLM辅助与人工校验结合的可复现标注流程,探讨语言如何构建算法传播中的可见性。
研究者基于叙事理论,针对3万亿token的开放预训练语料Dolma,设计了涵盖施事性、场景和事件三大核心叙事要素的11个可解释维度框架,首次对网络规模LLM预训练数据的叙事组成进行系统量化分析,揭示了预训练语料中叙事内容的分布特征与结构规律。
该论文针对大语言模型测试时缩放(TTS)中验证器的最优粒度问题展开研究,提出GRACE框架,通过自适应调节验证粒度来优化计算效率。TTS通过在推理阶段投入额外计算提升推理性能,验证器负责评分或筛选候选解以引导搜索过程,而验证粒度的选择对效率与准确性的平衡至关重要。
论文提出因果归因剪枝(CAP)方法,通过度量注意力头在推理任务中的因果影响来识别关键头,并以头级评分指导细粒度权重剪枝。该方法无需额外训练,在前向传播中遮蔽注意力头并估计预期性能退化,从而在大幅压缩模型的同时保留多步推理能力,降低推理成本。
论文提出MiqraBERT,基于现代希伯来语编码器AlephBERT微调的Sentence-BERT模型,用于圣经希伯来语经文级语义相似度检测。针对传统方法依赖词汇重叠、在释义和句法改写场景下失效的问题,采用1650条标注经文对进行回归训练,提升了跨表述平行文本的召回能力。
研究首次系统探讨扩散大语言模型(dLLM)中上下文学习的查询放置位置问题。与自回归模型的单向因果掩码不同,dLLM具有双向注意力,为查询位置提供更大空间灵活性。论文揭示当前沿用AR风格尾部查询模板存在位置偏差,并通过解码动力学分析提出缓解策略,为dLLM的ICL范式提供新见解。
论文提出基于问题可解性的LLM硬件设计错误分类法,将失败分为语法、语义、可解功能性和不可解功能性四类。研究发现LLM难以将顺序编程先验转化为硬件设计所需的并行时序逻辑,在VerilogEval基准上存在严格的经验性能上限。该分类法借鉴认知理论,为理解LLM在RTL编码中的能力边界提供了系统性分析框架。
研究团队发布NRITYAM基准,用于评估语言模型对全球舞蹈传统的文化理解能力。该数据集包含9260个精心策划的问答对,覆盖12种语言,旨在衡量模型对地方社会文化语境的细粒度把握程度,填补语言模型在文化多样性理解方面的评估空白。
研究团队对7万余条在线募资平台客服对话进行分析,指出传统情感分析仅衡量客户语气而非实际满意度。研究使用GPT-5.4对每位客户的满意度进行估计,并标记其是否报告了具体问题,再与实际验证对比,提出了一种比单纯情感分析更丰富的客服质量评估框架。
研究在语言模型对齐中依次应用多个行为目标时,后续DPO训练是否均匀退化先前学到的偏好。实验跨四种偏好设置表明,遗忘程度取决于目标间的关系而非简单的顺序覆盖,为多目标序列化对齐策略的设计提供了实证依据。
该研究提出TerraMARS流水线,利用领域适配的小型语言模型从火星科学文献中提取关于大气、水文、表面化学、辐射环境及空间特征的结构化知识与定量约束,用于支撑宜居性评估等下游研究。工作聚焦于低资源场景下的科学文本信息抽取能力。
该综述系统梳理了手语识别、翻译与生成领域的数据集现状,指出当前研究受限于数据碎片化、标注不一致及语言覆盖不足等问题。论文对现有基准进行系统性分析,揭示其与真实通信需求的差距,为后续手语AI研究提供资源与标注标准方面的参考框架。
RAG虽提升事实性但增加了提示长度和预填充成本。vLLM等引擎的前缀缓存仅在请求共享相同token前缀时有效,而实际中相邻查询检索到的证据集合虽有重叠却排列不同,无法复用缓存前缀。CacheWeaver提出一种轻量级提示层方法,通过对检索证据进行缓存感知排序,最大化前缀重用率,在不改变模型或推理引擎的情况下降低RAG服务的计算开销。
论文提出一种语义预训练框架,将BERT等预训练语言模型的上下文知识以语义聚类形式迁移至Tsetlin Machine(TM),使TM在保持子句级可解释性的同时获取丰富语义信息。该方法克服了此前基于静态词嵌入的桥接方案无法捕捉上下文语义的局限,适用于对透明度要求高的文本分类场景。
论文提出TreeTracer可视化分析工具,针对LLM文本生成中隐藏在低概率分支里的表征与句法偏见进行检测。传统审计方法依赖单次输出检查或静态指标,难以捕获概率分布中的潜在偏见。TreeTracer通过随机路径聚合技术,将生成树中多条路径的概率分布可视化,使审计者能系统性地发现被常规方法忽略的偏见模式。