来自该信源的全部动态 · 共 981 条
论文提出HCG-RAG,用模式约束的层级因果图替代GraphRAG中开放式实体关系抽取,使图规模与查询推理需求而非语料长度相关,旨在降低构建成本并提升结构化检索的可控性与因果推理能力。
论文提出在LLM全流水线引入MoE式混合,而不只局限于FFN层,以突破密集Transformer的计算与参数耦合瓶颈,并给出cMoLLM的横向扩展缩放规律,为万亿参数级模型设计提供理论参考。
论文提出 SCAIR,一种面向企业知识图谱的模式条件化智能体迭代推理方法,针对现有 KG-RAG 在真实企业图谱中因结构密集、强模式约束和运营限制而泛化不足的问题,提升自然语言查询与结构化知识交互能力。
研究提出神经符号词汇发现框架NSLD,让一组基于LLM的智能体在未知、分布外的视觉对象上进行指代博弈,自主形成共享的外星词汇,用于描述人类语言中没有现成名称的实体。
论文提出DSTFView,用双输入时空频多视角建模预测云边协同环境中的工作负载,面向边侧AI推理的低延迟、高并发与可靠性需求,旨在兼顾多维特征表达和预测效率,适合关注云边资源调度与推理平台优化的研究者参考。
论文研究端侧大模型推理中提示词设计对能耗的影响,指出不同关键词会显著改变移动和嵌入式设备上的能量消耗。工作补足了以往偏重模型压缩和运行时加速、忽视提示层面能效优化的空白。
论文针对LLM-as-a-judge评测成本高、延迟大、决策不透明的问题,提出程序蒸馏:将LLM评审逻辑蒸馏为程序委员会,在评测时直接为候选结果打分,以提升自动评估的可扩展性、效率与可靠性。
论文提出SF-AMS智能体记忆框架,通过建模记忆单元的长期效用,替代静态检索和启发式衰减机制,动态保留高价值信息、遗忘冗余内容,以缓解长上下文依赖对多步推理的干扰。
论文以长上下文语言模型为对象,研究其是否具备类似人类情景记忆的顺序检索能力。作者提出时间语境复现机制可驱动跨长时间尺度的事件顺序记忆,并为理解LLM长程记忆行为提供可解释线索。
论文提出 SCEPTER 框架,将单个临床病例描述自动转为基于 PubMed 证据的推荐,用多目标证据推理整合检索到的文献,缓解复杂病例下论文过多、人工筛选耗时的问题,为临床辅助决策提供自动化证据汇总路径。
论文关注多模态大模型推理中的KV缓存膨胀问题,指出现有预填充阶段选择方法默认预填充查询可代表解码查询,导致视觉token裁剪不准。MM-ShiftKV引入面向解码的KV重要性估计,在降低缓存占用的同时减少性能损失。
arXiv 研究指出,编码 Agent 评测常只看模型名和通过率,却忽略 harness/scaffold 对工具调用、上下文管理和停止策略的影响。作者在多个开源框架上比较 Qwen 3.6 Plus 与 MiniMax M2.5,说明不同脚手架会显著改变性能与效率排名。
提出 MIITA,通过记忆机制让小语言模型在推理阶段适应不断变化的任务,避免直接更新有限参数带来的灾难性遗忘,并针对小模型存储与上下文能力受限的问题改进持续学习效果。
论文提出面向HPC遥测与时间序列的语义基础模型思路,指出现有方法多依赖固定且匿名的传感器变量,难以适配任务或指标变化,目标是为数据中心与算力节点构建更通用的数字孪生。
论文提出 DeepLens Diagnosis Agent 五阶段诊断流水线,将事实抽取、知识检索、差异分析与最终判定分工处理,用流程约束弥补小型医学推理模型的短板,在诊断任务上逼近前沿 LLM。
论文提出 HeraSys,用细粒度端到端优化协同服务多条 LLM 工作流,重点挖掘跨工作流的共享与调度机会,弥补现有方案只优化单个工作流的局限,以提升高并发、多租户 agentic 场景的吞吐与延迟表现。
论文提出 ParBench,用于评测大模型和代码智能体在并行代码翻译中的可靠性,重点检查是否保留 CUDA、OpenMP、OpenCL 等低层并行语义,弥补现有方法难以判断行为等价的问题。
这项研究指出,传统RAG只按语义相似度排序检索文档,忽略来源可信度。作者为不同来源引入可靠性先验lambda(s),用sim(q,d)×lambda重加权检索分数,以提升检索结果的稳健性与可解释性。
TriSP提出一种面向大语言模型的结构化剪枝方法,通过三类信号评估注意力头和MLP神经元的重要性,删除整块结构以生成更小的稠密模型,兼顾标准硬件上的推理效率与模型性能。
论文提出基于概念的视觉反事实解释方法,利用扩散模型生成逼真编辑,回答「若要改变模型预测,图像最小需改哪里」。相比依赖外部分类器的传统方案,它旨在减少对噪声图像分类器的脆弱依赖,提升安全场景可部署性。