来自该信源的全部动态 · 共 981 条
论文提出OPTScientist,用多智能体方法自动发现用于Transformer预训练的类型化优化器程序,试图在灵活搜索与有效性约束间取得平衡,覆盖优化几何、状态动态、数值稳定和实现限制等因素。
论文指出,LLM水印多在通用基准上验证,而医疗文本中细微词元扰动可能改变临床语义。作者系统评估水印在医疗文本中的可追踪性、文本质量与潜在安全风险,为临床AI生成内容治理提供依据。
论文提出SonicSampler,将LLM推理中的logit处理、token选择和推测解码验证整合为tile感知CUDA内核,减少多次kernel启动,支持批内异构采样与动态服务负载,并提升CUDA Graph执行效率。
论文提出DecodeShare协议,用于在KV缓存推理中识别LLM解码阶段隐藏状态里跨任务共享的低维子空间,并通过仅在解码时移除该子空间检验其因果作用,帮助理解多任务能力在生成阶段的通用表征机制。
该论文关注LLM在政治新闻问答中的事实错误与意识形态偏移,提出可复现测量框架,将文档问答中的无依据陈述视为意识形态漂移信号,并基于21727篇专家标注的美国政治新闻文章进行分析。
论文研究如何约束自回归大模型生成,使其在代码、SQL、JSON等形式语言任务中保持语法有效。方法面向LR(k)上下文无关文法,探索将模型蒸馏到更易控制的层级结构,以降低受约束生成的计算复杂度。
论文提出 VeriSimpl,面向自然语言到优化求解器公式的自动建模。其核心是通过简化式验证检查 LLM 生成的模型是否真正符合任务意图,而不只是不报错运行,旨在提升优化建模接口的可靠性与可用性。
论文指出LLM长上下文能力受表征坍塌限制,并将其分为注意力汇聚导致的同质化坍塌与局部注意力造成的隔离坍塌。作者用注意力谱分析解释成因,提出拓扑正则化侧路径以维持连通性并缓解秩退化。
论文提出EvoSQL,将Text-to-SQL建模为生成器与评审器的迭代协同进化过程。框架维护上下文化候选记忆,并结合执行验证、错误诊断与定向修正,以提升复杂数据库查询中的多步推理和SQL生成可靠性。
论文提出CRAWO,用自定义资源支持边缘智能场景下AI流水线的自适应工作负载编排,面向异构边缘设备能力差异、低时延与带宽约束等问题,旨在提升智能城市实时应用的部署灵活性与资源利用效率。
论文评测在Intel TDX环境中使用NVIDIA H100进行机密GPU推理的性能影响,对比非机密执行与机密计算模式,关注大模型服务在处理敏感输入、保护模型资产时的吞吐、延迟和部署成本,为安全推理基础设施选型提供数据。
论文讨论主动推理中的复杂推理,认为其核心并非递归信念建模或树搜索,而是在规划时域内实现闭环决策,使未来动作依赖未来状态与观测,并可由认识论先验的变分自由能框架统一表示。
论文提出Spectral-LSH,一种无需训练的长提示压缩方法,在输入模型前用Krylov子空间与随机特征近似注意力核主成分,避免显式构建O(N²)注意力核,目标是降低长上下文prefill成本。
论文提出「Chronos漏洞」概念,系统化描述有状态自主智能体因长期记忆与时间持久性带来的安全风险,涵盖记忆注入、跨会话欺骗与企业工作流自动化中的攻击面,为Agent安全评估提供分类框架。
论文提出一套透明的 SAE 特征 steering 流程:先用六项可靠性条件筛选稀疏特征,再以 F 检验等三类统计量的无权 Borda 共识排序,替代单一标准或学习式目标,提升激活空间行为控制的可解释性。
论文提出信息辨别概念,衡量大模型接入互联网等外部知识时,是否会根据信源可靠性和事实接近程度调整信念;并发布Learn2Discern框架与基准,基于三条规范公理给出可解释指标。
论文提出LISA线性索引稀疏注意力,面向DeepSeek-R1等长链式思考模型的长上下文推理成本问题。其目标是在测试时扩展场景下降低标准自注意力O(n^2)计算开销,缓解长序列推理部署成本,为长CoT模型高效推理提供新思路。
论文提出NEXUS,一个面向工具调用LLM智能体的结构化运行时安全监控器。它结合确定性安全规则、参数级检查和校准风险评分,并按形式化干预策略在放行、阻断、请求确认、请求修改间决策,以降低高影响动作风险。
论文提出 FineServe,用于刻画全球多模型 LLM 在线服务的真实负载。研究关注请求波动、模型异构、延迟与吞吐约束,弥补以往依赖代理 trace 或粗粒度统计的不足,为推理调度、容量规划和服务系统优化提供数据基础。