来自该信源的全部动态 · 共 981 条
该研究借鉴神经科学中「印迹」概念,提出几何框架在深度神经网络中定位类似生物记忆单元的结构。将特异性、再激活、充分性和必要性四项神经科学判据形式化为约束逆问题,并推导出闭式估计器以分离单个记忆痕迹,为理解深度学习模型的内部记忆机制提供了新的理论工具。
该研究针对多智能体协作中缺乏标准信任度量的问题,提出基于「代价性验证」的行为测量方法。在合作生存游戏中,验证队友输出会消耗资源,而盲目信任错误答案可能致命。通过与无记忆基线模型对比,验证频率的降低可作为信任形成的可观测信号,为多智能体系统治理提供量化依据。
论文提出APEX框架,将AI Agent的自我改进从单一提示词优化扩展为三层结构:提示词、行为原则与工作流决策规则的联合自演化。相较于仅优化prompt harness的Self-Harness方法,APEX通过挖掘运行经验自动提取并更新多维度策略,面向生产环境中Agent的持续自我提升,补充了当前自改进研究中行为原则缺失的短板。
LLM产品持续评估依赖LLM裁判作为基准,但裁判模型本身可能因API静默升级或提示词变更导致评分漂移,使告警无法区分是产品退化还是裁判变化。本文提出利用固定的人工标注锚集,通过随时有效统计检验将评分漂移归因到产品端或裁判端,解决评估管道中的归因歧义问题。
论文指出现有深度研究智能体训练数据过度依赖搜索导向的封闭式问答,难以覆盖长程规划、证据收集、推理与报告生成等完整研究流程。S1-DeepResearch 提出超越单纯检索的训练范式,构建面向复杂知识密集型任务的长程研究智能体,旨在提升智能体在真实开放性研究场景中的综合能力。
前沿推理模型在深层演绎任务上仍表现不佳,且通过延长内部推理提升性能的成本扩展性差。该研究提出PrologMCP,基于MCP协议为LLM智能体提供标准化的Prolog逻辑编程接口,使模型可将问题翻译为形式化表示后委托符号求解器执行推理,避免了现有自动形式化管道针对特定任务的定制化集成问题。
该研究将定向广告系统建模为属性推断的噪声预言机,分离了投放谓词、曝光、交互和披露四个环节。当用户交互与广告投放活动保持关联时,广告主可获得绑定到具体用户(而非聚合报告)的观测信号,由此推断用户属性。该模型刻画了这一信息泄露渠道的边界条件与隐私风险。
论文提出CogGuard框架,针对边缘智能服务中的主动预警需求,结合主体长期静态属性与短期动态状态构建结构化画像,利用大语言模型的长上下文推理能力从历史交互日志中提取特征,在严格时延和隐私约束下预测主体能否成功完成即将到来的任务,为边缘场景下的服务质量保障提供新思路。
本文提出迄今为止最强的端到端科研自动化系统「The AI Scientist」,目标是让AI自主完成从构思、实验到论文撰写的完整研究生命周期。此前社区已在科研流程的各独立环节取得进展,但贯穿全流程的自主系统一直缺失。该工作展示了系统在自动化整个科研过程方面的最新能力边界。
针对多模态临床数据中模态不平衡与分布偏移问题,提出基于基础模型的跨模态表示对齐框架,将CT影像与纵向电子健康记录(EHR)通过各自领域基础模型独立编码后在共享潜在空间中对齐,用于生存时间预测任务,具备跨任务和跨机构泛化能力。
论文提出Dr-DCI方法,解决智能体在大规模语料库搜索中的局限性。传统检索接口(BM25/ColBERT)仅暴露排序结果或有限文档视图,限制了智能体跨文档重组材料和验证约束的能力。直接语料库交互(DCI)通过可执行的Shell操作暴露语料库,而Dr-DCI进一步引入动态工作区扩展机制,使该方法可扩展至大规模场景。
论文提出FactoryLLM,一个安全、开源的AI实验平台,用于评估基于大语言模型的检索增强生成(RAG)方案在智能工厂场景中的表现。该平台针对制造业故障诊断与恢复任务,解决关键信息分散在多台互联设备手册中的难题,为工业领域LLM应用提供标准化评测环境。
论文提出YeasierAgent,一种基于共生智能体、叙事世界和场景感知交互的应用构建范式。它挑战传统设备耦合的软件模型,将应用重新定义为用户、智能体与世界之间的协作空间。系统架构实现两个核心贡献:支持跨平台快速构建Agent原生应用,并通过意图驱动的创作方式降低开发门槛。
论文提出将超维计算(HDC)应用于表格数据嵌入的结构化查询场景。现有方法将行、列或整表映射到向量空间后依赖最近邻搜索做候选匹配,缺乏可解释性且无法支持结构化条件过滤。该工作利用HDC的组合代数特性,在嵌入空间中实现可解释的结构化查询操作,服务于实体标注、模式匹配、列类型检测和表搜索等数据集成任务。
该研究针对开放车间调度问题(OSSP)提出一种基于Transformer编码器-解码器架构的调度策略,结合深度强化学习进行训练。传统精确方法在大规模问题上难以处理,启发式方法需大量调参,本文方法旨在兼顾求解质量与可扩展性,为工业和服务场景中的调度优化提供新的神经网络求解思路。
该研究对比了两类消除安全微调模型拒绝行为的技术路线:基于差异均值(DiM)的激活加法与方向消融,以及基于迭代零空间投影(INLP)的零空间投影与反事实翻转。实验在五个开源权重模型上进行,探讨拒绝行为是否仅由残差流中单一线性方向介导,还是存在更复杂的多方向结构。
论文提出HarnessX框架,将AI智能体的运行时harness(提示词、工具、记忆、控制流)视为可组合模块,支持自适应演化。现有harness多为手工搭建且静态,每换模型或任务需重新搭建脚手架,执行痕迹也未被系统性回馈优化。HarnessX提供一个foundry式架构,使harness组件可拼装、可从运行数据中自动蒸馏改进,降低智能体工程的重复劳动。
研究者提出Poker Arena——一个基于无限注德州扑克锦标赛的LLM评估平台,设计三层记忆架构(手内、会话内、跨会话)与九轴能力评估体系,旨在突破现有博弈基准将异质推理能力压缩为单一标量的局限,系统性地揭示前沿LLM在不确定性下策略推理的能力结构与差异。
该研究以Grothendieck消失定理的半自动形式化为案例,指出大语言模型虽能在交互式定理证明器中消除所有sorry(未证明占位符),但专家评审发现定义不当、定理泛化不足、文件组织混乱及API设计缺陷等严重问题。论文强调「编译通过」与「可复用库贡献」之间存在本质鸿沟,对LLM辅助数学形式化的质量评估标准提出反思。
论文提出风险感知因果门控(RACG)框架,将最小权限原则引入LLM智能体决策。该框架结合因果效应估计与校准风险控制,对模型预测进行执行、延迟或放弃的三级门控决策,建模从候选动作到结果的因果路径,旨在减少学习型组件在高置信但错误输出时引发的下游代价性失误,为智能体安全提供形式化能力最小化机制。