来自该信源的全部动态 · 共 981 条
论文针对城市洪涝建模中的细粒度降雨重建问题,指出雨量计、微波链路、雷达/卫星网格等观测具有不同空间支撑。作者提出几何感知图融合方法,将点、路径、面域约束纳入异构图建模,以更一致地融合多源降雨观测。
论文研究客服智能体从对话走向退款、取消、改签等后台执行后带来的服务控制问题,提出按请求难度路由的控制机制,在保持常规服务低摩擦的同时,对高风险或指令不清场景触发重新考虑,以降低操作错误。
论文提出 Janus,用于实现和评估用户参与的智能体权限管理方案。研究聚焦自主工具调用场景下用户应如何介入授权、监督与决策,为智能体安全、可控执行和权限交互设计提供实验平台。
论文提出DRL-CLBA,用DDPG强化学习构造面向语音分类的清洁标签后门攻击,在不篡改样本标签的情况下植入触发器,降低人工数据审查可发现性。研究聚焦语音模型安全评估与后门防御挑战。
论文针对稀疏激活MoE语言模型中路由专家存在结构化冗余、缺少下游校准数据时难以剪枝的问题,提出Generic TB-Coverage,以覆盖感知方式选择保留专家,减少单一重要性评分对主导校准模式的偏置。
论文提出CreativityNeuro,一种无需数据的对比式权重调控方法,用于提升大语言模型在开放问题中的发散思维能力,缓解反复生成相似答案的「人工蜂群」和模式坍塌现象,并在多项创造力评测中验证效果。
论文针对企业SaaS中LLM调用API易漏字段、幻觉工具和过早停止的问题,探索将可验证奖励强化学习直接用于Atlassian工作流工具使用,评估其能否弥合下一个词预测与实际执行目标的错配。
论文研究同一数据在不同分析选择下如何导向不同结论。作者让AI智能体扮演不同研究者人格,在四个高风险领域复现实证研究中的分析差异,并显式呈现隐藏分叉路径,显示仅改变persona就可能产生相互对立结论。
论文面向云端 AI 系统的故障恢复,提出用神经符号世界模型验证大模型生成的恢复计划,旨在弥合语义推理与策略优化之间松散耦合的问题,提升云服务在复杂故障场景下的安全性、适应性与可验证性。
论文扩展 SOLiD 方法,用测谎器筛选需高成本标注者复核的 LLM 回答,以降低欺骗行为监控成本。实验覆盖更大模型和更真实的偏好学习场景,发现随模型规模增大,未检测到的欺骗比例显著下降,支持可扩展监督路线。
论文讨论在FHIR临床环境中用可验证器提供「世界反馈」训练协议执行智能体。作者审计MedAgentBench v1/v2,指出反馈通道和基础能力不足会限制RL效果,并揭示静默完成等评测缺陷,为医疗智能体基准与训练设计提供诊断依据。
论文研究多来源心电部署中无法保留或回放原始ECG时的持续学习问题。方法冻结ECGFounder骨干,为各数据源配置独立分类器以避免参数干扰,并重点分析在缺少来源元数据时如何自动选择专家,区分专家保留与来源推断两个环节。
论文提出程序记忆蒸馏,针对RLVR和SDPO等只利用单次验证奖励、忽视推理过程复用的问题,让模型在训练中在线反思并保存跨回合的程序性经验,用于后续策略更新,旨在提升语言模型自我改进效率与泛化能力。
论文提出 Wiola,一种从头设计的小语言模型架构,声称不继承 GPT、LLaMA、Mistral 等现有结构。其核心包括三维螺旋位置编码 SRPE、门控等五个新组件,目标是在小参数规模下提升效率与表达能力。当前为 arXiv 新稿,仍需实验复现与同规模基线验证。
论文提出 Auto-FL-Research,用受约束的编码智能体自动探索联邦学习算法设计空间,覆盖优化器、聚合规则、本地训练、归一化、正则化与模型结构等选择,旨在降低人工试错成本,并提升候选改动在训练和评估路径上的公平可比性。
论文重新审视有限监督下的思维链推理,定义半监督思维链学习,并提出Semi-CoT框架,将模型生成的推理轨迹从推理提示扩展为可复用训练信号,旨在降低人工标注依赖并提升LLM推理能力。
论文用Lewis信号博弈研究两个LLM智能体如何从零形成共享语言,比较五类记忆架构与不同信道配置。结果显示,记忆设计比信道容量更关键;持久私有笔记本可利用冗余容量,并避免高容量下的协作崩塌。
论文提出一个全自动管线,用多智能体LLM从反应数据中生成可验证规则,为合成规划提供确定、可解释且可自扩展的反应分类标签,试图解决长尾化学导致人工规则维护困难和固定规则集难适配的问题。
论文提出PHREEQC-MCQ-200,用于评估接入工具的大模型智能体在确定性水地球化学模拟中的可靠性。基准含21个验证场景衍生的200道选择题,考察智能体构建并调用PHREEQC、诊断计算结果的能力。
论文关注自主实验室中AI智能体提出实验方案后,如何在多仪器、不同容量与吞吐等硬件约束下高效排程与执行。作者提出两步方法优化资源利用,面向真实实验设备场景,补足实验建议与实验落地之间的调度问题。