来自该信源的全部动态 · 共 981 条
该论文提出 FORCE-Bench,用于评测企业金融场景中的智能体系统,包含基准、数据集与评测框架。它聚焦事实准确、可追溯依据和金融工作流执行等要求,弥补通用基准难以衡量真实业务能力的不足。
论文关注LLM苏格拉底导师在多轮压力下逐步放弃引导、直接给出答案的「脚手架崩塌」问题,提出通过表征对齐抑制内部表征漂移,相比提示词、偏好优化和过滤等输出约束更早干预。
论文关注LLM多智能体系统中的跨智能体恶意指令注入问题,指出攻击策略会针对防御持续演化,正常智能体行为也会随系统扩展漂移。OpenEvoShield试图将部署视为开放世界场景,提供持续适应的防御框架。
论文提出一种逻辑引导的数据抽取框架,将LLM用于从非结构化文本生成候选关系事实,再用答案集编程进行验证与全局一致性约束,以提升复杂组合推理场景下的抽取可靠性,降低冲突事实和幻觉影响。
论文指出,LLM 置信度评估不能只看校准度,因为它可能容纳不连贯估计且受分布影响;作者转而形式化“连贯概率信念”的条件,为更可靠的不确定性评估提供框架。
该论文提出Euclean,将几何题自动形式化到Lean并用统一验证流程对接Mathlib,针对现有几何系统依赖专用DSL、自定义公理且与标准库不兼容的问题,降低可信计算基,推动代数、数论与几何的统一形式推理。
论文提出ITPEval,用于评估Lean 4、Rocq、Isabelle和HOL Light之间的自动形式证明翻译,覆盖不同逻辑基础。该基准瞄准证明生态割裂问题,可帮助衡量模型迁移已验证结果与扩展训练数据的能力。
论文提出随机原对偶解码方法,用于生成式推荐系统中的多目标列表构建,在相关性之外同时处理物品属性约束、公平性等目标。该方法将约束优化融入解码过程,避免传统后处理在生成式场景中的适配不足。
论文提出「提升表示假说」:LLM并非只记住孤立事实,而是通过共享的潜在结构更新记忆;这种结构化记忆可解释模型如何在实例间迁移、选择并修正规则。作者还用实例间对称性解释这种压缩机制,并讨论其对可解释性、记忆编辑和提示设计的意义。
论文提出SFgen,利用多模态大模型构建电子元件符号与PCB封装的智能体识别和生成流程,旨在减少工程师手工建库、画原理图的耗时与错误。其在符号生成等任务上报告较高准确率,面向EDA自动化场景。
论文提出GraphContainer,用于统一比较和调试Graph RAG方法。该平台针对现有框架图结构格式不兼容、检索行为难以细粒度可视化的问题,提供标准化容器与分析工具,帮助评估多跳问答中的图检索过程和性能差异。
论文关注LLM智能体跨会话长期记忆中的多跳关联能力,指出现有基准多停留在单跳回忆。作者提出MemHop基准,覆盖10个社交网络场景、1000个1至5跳问题,并给出逐跳证据标注;同时提出Profile-Graph Memory方法,以画像和图结构支持跨实体隐式检索。
论文综述民航场景中的边缘智能,指出云端大模型在飞行、塔台、机坪和维护等环节面临高延迟、离线不可用、隐私与数据主权风险,并梳理边缘AI的部署范式、关键技术和安全关键应用。
研究提出 AdaRoPE,指出不同功能的注意力头不应共享同一 RoPE 频率与缩放。作者在简化检索任务和长度泛化场景中结合理论与实验表明,按头定制频率范围与注意力缩放可改善效果。
这篇论文提出用稀疏自编码器提取LLM隐空间特征来学习安全分类约束,替代原方法中按类别反复搜索约束数K。在Qwen3.5-9B上,12/14类别以K=2效果最佳,BeaverTails基准分类准确率达96%-99%,显著降低调参成本。
论文提出 HyGRL,用于提升检索增强模型回答多实体组合问题的能力。该框架将非结构化文本嵌入结构化知识图谱,构建异构网络,以缓解标准 RAG 缺少动态推理、传统 Graph-RAG 结构稀疏,以及由 LLM 构图成本过高的问题。
论文研究无范围德州扑克自回归模型中的隐状态含义。模型只用行动与价值目标训练,不直接学习对手手牌或范围;结果显示,在控制行动/价值后,部分种子仍能探测到对手范围信息,但这不足以证明模型真的维护了后验信念分布。
论文提出CrackedPDFs,用于评估文档型LLM系统在PDF扁平化处理后识别隐藏提示注入的能力。基准含4,983份基础文档生成的29,322个PDF,覆盖9,774个注入样本及良性、混淆对照样本,并评测PromptGuard与规则基线。
论文提出FraudShield AI,将LSTM与人工设计的图拓扑特征结合,用于识别洗钱中的拆分交易、分层等复杂模式。方法同时建模交易时间序列与关系网络结构,针对0.13%欺诈率的极端类别不平衡和对抗规避场景评估鲁棒性。
论文提出 FORMULASPIN,一种面向自然语言到电子表格公式生成的自博弈微调框架,可在不增加标注数据下迭代提升模型,突破静态监督微调的数据瓶颈,并分析普通 SPIN 在该任务上的失效原因。