来自该信源的全部动态 · 共 981 条
论文提出 LipSSD,将 Lipschitz 约束引入单阶段目标检测,以提升检测器对对抗扰动的鲁棒性。相比依赖对抗训练的方法,该思路强调跨攻击和扰动预算的稳定性,面向安全关键视觉场景。
论文提出面向自主智能体的代理式数据环境框架,将数据库视角扩展到文件、API、应用和系统状态,关注在自动化提速增效的同时限制失败影响,为Agent安全、权限与数据治理提供研究议题。
论文提出ReAct式数学智能体,将LLM推理与SageMath可验证计算反馈结合,并用Context7获取最新文档。研究评测多款前沿模型在研究级计算与实验数学问题上的表现,补足CAS在智能体数学工作流中的系统评估空白。
论文提出将大语言模型推理引入基于智能体建模,弥补传统ABM依赖静态先验、难以适应实时变化的问题。方法面向大规模个体行为预测与政策模拟,探索LLM对人类决策建模的可扩展混合框架。
论文提出 Large Behavioral Model,将大规模零售交易建模为人-环境交互,学习顾客决策过程,兼顾预测与可解释模拟。目标是构建可提示的零售顾客数字孪生,用于推荐、营销和决策支持。
论文指出人类编写基准会随模型能力提升而饱和,且超人类任务难以由人判断难度与可验证性。作者提出相对测量范式:让模型生成公开挑战以区分其他系统,并汇总对抗结果形成心理测量式评分,用于评估超人类能力。
论文综述2024至2026年1250篇arXiv文献,梳理AI参与自身改进的不同路径,包括输出修订、部署中工具链适配、合成数据训练与自动化AI研究,指出现有自精炼、自奖励、自博弈、自进化等术语混用,需按目标与自主性重新分类。
论文提出 InductWave,面向知识图谱上的多跳逻辑查询回答,重点解决现有 EFO 查询方法多依赖传导式推理、难以处理训练中未见实体的问题。研究聚焦更贴近真实动态知识图谱的归纳场景。
论文提出PCBWorld,一个基于KiCad EDA引擎的开源PCB布线环境。智能体可通过原生操作交互式布线,并利用设计规则检查反馈约束结果,旨在评估和推动学习型方法在真实工程规则下的PCB自动化设计能力。
论文研究预测市场中「预测准」与「交易赚钱」的关系。作者指出经典理论只在特定自动做市商机制下成立,而主流中央限价订单簿中,知情预测者可能亏损,非知情策略也可能获利,需重新刻画机制条件。
论文提出面向LLM生成设计结构矩阵(DSM)的黑盒评测框架,用结构化技术文档输入,对比模型生成矩阵与人工验证真值矩阵。方法旨在解决闭源Auto-DSM流程难复现、难量化的问题,为工程设计中的LLM能力评估提供基准。
论文面向音视频自动抑郁检测中模态特征重叠、决策边界不稳的问题,提出细粒度多模态框架,结合时序编码器与互信息式Transformer进行跨模态融合,并设计二分类优势加权排序损失,在潜在空间建模抑郁严重度以提升二分类判别。
论文讨论在社会科学与人文学科中,将知识图谱与多语种学术语料结合,用于构建领域自适应LLM。重点关注文献发现、综述生成中的学科差异、多语访问、结果评估及监管挑战,并介绍欧洲项目中的进行中用例。
论文聚焦语言智能体长程任务训练中的在线策略蒸馏低效问题,指出完整轨迹 rollout 会在尾部轮次浪费算力且提供噪声较大的 KL 监督,并提出轮次感知的 TurnOPD 框架以提升训练效率。
论文提出 StateFuse,一种面向多智能体系统的冲突感知复制记忆契约,基于标准 OpSet/CRDT 合并,不发明新代数,而提供不可变历史、显式冲突和可审计语义,避免分支、重试、副本中的观察差异被覆盖规则隐藏。
论文提出基于信息增益的Rollout策略优化方法,用自适应树结构为多轮LLM智能体分配推理预算。该方法评估中间状态效用,将计算集中于高价值分支,面向长程搜索任务中传统强化学习rollout低效的问题。
论文提出 FirstResearch,一种面向科学发现 LLM Agent 的研究问题生成框架,强调从第一性原理显式呈现机制、可证伪点与假设,帮助科学家审计初始问题的可信度,降低看似合理但不可检验的生成风险。
论文提出Prompt-to-Paper,一个面向生物信息学的智能体论文生成系统,强调将论断可验证地锚定文献、真实执行实验而非编造结果,并引入多维评估框架衡量AI生成手稿的质量与严谨性。
论文展示 TOFFEE,一个学习式系统,用于在给定数据环境中规模化合成高质量数据智能体轨迹。其目标是覆盖复杂分析工作流,缓解现有数据智能体在异构企业数据与未见流程中泛化不足的问题,可服务于训练、评测等下游任务。
论文评估LLM与VLM从自然语言生成参数化3D机械零件CAD的能力,构建97个工程设计问题基准与统一评测流程,并介绍LLMForge多模型文本到CAD生成框架,用于比较模型在几何、约束和可制造设计上的表现。