来自该信源的全部动态 · 共 981 条
论文提出一种面向低通道 EEG 分析智能体的边界感知上下文锚定方法,将传感器可测范围、软件已实现算法与结果可支持结论显式纳入上下文,降低 LLM 在稀疏脑电数据上越界推断和误用工具的风险。
论文关注文本分类与大语言模型评估中常见的召回率、精确率等指标只报告点估计的问题,指出其受抽样波动影响且不确定性估计方法常不匹配。研究面向嵌套数据等场景,讨论更合适的性能不确定性估计方法,有助于提升分类评估可信度。
论文提出 COrigami,一套面向计算折纸的 AI 协同设计流程,尝试同时满足平折叠几何约束与视觉可识别性。该研究把生成式 AI 用于受严格数学规则约束的物理艺术设计,展示了在创意生成、结构可行性与审美目标之间进行联合优化的思路。
论文提出一套LLM驱动的大规模治理话语分析管线,结合自动标注、神经主题建模和多层网络分析,用于研究AI智能体互操作协议背后的社会技术权力结构,并在两类标准案例上验证。
论文指出,大模型在道德困境的标准链式思考中常出现利益相关者遗漏与不确定性压制。作者提出NoT系统提示,将推理组织为主角、相关方、两步后果、不确定性与承诺五段,以改善可撤销伦理推理。
论文提出PMDformer,用于长期时间序列预测。其核心是补丁均值解耦,将趋势信息与残差形状分离,以缓解不同变量和补丁间尺度差异对形状相似性建模的干扰,面向能源、金融、交通等预测场景。
论文提出MKG-RAG-Bench,聚焦多模态知识图谱增强生成中的检索瓶颈。作者指出现有RAG基准较少覆盖异构多模态知识、跨模态对齐和结构化图谱检索问题,旨在为MKG-RAG检索器评测提供更贴近实际的测试框架。
论文提出将漂移扩散模型引入 Elo 评分,利用棋局逐步信息和走子质量加速棋力评估,缓解仅依赖胜负结果导致的响应滞后,同时应对局面空间庞大与噪声问题,面向国际象棋匹配和评级优化。
论文提出临床AI技能与Clinical Harness运行时治理架构,用于注册、编排、防护和监控AI驱动的临床能力。以骨质疏松为例,展示知识驱动、数据驱动和物理增强技能如何支持可追责的生命周期护理。
论文介绍开源EEG智能体NeuraDock Agent的可复现实操流程,覆盖安装、预处理、质控、Alpha动态可视化、Rest/Task视觉认知负荷比较,以及公开小数据集复现实验,面向实时应用验证。
论文以CORE-Bench为例讨论基准准确率饱和后的评测价值,指出不应简单淘汰基准,而应继续分析捷径、分布外泛化、效率、可靠性、模型与脚手架贡献及人机协作增益等维度。
论文讨论非智能体预言机在预测未来事件概率时的自指问题:答案被知晓并采取行动后会改变原概率。作者批评反事实提问会削弱实用性,并尝试用格论构造无偏、规范的集值预言机框架。
论文综述多模态大语言模型评估现状,指出现有基准多聚焦孤立任务,难以衡量模型是否真正跨文本、图像、音频、视频等模态整合信息。作者梳理评测方法与基准缺口,强调需面向跨模态推理、真实场景和更可靠指标。
论文研究n×n网格点构型的组合几何极值问题,针对精确求解器组合爆炸、强化学习稀疏奖励与Transformer二次Token开销等瓶颈,提出结合几何结构的蒙特卡洛树搜索方法,以提升严格全局约束下的搜索效率。
论文研究指令微调聊天模型中「顺从人格」与拒绝机制的耦合,发现人格方向会门控拒绝方向。在Qwen2.5-7B-Instruct和Llama-3.1-8B-Instruct上干预表明,强化顺从人格可显著抑制拒绝,提示安全对齐存在更上游控制变量。
这篇 arXiv 论文尝试用简单数学形式解释库兹韦尔的「加速回报」命题,讨论计算、AI、脑科学和生物技术等领域如何相互强化,推动科技进步呈近似指数增长,并将其与科学发现中的定性机制联系起来。
论文提出 auto-psych,用智能体自动生成心理学假设、设计实验并分析数据,试图打通理论发现到人类数据收集的闭环。其重点在计算认知科学场景,利用可代码化理论和众包平台降低实验自动化门槛。
论文比较大型推理模型与人类在难题上的用时模式,区分跨题难度登记与同题审慎分配。结果显示模型答错同题时消耗更多token,人类答错时反而更快,提示现有LRM的坚持并不等同人类式元认知调节。
论文关注精神科用药信息检索,提出知识增强的Agentic AI思路,尝试整合监管不良事件记录与患者叙事,同时区分权威证据和个人经验,以降低误读、恐惧、安慰剂反应及不依从风险。
论文提出一种迭代数据生成流程,用于构造更清晰的对比样本,帮助激活转向方法识别与模型谄媚行为相关的线性特征,并进一步实现检测和抑制。研究关注可解释性框架对数据质量的依赖及行为控制可靠性。