来自该信源的全部动态 · 共 55 条
中国AI创业公司智象未来发布HiDream-O1-Image-1.5模型,在AI图像生成领域再次实现全球SOTA水平。该公司在半个月内两度问鼎全球榜单,显示国内团队在图像生成赛道的竞争力显著提升,对海外主流模型形成挑战。
清华大学与腾讯联合提出 MBench,一个专门评测视频世界模型长期记忆能力的基准。该基准系统性地定义并量化了当前主流视频生成模型在时序一致性、物体持久性等维度上的记忆边界,揭示了现有模型在长视频生成中记忆衰退的关键瓶颈,为后续改进提供了明确方向。
蚂蚁集团提出MiniAppBench,专门评估大模型生成交互式小程序/迷你应用的能力。研究发现当前模型每生成6个交互应用仅约1个能真正满足用户需求,暴露了代码生成在复杂交互场景下的短板。该工作已被ICML 2026接收为Spotlight论文,为AI生成前端交互应用提供了标准化评测框架。
阿里推出免费AI高考志愿填报智能体,旨在用AI弥合志愿填报中的信息差。该Agent已为约40万考生提供服务,帮助其匹配院校与专业。文章探讨AI在教育决策场景的落地效果,以及能否真正解决信息不对称问题。
研究提出 DRDD 方法,重新审视扩散模型中噪声的角色,发现其可作为域协调器用于统一图像翻译。该方法无需针对不同翻译任务设计独立架构,通过噪声调控实现跨域图像转换的统一框架,为图像到图像翻译提供了新的理论视角和技术路径。
跨维智能将自动驾驶领域成熟的BEV(鸟瞰图)表征技术迁移至具身智能,旨在解决机器人训练数据稀缺和标注成本高的瓶颈。该方案借鉴自动驾驶数据工程的经验教训,通过跨域技术复用让机器人数据生产进入Scaling通道,避免重复自动驾驶早期的数据困境。
Anthropic被曝在用户使用Claude进行前沿大模型研发相关任务时,主动降低模型输出质量。官方确认实施了干预措施以限制Claude在处理涉及前沿LLM开发请求时的有效性。此举引发AI研究界强烈不满,研究者批评这种做法损害了工具的可靠性与信任基础,质疑商业模型对学术研究的隐性限制。
openJiuwen推出SwarmFlow框架,主打多智能体蜂群协同的可控编排能力。核心思路是将任务编排逻辑交由系统层处理,让Agent专注于智能决策与执行,降低多Agent协作中的混乱与不可控性。目前仅机器之心单一信源报道,具体技术细节与开源情况待进一步确认。
上海创智学院与上海交大联合提出MINT方法,针对视觉-语言-动作模型(VLA)泛化与迁移能力不足的问题,让模型不再仅学习模仿轨迹,而是理解底层行为意图,从而获得可迁移的行为结构表征。该工作已被RSS 2026接收,在跨场景、跨任务迁移上展现出强泛化能力。
美团推出一款具备Agent能力的AI浏览器,可自动完成网页端重复性操作流程,如填表、数据抓取、多步骤任务执行等。产品定位为效率工具,宣布永久免费。这是国内大厂在浏览器+Agent方向的又一落地尝试,体现了AI Agent从对话向实际操作演进的趋势。
Anthropic正式发布Claude Opus 4(代号Fable),为其最强推理模型。该模型在编码、数学、多步推理等基准上表现显著提升,但API价格相比前代翻倍。Opus 4定位于复杂任务场景,面向需要深度推理能力的开发者和企业用户。
UIUC、Meta、斯坦福研究者深度解析Agent Harness概念——当Agent被置于长期任务环境中,真正串联推理、行动、反馈、验证与协作的底层操作对象。文章以Claude Code为切入点,探讨Agent在复杂任务中如何通过Harness机制实现持续执行与环境交互,为理解当前代码Agent的架构设计提供理论框架。
探讨将推理(Reasoning)能力引入推荐系统的方法论。文章指出推荐场景中的推理并非简单复制LLM的思维链范式,而需要针对推荐任务的特性进行适配设计,涉及如何让模型在用户偏好建模和物品匹配过程中实现更深层次的逻辑推断,提升推荐质量与可解释性。
PRISM 提出一种并行化的多步记忆写入范式,将「写入前思考」引入线性注意力模型。该方法允许模型在更新记忆状态前进行多步推理,突破了线性注意力单步写入的表达力瓶颈,同时保持了线性复杂度的推理效率。实验验证了这一范式在提升线性注意力模型能力方面的可行性与有效性。
OpenAI研究科学家Noam Brown提出观点:当前AI能力的上限远未被触及,核心瓶颈在于推理时计算成本过高。以测试时计算(test-time compute)扩展为例,若投入千万美元级算力,模型表现可能远超现有基准,但这一成本使得真正的能力天花板几乎无法被实际验证。该观点对理解Scaling Law的持续有效性具有参考意义。