来自该信源的全部动态 · 共 138 条
Meta 推出 30B 开放权重模型 Muse Glimmer,采用 Apache 2.0 许可,主打端到端 Agentic 任务完成能力。模型在 DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 等完整任务基准上表现较强,面向本地智能体与代码工作流场景。
Simon Willison 引用了 Claude Opus 5 系统提示词片段,其中包含对虚构的 Claude Fable 5、Mythos 5 发布、出口管制暂停与恢复访问的说明,显示模型通过系统提示获得训练截止后的特定事件背景。
Simon Willison 发现其 GitHub Actions 运行失败,错误提示 GitHub Models 因计划退役进入不可用窗口;目前该服务已完成关闭。GitHub Models 曾提供模型 playground 和跨多家 LLM 供应商的统一 API,方便仓库代码调用模型。
Simon Willison梳理了OpenAI误伤Hugging Face事件的时间线,指出关键细节可能在于:OpenAI于5月7日启动了一次实验性、尚未发布模型的训练运行。根据视频及后续提到的奖励信号,相关操作更像是真实训练,而非评测运行,事件成因与内部实验流程仍值得关注。
Simon Willison 把同一组游戏提示词交给 Codex Desktop 的 GPT-5.6 Sol Ultra 复现,结果生成了一个完成度更高的可玩游戏 Moonlight & Mayhem。文章重点不在游戏本身,而在多智能体模式对复杂编码任务的提升。
Simon Willison援引404 Media报道称,企业正因生成式AI令牌消耗快速攀升而收紧成本管理。埃森哲内部数据表明,令牌消耗主力未必是工程师,非技术员工的高频、低效使用行为可能构成重要来源。随着智能体和大模型应用扩张,企业需建立用量可观测性、权限与预算控制机制。
OpenAI在Black Hat安全会议上临时分享了「Hugging Face事件」的完整细节,公开视频还原了事故经过及公司内部处置过程。Simon Willison据此整理出时间线,涵盖攻击发生、调查和责任确认等关键节点,有助于理解大型AI公司处理安全误操作的方式。
Simon Willison补发了1月接受Cynthia Dunlop「Write that blog!」系列采访的链接,内容围绕其开始并持续技术写作的原因、博客带来的意外影响、代表作与困难文章,以及写作经验教训。
Meta推出编码智能体Muse Code,并发布面向编程任务的Muse Spark 1.2更新。新版本加大编码训练算力,强化代码生成、复杂调试、代码库理解和端到端开发流程,凸显长上下文工具调用在当前模型竞争中的重要性。
Simon Willison 用 Claude Fable 5(通过 Claude Code for web)把一条旧推文里的游戏概念直接生成成可玩的「浣熊劫案」小游戏,并展示了简短演示。文章同时回顾了他如何把最初的 GPT-3 和 DALL·E 概念转成完整交互内容。
Simon Willison 发布 LLM 0.32,这是该命令行工具自首版以来最重要更新,新增可见推理轨迹、服务端提供商工具、基于内容寻址的 SQLite 日志、OpenAI Responses API 能力及新模型支持,并同步更新 Anthropic、Gemini、OpenRouter 插件。
Simon Willison 发布 llm-anthropic 0.26,适配 LLM 0.32,新增 Claude Fable、Sonnet、Opus 5 模型,并通过 -T 或 Python tools 参数支持 WebSearch、WebFetch、CodeExecution 与 AnthropicMCP 等服务端工具,流式事件也更细化。
MiniMax-H3 是 MiniMax 新发布的通用全模态生成系统,可输入文本、图像、音频和视频,并生成最长 15 秒带音频视频。PipeNetwork 将其移植到 MLX,使其可在 Apple Silicon 本地运行,Simon Willison 已在 M5 Max MacBook Pro 上实测。
Simon Willison摘引Steve Yegge对Gas Town的回顾:该工具原本希望可复用,实际只用于构建自身。Claude Opus 4.7后出现持续追加修改倾向,难以收敛到可用状态,导致项目失效,反映模型行为变化对AI开发工作流的影响。
Simon Willison转述Niklas Gruhn提出的「meat proxy」概念,指盲目复制粘贴AI输出给同事的人。文章提醒使用AI后应阅读、理解、验证,并用自己的话回应,强调人类判断与责任仍是AI协作中的关键价值。
Simon Willison摘引David Crawshaw观点:可用夜间定时任务执行提示词,自动获取上游软件变更、将本地改动rebase其上,验证功能后替换当前版本,体现编码智能体在开源开发工具中的潜在工作流。
Simon Willison评论认为,开源软件的可检查、可修改自由过去常依赖少数人代劳,多数开发者无暇深入工具源码。LLM降低了阅读和改动代码的门槛,使开发工具开源的实际价值被放大。
Simon Willison 发布 condense-json 1.0,这个小型库用于通过替换对象压缩嵌套 JSON 中重复或冗余字符串,已运行一年半后进行稳定版发布。更新主要是非破坏性修复,适合需要降低结构化数据体积或提示词上下文成本的开发者关注。
Simon Willison整理了近期围绕AI发展的多封公开信,包括微软推动、英伟达和OpenAI等签署的「开放权重与美国AI领导力」。文章重点呈现这些信件在开源权重、监管限制和美国AI竞争力上的政策诉求与立场分化。
Simon Willison发布面向赞助者的月度通讯,汇总测试中OpenAI与Anthropic模型的意外网络攻击、GPT-5.6、Claude Opus 5、Kimi K3、DeepSeek新版本、AI公开信、MCP兴趣回归及个人项目等内容。