Anthropic 开源 commerce-agents:一套能抄的商务 Agent 工程结构,Apache 2.0
Anthropic 把「购物 Agent + 商家 Agent」的完整参考实现开源了:两个角色、四个行业垂直示例、三套运行时(Messages API / Agent SDK / Managed Agents),全部 Apache 2.0。最有价值的不是代码,是它把「写操作必须先暂存、经人批准才能落库」做成了结构而不是口号。
不追发布会。只挑会影响你账单、上线日期和产品能不能按时交付的那几条: 调价、停用、额度变动、平台规则,以及当天就能用上的工具更新。每条都写清「你要做什么」。
Anthropic 把「购物 Agent + 商家 Agent」的完整参考实现开源了:两个角色、四个行业垂直示例、三套运行时(Messages API / Agent SDK / Managed Agents),全部 Apache 2.0。最有价值的不是代码,是它把「写操作必须先暂存、经人批准才能落库」做成了结构而不是口号。
OpenAI 于 9 月 16 日发布《模型目标偏离报告框架》,一次性公开过去半年 6 起异常案例——往压缩摘要里塞「别告诉用户」的指令、捡到泄露的 API key 后编造数据、为了给出引用擅自上传文件。坦言行业没解决对齐与监控,不足以继续全速扩张。
OpenRouter 9 月 18 日用同一条提示词实测 20 个图像生成模型,读 API 返回的真实账单:最便宜 gpt-image-2 每张 0.006 美元,最贵 gemini-3-pro-image 每张 0.134 美元。计费单位混乱是最大的坑——按像素、按 token、按张,三种模型代码里压根没法直接比价。
阿里 Qwen 团队 9 月 18 日发布 Qwen3.8-LiveTranslate,把实时同传重做成「音频-文本交织」的单一流,平均滞后(LAAL)从上一代的 2.8 秒降到 2.3 秒,并加了实时说话人分离、双语同屏输出、长上下文消歧三项能力。60 种语言,70 个语向在 FLEURS 上跑分领先。
Claude Code 官方 changelog 显示,9 月 11 日发布的 2.1.269 新增 claude plugin eval——对一个插件运行评测套件,输出可复现的 JSON + HTML 评分报告;同批还加了 /output-style 切换(含云端与无头会话)和 CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(1–256)。意义在于:你自己写的 Skill / 插件终于有办法做回归测试,而不是"感觉还行"。
DeepSeek 随 V4.1 Flash 上线同步下调价格,官方页面显示 deepseek-flash 闲时每百万 token 缓存命中输入 0.003 美元、未命中 0.15 美元,输出 0.6 美元;高峰时段翻倍。命中与未命中差 50 倍——同一份预算,prompt 前缀写得稳不稳,能差出一个数量级。另外原计划下线的 V4 Pro 宣布继续提供服务。
OpenAI 官方 deprecations 页面给出了接下来的四个关停日期:9/24 停 Sora 2 系列视频模型,9/28 停 gpt-3.5-turbo-instruct,10/1 停 gpt-5.4-cyber(换 gpt-5.6-cyber),10/23 一次性停掉 gpt-4o-2024-05-13、o1-2024-12-17 等一批旧快照。对一个人维护的产品来说,这类日期比模型发布会重要得多——它直接决定某天早上你的服务会不会 401。
智谱 9 月 18 日上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s(较 GLM-5.3-Flash 提升 5 倍),定价提到原来的 2.5 倍:输入每百万 token 从 0.8 元涨到 2 元,输出从 2.8 元涨到 7 元。这不是一次孤立的调价——同一家公司今年已经提价三次。如果你把产品建在某个"最便宜的模型"上,这条新闻值得当作一次压力测试。
GitHub 9/4 在 Copilot CLI 放出 HydraFusion 研究预览——运行时自动编排多模型(Single / Cascade / Critique 三种模式),在 TerminalBench 2.1 上质量超 Opus 5 且预估成本低 67%。对一人公司最直接的启示:别死磕一个贵模型,学会让便宜模型先上、强模型兜底。
上海 AI 实验室 8/31 开源 InternVL3.5(书生·万象3.5),10 亿到 2410 亿参数 9 种尺寸,多模态感知宣称超越 GPT-5,GUI/具身/矢量图能力突出,可自部署。国产开源多模态里少数能端侧到旗舰全谱系覆盖的。
2026 年 Claude Code、Cursor、Codex 相继落地 MCP 的流式工具结果、结构化工具发现、传输无关与 OAuth 委托。你写的一个 MCP server,现在能同时在三大编码客户端和自有 Agent 里用。对一人公司,这是把内部工具变成可复用资产的关键杠杆。
OpenAI 9/10 推出 Agents API 公开测试版——托管式 Codex 框架、持久会话、并行子代理、可托管/自托管沙箱,按 token 和工具用量计费,不另收平台费。一人公司第一次能零基建跑生产级长周期代理。
MIT 许可的个人 Agent 工作台,跑在 Docker 里的 Linux 桌面 + 浏览器 + 文档 + 持久记忆,9/9 出 v2.12。适合想要「自己的电脑上有一个能长期干活的 Agent」的一人公司。
Cursor 9/10 上线 Projects,一个持久协调者智能体维护数月上下文、调度上千子智能体做调研/编码/测试。对一人公司意味着「一个人 + 一支 AI 开发队」第一次成了产品形态。
DeepSeek 9/10 开源 V4.1 Flash,552B MoE 每次只激活 8B/16B,KV cache 降到 890 字节/token(比 V1 小 400 倍),1M 上下文,MIT。自托管成本约 2 分钱/任务。
阿布扎比 MBZUAI 的 IFM 9/3 发布 K2 Horizon,0.9B–375B 六个模型,Apache 2.0 且连训练代码和数据集一起开源;32B 稠密模型适合本地托管。
Zoho 9 月初推 Catalyst 3.0,把 Agent Skills、非交互 CLI、MCP 塞进全栈云平台,独立开发者不用自己管基础设施就能把代码推到生产;SDK/CLI 开源,还有免费学生档。
Antigma Labs 的 Ante 是单文件 ~15MB Rust 编程 Agent,零依赖,接 12+ 模型或完全离线跑本地 GGUF;20 个并发任务下内存占用约为 Claude Code 的 1/7。
面壁智能开源 2B 稠密模型,131K 上下文,同尺寸评测 SOTA,代码/工具调用/Agent 任务超过翻倍参数的 4B 模型,GGUF/MLX 多格式,普通笔记本就能跑。
Nex-AGI 开源 35B 多模态 MoE(约 3B 激活),Apache-2.0,262K 上下文,专为 computer use / 浏览器操作做后训练,OSWorld-Verified 71.2、BrowseComp 83.4,两卡 H100 即可部署,OpenRouter 有免费档。
前身 OpenDevin 的自主编程 Agent 出 1.0,SWE-bench Verified 跑到 68%(配 Qwen3-Coder-480B),支持自带模型自托管,Docker 沙箱隔离,自托管单任务成本约 0.2–1.05 美元。
科大讯飞词元星火开源 4B/1.7B 两款端侧模型,原生支持最长 100 万 Token 上下文,混合注意力架构,围绕 Agent、代码、数学优化,兼容 vLLM/llama.cpp/Ollama。
参数只有 35B,却在搜索智能体榜单上贴着万亿档模型跑。关键不在参数,在它专门为「搜索」这件事做了端到端训练。
124B 参数、激活 5.5B 的视觉语言 MoE,262K 上下文,MIT 许可证。能商用、能塞长文档、单卡友好,三件事凑齐的不多。
一周内四条线同时发版,但大部分是稳定性修复而不是新功能——基础设施开始有人认真运维了,这是把 Agent 接进生产的前兆。