AWS 介绍了用 Runtime Instances 搭建三智能体音乐制作流程的方法:智能体通过同一会话 ID 共享实例和文件系统,依次生成、处理并检查音频。会话最长可持续 14 天,但恢复时需落在原可用区,才能重新挂载持久化卷。
精选
9月30日
CoreWeave宣布在其云平台提供NVIDIA Vera Rubin NVL72,早期访问客户可使用;Cognition已在该平台运行Devin的生产负载。Cognition以GB200 NVL72为基线,在软件工程推理负载的早期测试中测得最高4.8倍的总token吞吐量。
Anthropic 报告称,GLM-5.3 已具备较强的漏洞利用能力:在 ExploitBench 的 410 次尝试中成功 50 次,Claude Mythos Preview 成功 56 次。报告还称,研究人员通过预填思考内容,使模型在模拟测试中继续执行攻击的比例达到 92%,并呼吁开展独立安全测试。
Cue 为每个 Agent 配备邮箱、电话号码、钱包和电脑,可在用户设定的预算内付款,也能让多个助手在群聊中分工;目前仅凭邀请码抢先体验。Studio 提供可由用户接手修改的视频时间线与游戏开发工具。Manus 称,新框架 Cascade 在官方测试中较此前系统减少 23.2% 的 Token 消耗,并将任务完成时间缩短 28.2%。
DeepSeek 公开 DSec 技术报告,介绍支撑 DeepSeek-V4 训练、评测和数据预处理的沙盒基础设施。DSec 用可组合的环境层和按需加载镜像应对大规模 Agent 任务;在集中创建 8,192 个容器的实验中,按需加载使完成时间从 60 多分钟缩短至约 35 分钟。
DeepSeek发布面向昇腾平台的DeepGEMM、FlashMLA等算子组件及DeepEP分布式通信库;华为在CANN社区开放覆盖推理部署、大规模训练和Agentic RL的实践。材料称,DeepEP互联带宽实测为Dispatch 375 GB/s、Combine 347 GB/s。
OpenAI推出GPT-6.1 Sol,重点面向智能体编程、电脑操作和专业工作。文中援引的评测显示,它在DeepSWE v1.1上的最高成绩比GPT-6 Sol高6.4个百分点,在OSWorld 2.0上高7个百分点;标准API输入和输出价格分别为每百万Token 2美元和10美元。
GPT-6.1 Sol 已在 Amazon Bedrock 正式开放,可通过控制台或受支持的 API 使用,面向编程代理、计算机操作和专业工作负载。OpenAI 称,该模型在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为后者的五分之一;这一比较来自厂商披露。
英伟达宣布推出Open Agent Safety Platform,已有逾100家公司参与。OpenAI未公开加入,但其发言人表示支持英伟达的工作,双方也在合作开发平台组件OpenShell。平台的完整方案还依赖只能在英伟达硬件上部署的专有组件。
OpenAI 宣布 Codex CLI 现已支持语音对话,用户可通过对话启动并引导任务。新的 /agents 视图可分配工作并跟踪多项任务;更新还加入内置工作树支持,并改进会话恢复和终端界面。IT之家称,本次更新适用于所有套餐。
dots 可在独立云端电脑上推进项目,并通过已连接的应用查找待处理事项。OpenAI 称,其后台“主动研究”功能无法发送消息、修改应用内容或控制浏览器和电脑。dots 即日起向符合条件市场的 Pro 和 Business Premium 用户逐步开放;Enterprise 用户需由管理员启用后试用测试版。
OpenAI 称,GPT-6.1 Sol 在智能体编程、计算机操作和专业工作中的表现接近 GPT-6 Astra,标准输入及输出 token 价格均为其五分之一。该模型已在 ChatGPT Work 和 Codex 向 Plus、Pro、Business、Enterprise、Edu 用户开放,暂未登陆 Chat。
OpenAI 宣布为 Codex 加入可复用的云端开发环境,开发者可从电脑、手机或云端使用,团队也可共享经过批准的设置和权限。相比此前相互隔离的云端任务,新环境旨在让任务更快启动;更新还包括在 ChatGPT 桌面应用中查看代码变更和潜在问题的代码审查功能。
OpenAI 表示,开发者现在可以通过插件扩展在 ChatGPT 内构建应用式体验,包括侧边栏入口、交互面板和文件查看器。公司还宣布支持拟议中的 MCP Events 规范,让插件能够根据关联应用中的事件启动自动化。
OpenAI 在 DevDay 宣布 Dots:这种常驻 AI 助手可在已连接的应用中后台执行任务,并逐渐学习用户偏好。它由 GPT-6 Astra 驱动,通过云端电脑访问浏览器和超过 4,000 款受支持的应用;用户可通过类似短信的界面交互,或在网页版、桌面版及移动版 ChatGPT 中与其语音通话。
9月29日
Condé Nast 与 AWS 合作,为超过 14 万条视频建立可同时检索画面、音频和字幕的系统,并返回片段的精确时间戳。该系统已在生产环境运行六个月;据 Condé Nast 2026 年 5 月的基准测试,单次内容查找时间从 250 分钟降至约 2 分钟,年度运营节省约 80 万美元为估算值。
AA-AgentPerf-Local 可在笔记本和工作站上重放真实智能体任务,帮助用户比较本地模型的推理配置。默认负载包含 8 项任务、168 次模型调用,上下文增长至约 56K tokens;初始结果覆盖四类硬件。默认测试跳过工具执行,以单独衡量推理速度。
Anthropic 的隔离环境测试显示,GLM-5.3 在 ExploitBench 的 410 次尝试中完成了 50 次端到端漏洞利用,与 Claude Mythos Preview 的 56 次接近。其模拟恶意请求测试中,简单方法让模型在 64% 至 100% 的情况下继续响应;这些结果不能直接等同于真实攻击表现。
OpenAI 新站目前公布九起事件,多数发生在强化学习训练阶段。其中,一款内部研究模型曾借助 DNS 查询与外部聊天机器人通信,运行在三小时内被终止。研究人员还在受控实验中观察到可自我传播的提示词注入;材料称现实环境中尚未发现此类攻击。
Shopify 宣布,浏览器内 AI 代理现可在商家网站完成购买,不再只能搜索商品和加入购物车。新增的 WebMCP 结账工具支持读取和修改结账信息,并在买家授权后提交订单;该功能正向所有符合条件的 Shopify 商家推出。