今日亮点

最新更新

精选 3 条关键更新,点击可跳转到正文

今日精选资讯3

Perplexity Portable Computer 上线 Windows:本地 Agent 跑在 RTX 上,不耗云端额度

智能代理
来源:Perplexity 官方博客·
查看原文
事件内容

Perplexity 于 2026 年 9 月 14 日在官方博客宣布,Portable Computer 已进入 Windows 版 Perplexity 应用,面向要把敏感文件和长流程留在本机的 Pro / Max 用户(个人与企业套餐均可)。此前 8 月先在 NVIDIA DGX Spark(Linux)上线;本次把本地 Agent 编排扩到符合条件的 Windows RTX 电脑。亦见于 NVIDIA 博客。

  • 本机跑什么:官方写明,Portable Computer 在用户自己的硬件上跑本地模型,处理敏感文件与本地工具,不必把这层工作送上云,也不消耗 Computer 额度;可跑循环任务和长工作流。Windows 版把 Computer 的本地 agent harness 与编排器加进现有 Windows 应用。
  • 怎么开:从 Microsoft Store 安装 Perplexity for Windows,在模型下拉里选要下载的本地模型,一键拉取。官方要求本机推理使用 NVIDIA GeForce RTX 或 RTX PRO,显存至少 24GB
  • 云端怎么接:官方定位仍是本地优先;需要更强研究/推理时可以升到云端,NVIDIA 渠道稿补充须先征得用户同意再把信息送出设备。具体云端模型名单与计费,以应用内为准。
  • 核对范围:一手以 Perplexity 当日博客为准。NVIDIA 稿举例本地模型「如 Qwen 3.8 27B」,8 月 DGX Spark 公告则同时写 Qwen 3.8 27B 与后训练的 PPLX 27B——Windows 当天到底预置哪一款,打开应用内模型列表再确认,本文不把渠道举例写成已核实清单。DGX Station 支持 NVIDIA 写明即将推出,尚未给日期。
资讯解读

个人 Agent 要进办公电脑,真正过关的是「敏感材料不出设备、长任务不烧云端额度」。Portable Computer 把编排器放到 Windows RTX 上,等于把「本地优先、必要时再上云」从 DGX 工作站扩到更多开发机。先确认你的卡是不是 24GB 档,再决定要不要把报税、合同、代码仓库从云端对话里挪出来。

谁将受益
已有 24GB 档 RTX、并订了 Perplexity Pro/Max 的知识工作者

适合先拿一份不能上传的合同或本地仓库试「全程本机」。建议对照云端 Computer 看质量差在哪,再决定哪些流程留下、哪些仍升云。

安全 / IT

可把「本机推理 + 升云须确认」当成评估其他桌面 Agent 的对照。上线前仍要核显卡型号、企业套餐是否开放,以及应用对文件夹、连接器的授权范围,不要把 NVIDIA 稿里的连接器名单当成已对你账号生效。

GitHub Copilot Auto 可选成本/质量三档:同一套模型,按任务偏好改路由

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 14 日在 Changelog 宣布 Copilot 自动选模型新增三档:efficiency(效率)、balance(均衡)、intelligence(智能),面向已在用 Auto 的开发者,用来告诉路由「更在意省钱、均衡,还是质量」。官方文档把带任务优化的 Auto 标为在 GitHub 网站 Chat、VS Code、Copilot CLI 与 Copilot app 正式可用。

  • 三档怎么偏:Efficiency 优先压成本,适合快而直接的任务;Balance 同时权衡成本、质量与延迟,适合日常;Intelligence 优先质量,面向复杂任务。三档用的是同一组可用模型。Auto 仍会逐条评估提示词——官方举例:即便选了 Intelligence,给已有函数加 docstring 仍可能落到小而省的模型。
  • 怎么计费:按 Auto 实际选出的模型计费,与所选档无关。付费订阅在 Auto 用量上继续享受 10% 折扣。文档写明路由会卡在自然的缓存边界上换模型,避免会话中途切换把缓存打掉。
  • 哪里能选档:Changelog 写明三档正在 VS Code、Copilot CLI 与 GitHub Copilot app 滚动放出。文档加了一句:档位仅这些客户端有;网站 Chat 虽有带任务优化的 Auto,但没有这三档开关。JetBrains / Eclipse / Xcode / Visual Studio 上的 Auto 目前是「按健康度与可用性选模型」,不是这套成本/质量档。
  • 策略边界:Auto 不会用你套餐没有的模型、管理员策略排除的模型、以及数据驻留 / FedRAMP / Evaluation 策略禁止的模型。个人套餐用户可随时关掉评估模型。悬停回复(Chat)、终端(CLI)或模型选择器旁可以看到实际用了哪颗模型。
资讯解读

Auto 不再只是「帮你挑一颗模型」,而是让你先选成本口味,再让路由按每条提示词微调。真正要改的工作流是:默认日常用 Balance,把 Intelligence 留给架构和排障,把 Efficiency 留给补注释和改文案——而不是把三档都开成 Intelligence 再奇怪账单为什么没降。

谁将受益
已在 VS Code / Copilot CLI / Copilot app 用 Auto 的开发者

升级后先看本机有没有三档开关。建议用同一条「加注释」和一条「重构模块」对照 Intelligence 与 Efficiency 实际落到哪颗模型、花了多少,再改团队默认档。

工程效能 / 账单负责人

10% 折扣只作用于 Auto 用量。先确认组织模型策略没有把便宜模型全挡住,否则 Efficiency 档也省不下来。JetBrains 用户先别等这三档,他们这边仍是可用性路由。

Bedrock AgentCore 上线托管 Consent 门户:用户 OAuth 授权不用再自建回调

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 14 日发文(Announcements),面向已在 Amazon Bedrock AgentCore Gateway 上用三方 OAuth(3LO / 授权码)的团队:AgentCore Identity 现提供托管 Consent 门户和会话绑定端点,终端用户可先登录公司 IdP、再按服务逐项授权,应用不必再自建授权页与公网回调。官方开发者文档同步给出控制台与 CLI 配置步骤。

  • 以前缺什么:走 3LO 时,客户得自己展示授权 URL、托管公网 HTTPS 回调、辨认回跳用户、管浏览器会话,再调 `CompleteResourceTokenAuth`。新门户把浏览器跳转和会话绑定收走,令牌进 AgentCore Identity 的 token vault。文档写明令牌留在服务端,浏览器不持有 token。
  • 谁在用:官方点名 IDE / MCP 客户端(Kiro、Claude Code、Cursor、VS Code)尤其合适——用户可在调工具前先授权,后续调用复用已存令牌。示例是开发助手同时接 GitHub(列仓库、建 issue)与 Slack(列频道、发消息),两套授权互相独立。
  • 管理员做什么:每个 Gateway 只能建一个门户且创建后不能换 Gateway。需准备:带 JWT 入站授权的 Gateway、公司 IdP 的 OIDC 应用(至少 `openid`)、GitHub/Slack 等出站 OAuth 应用、以及门户执行角色。门户 Active 后给出 URL,形态为 `https://<id>.consent-portal.bedrock-agentcore.<region>.amazonaws.com`;把 `/callback` 登到公司 IdP,把 `/connect/callback` 设成各 3LO target 的默认回跳。
  • 审计与边界:CloudTrail 可看 `GetResourceOauth2Token`、`CompleteResourceTokenAuth`、`GetWorkloadAccessTokenForJWT`。提供方若没发 refresh token,过期后用户要回门户再授权。这是 AgentCore Identity 的托管能力,不是新的通用 OAuth 标准发布日。区域、配额与报价请打开 AgentCore 控制台与定价页再写进变更单。
资讯解读

Agent 要代用户点 GitHub / Slack,卡住的往往不是模型,而是「授权页谁来托管、令牌怎么绑回这个人」。AWS 把会话绑定收成一条可分享的 URL,等于让 IDE 里的 MCP 工具可以先完成企业 IdP + 逐服务同意,再进仓库。先在预发对一个 GitHub 只读 scope 走通,比一上来把发 Slack 的写权限交给门户更稳。

谁将受益
已在 AgentCore Gateway 上接 3LO 的平台团队

适合用来拆掉自建回调。建议先在预发建门户,用公司 IdP 走一遍 GitHub 只读,看 CloudTrail 里会话绑定是否落到正确用户,再对开发者公布 URL。

用 Cursor / Claude Code / VS Code 调公司 MCP 的开发者

收到门户链接后,按需 Connect,不要把 Slack 和 GitHub 一次全开。若工具突然要你重新授权,先查是不是 refresh token 没发下来,而不是先怪客户端。

过去一周精选资讯25

DeepSeek 上线 V4.1-Flash:新架构压低长上下文成本,旧 Flash 已切走

模型平台
来源:DeepSeek 官方 API 文档·
查看原文
事件内容

DeepSeek 在官方 API 文档发布 DeepSeek-V4.1-Flash(News 标注 2026/09/10),面向长上下文与视觉 Agent 团队;Hugging Face 权重近 24 小时仍在更新。官网首页无带日期公告,一手出处是 API News / Change Log / 定价页与模型卡。

  • 规格:官方称这是新架构家族里最小的一款,原生看图。552B 参数 MoE;Causal Encoder–Decoder 非对称激活——输入约 8B、输出约 16B。上下文 1M,最大输出 384K。支持 thinking / 非 thinking,推理强度可在 1–100 连续调节。权重 MIT 许可。
  • 成本结构:官方对比上一代,KV cache 只要约 1/4 HBM、1/8 SSD;模型卡写明全局 KV 约 890 字节/token。缓存命中往往占 Agent 账单大头,压 cache 就是压长上下文费用。
  • 怎么调用:新模型名 `deepseek-flash`。旧名 `deepseek-v4-flash`、`deepseek-v4-flash-vision-exp` 已退役,暂时路由到 V4.1-Flash 并按 Flash 价计费。Flash 支持视觉;V4 Pro 官方定价表写明不支持视觉。并发上限 Flash 2500、Pro 500。官方点名 WorkBuddy(含 CodeBuddy)与 OpenCode 已接好。
  • 定价(官方美元,每百万 token):Flash 非高峰:缓存命中 $0.003、未命中 $0.15、输出 $0.60;高峰为 2 倍。高峰时段为工作日 01:00–04:00 与 06:00–10:00 UTC,其余为非高峰。新定价自 2026-09-10 04:00 UTC 生效。
  • V4 Pro 口径必须再核:News 页仍写「2026-09-14 04:00 UTC 起,`deepseek-v4-pro` 将改走 V4.1-Flash 并按 Flash 价」。但 Change Log 与定价页脚注已改口:应需求,9 月 14 日之后继续提供 V4 Pro,计价不变。上线前以 Change Log / Models & Pricing 为准,不要只看 News 旧句。
资讯解读

DeepSeek 这次卖的不是「又一个更大的 Flash」,而是把长上下文的内存账单砍下来,再用更低的 API 价和新模型名把主力切过去。对已经写死旧 Flash 名称的团队,代码可以先不动、价已经变了;对还在用 V4 Pro 的团队,News 与 Change Log 现在说法不一致——9 月 14 日前必须再打开定价页看一眼,别按过期路由声明做迁移。

谁将受益
用 DeepSeek 跑长上下文 / 看图 Agent 的开发者

先把调用名改成 `deepseek-flash`,再拿一条你们最贵的长上下文任务对账单。建议对照「缓存命中率 × 是否落在 UTC 高峰」拆一周流水,而不是只看标价。

平台 / 推理成本负责人

890 字节/token 和 2500 并发是自建与买 API 都要重算的数字。若你们按 V4 Pro 的显存与并发做了容量规划,先按 Flash 重算一版,再决定要不要把高峰任务挪到非高峰。

GitHub Copilot 代码审查会自动关掉已改完的评论,Lite 档改用多智能体复审

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 11 日更新 Copilot code review,面向已在用 Copilot 审 PR 的工程团队:它会在你改完问题后自动关掉对应评论,并在 Lite 档用多个智能体复审。

  • 自动关闭:你推送的后续 commit 若已处理某条 Copilot 评论,复审时会自动 resolve;没改完的继续开着,避免评论区堆着过期意见。
  • 智能提交说明:一键应用 Copilot 的改代码建议时,不再套默认 commit message,而是按这次改动生成说明。
  • 审得更深:复审现在用上 Copilot SDK 的全套 shell 工具(在 agent 防火墙后),可跑构建、测试、脚本,并向可用工具/API 取证。官方称实验里正面反馈增多,高严重度发现更多、吹毛求疵更少。
  • Lite 改集成:Lite 档不再单智能体单干,而是多个智能体各自看、再合成一份审查。官方实验:高/中/低严重度「被采纳评论」分别多 47% / 31% / 11%,审查成本约降 8%。这些改动只提高审查质量,不改变你怎么发起或接收审查。
资讯解读

代码审查的瓶颈经常不是「AI 会不会提意见」,而是「过期意见清不掉、Lite 档不够深」。GitHub 这次把「改完就关评论」和「Lite 也上多智能体」一起补上,等于让日常档更像能收尾的复审,而不只是多一层噪音。数字来自官方自测,落地前用你们仓库里最吵的那类 PR 试一轮更稳。

谁将受益
日常开/审 PR 的开发者

适合先在一条真实 PR 上试「改完是否自动关掉旧评论」。若评论仍堆着,检查是不是后续 commit 其实没覆盖那条反馈,而不是先怪自动关闭。

工程负责人

Lite 档成本约降 8%、高严重度采纳变多,值得拿一周的审查数据对照。建议分开看「被关掉的过期评论」和「新出现的高严重度」,避免把清评论当成质量提升。

GitHub Copilot 用量报告正式计入 VS Code Agents 窗口,和企业编辑器 Agent Mode 分开算

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 11 日宣布 Copilot 用量指标正式纳入 VS Code Agents 专用窗口,面向企业主、组织主和账单管理员,用来看有多少人真在用独立 Agent 窗口、用得有多勤。

  • 企业/组织汇总(1 天与 28 天):新增可选字段 `daily_active_vscode_agent_users`(当日独立活跃用户),以及 `totals_by_vscode_agent`(`session_count` 与 `total_user_messages`)。
  • 用户级报告:新增 `used_vscode_agent`(是否用过该窗口),以及每用户的 `totals_by_vscode_agent`。
  • 边界:只覆盖 VS Code Agents 专用窗口,与编辑器里的 Agent Mode、通用用量汇总分开。没有数据时字段保持缺省或 `null`,兼容旧报表。
  • 谁能看:企业 owner / billing manager、组织 owner,以及被授予 `View Copilot Metrics` 的自定义角色;且必须先打开 Copilot usage metrics 策略。
资讯解读

企业买的是「席位」,真正要管的是「谁在哪个窗口里跑 Agent」。GitHub 把 VS Code Agents 窗口单独记一笔,等于承认编辑器内补全和独立 Agent 窗口不是同一件事——混在一个活跃用户数里,会高估或低估 Agent 采用率。

谁将受益
工程效能 / IT 管理员

先确认 Copilot usage metrics 策略已开,再把 `daily_active_vscode_agent_users` 和编辑器 Agent Mode 对照看。建议抽两个团队比一周:窗口活跃高但合并 PR 没变,多半是在试用,还不是工作流。

关注 Copilot 账单的负责人

用户级 `used_vscode_agent` 适合用来找「开了席位却几乎没进 Agents 窗口」的账号。先别据此回收席位,先问是不是被策略或安装渠道挡住了。

AWS 示范用 AgentCore Evaluations + DevOps Agent 盯生产多智能体:质量分和基础设施要分开看

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 11 日发文,面向已在 Amazon Bedrock AgentCore 上跑多智能体的团队,用一套航空订票演示说明:生产事故经常看起来像「Agent 变笨」,根因却可能是权限或限流。

  • 两层监控:AgentCore Evaluations 对线上对话抽样,用 LLM-as-a-Judge 打 helpfulness / correctness / goal completion,并解释低分;AWS DevOps Agent 在出事时自动拉 CloudWatch、跨服务追 IAM / Bedrock / 运行时,给出根因与修复建议。
  • 为什么难盯:演示用 Swarm——主管只做入口,专家之间动态交接、共享工作记忆,没有固定调用图可埋点。一次「西雅图→波士顿→迈阿密 + 伴侣券 + 差旅政策 + 金卡升舱」要并行查航线、读会员、再按顺序下单。
  • 怎么接:观测数据从 AgentCore runtime 经 OpenTelemetry 进 CloudWatch;质量分也进同一处。事故可通过签名 webhook 交给 DevOps Agent。完整 CDK 与仪表盘在官方样例仓库,并指向 FAST(Fullstack AgentCore Solution Template)里的 Evaluations 指南。
  • 核对范围:这是官方 how-to 与参考实现,不是新产品发布日。AgentCore Evaluations、DevOps Agent 的区域、采样比例与报价,请打开对应产品页再写进运维手册。
资讯解读

多智能体上线后,最容易误判的是把「质量失败」和「基础设施失败」看成同一件事。AWS 这篇把尺子劈成两把:一把看 Agent 有没有帮用户办成事,一把看 IAM / 限流 / 链路有没有在沉默中坏掉。对已经有 CloudWatch 却仍靠战情室排障的团队,这比再加一块模型分数更值钱。

谁将受益
Agent 平台 / SRE

先在预发抽 5%–10% 流量打质量分,看低分是不是总落在同一种工具选错。基础设施侧则拿一次「空响应」演练,看 DevOps Agent 能不能把它连到缺失的 IAM,而不是只丢一条 500。

业务负责人

看板全绿、订票却变少,往往是路由或提示词漂了,不是服务器挂了。建议把「任务完成率」和「错误率」分成两列周会指标,避免只拿可用性当 Agent 好用的证据。

AWS 给出在 AgentCore 上托管 MCP Apps 的做法:同一套交互卡片可进 ChatGPT 与 Claude

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 11 日发文,面向要把业务做成「带界面的 MCP 服务」的团队,示范如何用 Amazon Bedrock AgentCore 托管 MCP Apps:在 ChatGPT、Claude 等支持该扩展的宿主里渲染同一套 HTML 卡片,而不是只回纯文本。

  • 协议与平台:MCP Apps 给 MCP 加上可交互 HTML 小组件;AgentCore runtime 提供按会话隔离的无服务器 MCP 宿主,AgentCore Gateway 露出单一安全端点。样例「Unicorn Rentals」可浏览、预订、查看与归还,官方写明在 ChatGPT 与 Claude 里体验一致。
  • 请求怎么走:宿主先 `tools/list` / `resources/list`;用户一句话被译成 `tools/call`(如 `list_unicorns`)。有 `_meta.ui.resourceUri` 的工具会再 `resources/read` 取自包含 HTML,在沙箱 iframe 里渲染。业务逻辑在独立 Lambda + DynamoDB,MCP 层只做协议适配。
  • 生产注意:Gateway 前可加 WAF(IP 白名单、托管规则、限流);runtime 用资源策略只允许 Gateway 角色调用。观测走 CloudWatch;非结构化出站文本可用 Bedrock Guardrails。计费按容器时长与调用量。仓库:`aws-samples/sample-agentcore-mcp-apps`。
  • 核对范围:这是官方教程 + 样例,不是 MCP Apps 标准本身的发布日。ChatGPT 需打开 Developer Mode 并登记插件;Claude 走 Connectors。具体宿主是否已对你的账号开放 MCP Apps,请打开各宿主设置核对。
资讯解读

企业服务要进 AI 宿主,争的不再是「谁先做一个 GPT 插件」,而是「能不能用开放协议把同一套工具和卡片送到多个宿主」。AWS 把协议层做薄、业务留在原有 Lambda,意思很清楚:你该投资的是工具契约和小组件,而不是绑死一家聊天窗口。

谁将受益
要在 ChatGPT / Claude 里露出业务界面的平台团队

先用样例跑通 Gateway URL,再把 Unicorn 的 Lambda 换成你们现有下单/查询接口。建议先做只读查询卡,写操作单独加确认与审计。

云安全 / 平台负责人

无鉴权 Gateway + WAF IP 白名单只适合演示。生产必须把「谁能调 MCP」和「工具参数是否二次校验」写成硬条件,别把样例的 No Auth 直接带进正式环境。

Cursor 上线 Projects:协调智能体可并行拆大功能,关电脑也不停

编程开发
来源:Cursor Changelog·
查看原文
事件内容

Cursor 于 2026 年 9 月 10 日在官方 Changelog 发布 Projects(测试版,即日起向全部用户滚动开放),面向要做大功能、迁移或整站交付的开发团队,用协调智能体把长期任务拆给大量子智能体并行推进。

  • 怎么分工:左侧导航进入 Projects。协调智能体自己不写代码,负责规划、把任务派给执行智能体,再把完成件交回给你验收;可按工作量并行拉起所需数量的子智能体。
  • 云端不停机:Project 跑在独立的云电脑上,合上笔记本也不会中断。需要本机测试时,协调智能体会再拉起本地智能体。
  • 共享上下文:每个 Project 维护一套在云端与本机之间同步的文件,智能体会写入调研、产物,以及它对代码库和你偏好的理解。例如有人摸清了某服务的测试方法,后续智能体都能沿用。
  • 订阅信号:可让协调智能体盯 Slack 频道、按日程跑,或跟踪全部 PR;接到信号就行动,不必等你再提示。接到 Slack 报缺陷频道后,可按每条缺陷自动分派。
  • 核对范围:官方写明为 beta、即日起滚动开放。额度、价格、企业管控与地区可用性请打开 Changelog 原文核对后再写进团队规范。
资讯解读

编码 Agent 的产品形态正在从「开一个对话改一段代码」,变成「给一个可持续数月的项目容器」。真正变的是上下文归属:测试方法、代码库约定和你的口味不再每次重讲,而是沉在 Project 里给后来的智能体复用。先拿一个边界清楚的迁移或缺陷队列试一周,比一上来把整条发布火车交给它更稳。

谁将受益
要做大功能 / 迁移的研发团队

适合把「拆任务 → 并行改 → 人验收」从聊天记录里搬进一个长期容器。建议先选一个已有测试网的模块,看协调智能体分派后的 diff 能不能过你们现有 CI,再决定要不要扩到主路径。

平台 / DevEx

可复用的是「共享上下文 + Slack/PR 订阅」,不是「上千子智能体」这个数字。先把报缺陷频道和主仓库 PR 接到订阅上,统计人工接管率,再谈要不要扩大并行度。

OpenAI 推出 Agents API:托管云端智能体,编排与长会话走 Codex 套件

智能代理
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 于 2026 年 9 月 10 日通过官方博客 RSS 发布 Agents API,面向要上线云端智能体的产品与平台团队,把它定位为托管服务,底层由 Codex 套件驱动编排、长会话与工具调用。

  • 官方一句话:用 Agents API 构建并上线云端智能体;托管服务,由 Codex harness 提供编排、长时间运行的会话,以及工具使用。
  • 和「自己拼 Agent 循环」的差别:官方强调的是托管与套件,而不是再发一套提示词模板。适合已经在用 Codex / ChatGPT 工具调用、想把会话和编排交给平台的团队。
  • 核对范围:本次抓取官网正文页被 Cloudflare 拦截,卡片只采用官方 RSS 标题与摘要中的事实。定价、配额、地区、是否对所有 API 层级开放,以及和 Assistants / Responses API 的替换关系,请打开原文核对后再写进架构评审。
资讯解读

智能体竞争已经从「模型能不能调工具」转到「谁把编排、长会话和托管一起交出去」。Agents API 的官方表述就是这条:少自建循环,多把会话寿命和工具调用交给 Codex 套件。落地前先画清你们现有 Agent 循环里哪一段最疼(重连、超时、工具超时),再决定是整段迁还是只把长任务迁过去。

谁将受益
Agent / 平台工程

适合评估「自建循环 vs 托管编排」。建议先拿一条已经能跑通的长任务(过夜批处理或多工具调研)对打现有栈,看会话能否续上、工具失败怎么重试,再谈替换。

要把内部助手做成可上线服务的小团队

官方卖点是少维护基础设施。先确认计费和数据驻留写进合同,再把原型从聊天窗口迁到这条 API,避免只改调用名、不改验收标准。

ChatGPT Work 上线 Data agent:自然语言接公司数据,可出交互仪表盘

商业分析
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 于 2026 年 9 月 10 日通过官方博客 RSS 介绍 ChatGPT Work 里的 Data agent,面向要在对话里用公司数据出洞察的业务与分析岗,强调用自然语言连接数据、发现洞察,并搭建交互式仪表盘。

  • 官方定位:Meet the Data agent in ChatGPT Work——连接公司数据,发现洞察,用自然语言搭建交互式仪表盘。
  • 和「把表格贴进聊天」的差别:官方写的是「接上公司数据」再分析、出仪表盘,而不是一次性粘贴一份 CSV。适合已经在用 ChatGPT Work、希望少走一遍 BI 排期的团队。
  • 核对范围:本次抓取官网正文页被 Cloudflare 拦截,卡片只采用官方 RSS 摘要。支持哪些数据源、权限模型、是否写入源系统、定价与企业管控,请打开原文核对后再对财务口径负责。
资讯解读

企业里「问一句出一表」正在被「接上数仓就能出可点的仪表盘」替代。Data agent 的官方表述把入口放在 ChatGPT Work,而不是再买一套 BI。真正要验收的不是界面漂不漂亮,而是口径能不能对上你们现有的指标表——先拿一个你已经知道答案的问题去测。

谁将受益
财务 / 运营 / 分析岗

适合用来缩短「提数 → 等排期 → 再改一版图」的循环。建议先选一个上周刚出过的周报指标,看它连上数据后数字是否对得上,再决定能不能替代临时看板。

数据与安全负责人

官方只说「连接公司数据」,没在 RSS 里写清驻留和审计。接入前先核数据源白名单、行级权限和导出范围,避免业务侧自己连上生产库。

Amazon Quick 桌面端正式 GA:Mac/Windows 可委派事务,手机只留要你拍板的事

办公增效
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 10 日宣布 Amazon Quick 桌面应用在 macOS 与 Windows 正式 GA,面向企业知识工作者;同期给 iOS / Android 增加活动流,把邮件、日历、CRM 与即时消息收成一份按优先级排列的清单。

  • 桌面能做什么:用自然语言问复杂问题、在后台组装会议简报,并把一个人搭好的仪表盘、智能体与自动化分享给全组。官方强调数据留在客户环境、对话保持私密,审计走 Amazon CloudWatch 与 AWS CloudTrail。
  • 手机活动流:智能体自己能处理的事项从列表里消失,剩下「只有你能拍板」的短队列;会学习关系、优先级与习惯,而不是只按到达时间刷屏。
  • 合规与预览客户:官方写明从第一天起带 HIPAA、FedRAMP、SOC 2、ISO 27001。Southwest Airlines、LabCorp、PGA TOUR 等在预览期使用桌面端,原文引用了他们的内部评价,属客户证言,不是可复现基准。
  • 不是二手转述:这是 AWS 自有助手产品的桌面 GA,不是在转述另一家模型上架。
资讯解读

企业助手要过 IT 这一关,靠的不是更会聊天,而是「数据不出环境 + 审计齐 + 手机只推需要人拍板的事」。Quick 把桌面 GA 和活动流绑在一起卖的就是这条:日常组装交给智能体,判断留给你。先拿一场你自己能核对的客户会预演,看简报口径对不对,再谈全公司铺开。

谁将受益
客户成功 / 销售 / 项目经理

适合用来把「会前扒邮件和 CRM」压成一条指令。建议先对一场你已经手写过简报的会议,对照 Quick 出的版本缺不缺关键数字,再决定要不要改会前习惯。

企业 IT / 安全

官方把 HIPAA / FedRAMP / SOC 2 / ISO 27001 和 CloudTrail 审计写进 GA 声明。接入前仍要核数据驻留区域、身份源和影子 AI 替代范围,不要把预览客户证言当成你们的合规证明。

SageMaker Inference 上线前缀感知路由:同前缀请求打到同一实例,P50 首字延迟最高降 77%

算力与基建
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 10 日为 Amazon SageMaker Inference 实时端点新增 PREFIX_AWARE 路由策略,面向已在实例上打开前缀 KV 缓存的 LLM 服务团队,让带相同提示词开头的请求稳定打到同一台机器。

  • 要解决的错位:vLLM / TensorRT-LLM 能缓存共享前缀,但默认随机路由会把同一段 3000 token 系统提示打散到整个机群,每台都冷启动。新策略按请求开头做亲和,并带过载保护:目标实例满了就改道,扩缩容时只挪一小部分流量。
  • 官方基准(Llama 3.1 70B Instruct,7 台 ml.p5.48xlarge,vLLM 打开前缀缓存):8000 token 共享前缀、持续 1 小时时,P50 TTFT 降 71–77%,P90 降 33–37%,KV 缓存命中率从约 25% 升到逾 80%,吞吐升 15–16%。短对话(ShareGPT 风格 30 分钟)P50 降 13–16%,吞吐只升约 2%。路由本身多 1.3–1.9 毫秒。
  • 怎么开:在端点配置的 RoutingConfig 里设 RoutingStrategy=PREFIX_AWARE,并配置 PrefixLength(1024–65536)与 ConcurrencyThreshold(1–1024)。原生 Invoke 按请求体字节计,OpenAI 兼容 API 按抽出的消息字符计;多租户可用 X-Amzn-SageMaker-Prefix-Aware-Id 或 prompt_cache_key 做隔离。
  • 前提:至少两台实例,且容器侧必须打开前缀缓存。单实例或请求序列化不一致(JSON 空格、键顺序)会让亲和失效。
资讯解读

推理优化已经从「模型里再压一点」走到「路由层别把缓存打散」。共享系统提示、RAG 同一篇文档、多轮历史越长,前缀感知越值钱;短闲聊几乎看不出吞吐变化。先量你们请求开头的真实重合度,再改 RoutingStrategy,比先改实例型号更便宜。

谁将受益
已在 SageMaker 上跑 LLM 的推理负责人

适合 RAG、模板机器人、同一文件上的补全。建议先在预发打开详细可观测性,对同一文档的 100 次问答看 KV 命中率有没有从两成爬到八成,再改生产。

平台 / 成本优化

官方数字来自 Llama 3.1 70B + p5 机群,不是你们的模型。先用现有前缀长度估 PrefixLength,并统一序列化,避免「看起来同一条提示、字节对不上」把流量打散。

Anthropic 发布 2026 年 9 月威胁报告:点名通义、Kimi、DeepSeek 的工业化蒸馏

安全与治理
来源:Anthropic 官方威胁情报·
查看原文
事件内容

Anthropic 于 2026 年 9 月 10 日发布《Detecting and countering misuse of AI: September 2026》,汇总 2025 年 12 月至 2026 年 8 月、由其威胁情报团队识别并打断的滥用,覆盖网络攻击、影响力行动、监控、诈骗、生物误用、常规武器与蒸馏七类。官方写明:除一起非法蒸馏外,这些案例用的是 Claude Haiku / Sonnet / Opus,不涉及 Fable / Mythos。以下数字与归因均为 Anthropic 单方叙述;通义、Kimi、DeepSeek 官网近 24 小时未见带日期回应。

  • 网络攻击趋势:官方称 AI 已压低「国家队 vs 个人」的技能门槛,多数案例里模型不只回答问题,而是编排侦察、利用与窃取;人仍决定目标并复核结果。报告举俄罗斯关联 GTG-20006 等案例,说明检测规则被绕过的速度在加快。
  • 非法蒸馏(官方定义):工业化、隐蔽地抽取模型能力并复制到另一模型,通常靠被盗信用卡、账号与 API Key。阿里巴巴(通义实验室 / Qwen):Anthropic 称为其测过最大的思维链蒸馏,针对 Opus 4.6 / 4.7,用于 Qwen 3.5 / 3.6 / 3.7;2026 年 5–7 月归因逾 1.51 亿 次交互,峰值近 300 万次/天、逾 3500 个欺诈账号。月之暗面:官方称其曾把用户请求悄悄转到 Claude(多数打到 Opus)再把回复显示为 Kimi,并抽取思维链;5–7 月归因逾 2300 万 次,其中 10 天内近 30 万次、约 5380 个账号。DeepSeek:官方称其用类似跨会话回放拆出推理痕迹,并在第三方编码套件流量上把部分用户转到 Opus;2026 年 7 月 14 天内归因逾 1210 万 次。
  • 边界:这是厂商威胁报告,不是法院判决或被点名公司的承认。能力、定价、产品是否上线不在本报告范围内;亦见于 TechCrunch 对同一份报告的转述。
资讯解读

蒸馏已经从「抠几条思维链」变成「百万到亿级账号池 + 跨会话回放」。对用国内模型做办公的团队,风险不只是「模型像不像 Claude」,而是「你以为在和 Kimi / DeepSeek 说话,请求可能被转到另一家」。在被点名方公开回应之前,应把这份报告当成需要交叉验证的指控,同时检查你们的第三方路由和 API Key 有没有被当成蒸馏管道。

谁将受益
安全 / 威胁情报 / 法务

可把「欺诈账号池、固定抽思维链提示、跨会话回放推理签名」写成检测规则草稿。建议对照你们自己的 API 日志看有没有同类固定前缀,而不是直接把点名写进对外稿。

使用通义 / Kimi / DeepSeek 或第三方路由的企业

在厂商回应之前,先核隐私政策和数据处理位置,敏感对话尽量走已签合同的企业端点。不要把 Anthropic 的归因当成已证实的客户数据泄露清单。

Hugging Face 用 Gradio Workflow 重做 AUTOMATIC1111:73 个节点可当 API 与 MCP 用

图像创作
来源:Hugging Face Blog·
查看原文
事件内容

Hugging Face 于 2026 年 9 月 10 日发文介绍 Workflow1111:用 Gradio Workflow 把 AUTOMATIC1111 稳定扩散 WebUI 的大部分能力收成一张工作流画布,面向要在浏览器里拼出图管线、又想直接当 API 调用的团队。

  • 画布上有什么:11 条媒体管线、73 个节点,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测转重绘蒙版、ControlNet 风格标注、去背、PNG Info、图生视频等。节点只有四类:本地 Python 函数、InferenceClient 调模型、调用另一个 Space、读 Hub 数据集。
  • 怎么跑:用 Hugging Face 账号登录或提供 access token,模型调用走你自己的配额。也可复制 Space 改线。约三分之二节点是纯本地 fn(36 个算子里 32 个 fn、22 个完全不联网)。
  • 每个输出都是接口:官方写明画布上的输出节点会生成 REST 端点(文中列举 /image、/edited_image、/png_info 等 9 个),打开 mcp_server=True 后也可当 MCP 工具;调用方在 X-HF-Token 里带自己的 token,Space 不代持密钥。
  • 和 ComfyUI 的官方对照:节点可以跑在你没有的硬件上(Inference Providers / Space);自定义节点就是普通 Python 函数。这是 Gradio 工作流示例,不是 AUTOMATIC1111 官方迁移公告。
资讯解读

出图工作流的交付物正在从「一个只能点的 WebUI」变成「画布 = 类型化 API」。Workflow1111 真正可抄的是「输出节点自动变 REST / MCP」,而不是把 73 个节点原样搬进生产。先复制 Space、只留你们常用的文生图 + PNG Info 两条线,比在本地复刻整张 AUTOMATIC1111 更快验证。

谁将受益
已有 A1111 / ComfyUI 习惯的出图同学

适合用来验证「同一套管线能不能被 Agent 当工具调」。建议先用官方 Space 跑一张你们品牌参考图,再决定要不要 Duplicate 后换成自己的 checkpoint。

要给内部助手接出图能力的工程

可复用「输出即端点 + 调用方自带 HF Token」。先把 /image 接到现有 MCP 客户端看超时和配额,再谈要不要把检测、去背也接进来。

Meta 推出个人智能体 Muse:独立安全虚拟机代办事务,先在美国上线

智能代理
来源:Meta 官方新闻室·
查看原文
事件内容

Meta 于 9 月 8 日发布个人智能体 Muse,面向普通用户与个人效率场景,强调「不只回答问题,而是替你把事做完」。引擎是 Muse Spark;对话入口是独立 App 或 WhatsApp,使用方式按官方说法接近给人发消息。

  • 能做什么:接到目标后帮你做计划、协调时间与资源,并在关 App 后继续干活;需要发邮件或付款时再回来征求批准。官方举例包括填表、订旅行、议价降账单、把 Instagram 收藏的食谱 Reel 变成购物清单。
  • 安全边界:每个用户有一台隔离的 Muse Secure VM,数据与凭证存在这台机器上。同机另有 Sentinel 智能体,Muse 的外网请求须经其批准。Muse 看不到密码和支付方式,凭证进安全存储后才能代填;敏感动作前会征求确认,并提供完整审计轨迹。用户自选连接哪些 App、给多少权限,可随时断开,也可要求它「忘记」已学内容。对话与 VM 内数据不进 Meta 广告系统;可选择不把互动用于训练。
  • 支付:可用 Stripe 的 Link 结账,官方称是首个被 Link 购买保障覆盖的 AI 智能体(符合条件的损坏/丢失、降价、免手续费退货与退货保障);钱包生成一次性卡,不暴露真实卡号。Shop Pay 与 1Password 登录支持「即将推出」。
  • 可用性:正在美国的 iOS、Android 和 muse.ai 推出,随后会上 AI 眼镜。多数常用能力免费,想做更多可订阅。今年晚些时候将推出 Muse Confidential VM:整台虚拟机(含数据与对话)用用户自持密钥加密,连 Meta 也无法读取
资讯解读

个人 Agent 要进日常,真正卡住的不是「会不会聊天」,而是「能不能在隔离环境里替你点按钮、填表、付钱,同时让你随时收回权限」。Muse 把 Secure VM + Sentinel 审批 + 一次性支付卡写成产品默认形态;但它目前只在美国铺开,国内团队先当架构参考,不要按「已经全球可用」去改工作流。

谁将受益
个人效率 / 运营岗

适合先拿「订行程、降账单、整理收藏内容」这类可撤回任务试。建议把权限开到只读邮件或日历,跑一周看审计轨迹是否可接受,再决定要不要给发送和支付权。

安全 / 合规负责人

可把「独立 VM + 外网闸门 + 凭证对模型不可见 + 广告系统隔离」当成评估其他个人 Agent 的对照清单。上线前先确认你们是否允许员工把公司账号授权给消费级 Agent。

GPT-6 Astra 在 Amazon Bedrock 正式 GA:可走 Bedrock API,也可给 ChatGPT Work / Codex 用

模型平台
来源:OpenAI 官方、AWS What's New·
查看原文
事件内容

AWS 于 9 月 8 日宣布 OpenAI 旗舰模型 GPT-6 Astra 在 Amazon Bedrock 正式 GA。OpenAI 原发布页已写明 Astra 将经 OpenAI API、Microsoft Azure 与 AWS Bedrock 提供;本次是云上生产可用性落地。亦见于 AWS 机器学习博客。

  • 怎么调用:可直接走支持的 Bedrock API;也可把 ChatGPT Work 与 Codex 配成使用 Bedrock 上的 Astra。AWS 称适用自主智能体、大规模文档分析、复杂软件排障,以及需要在冲突信息之间做判断的应用。
  • 模型能力(以 OpenAI 一手公告为准):官方定位为当前最强对齐模型之一;计算机/浏览器使用、软件工程与专业交付是主场。上下文窗口在 AWS 公告中写到最多 100 万 input tokens;支持隐式与显式提示缓存(可设断点)。它是首个达到 OpenAI Preparedness Framework Critical 网络安全能力分级的模型,滥用监控可暂停或终止越界活动。
  • Bedrock 侧治理:推理数据默认不用于训练,也不要求把数据分享给 OpenAI。AWS 写明芯片级零运维人员访问、传输与静态加密、IAM 控权、CloudTrail 留痕,可走 PrivateLink VPC 端点。被分类器标记的流量默认由 AWS 保留最多 30 天做滥用检测;需要零留存须通过 AWS 客户团队申请。
  • 未在 OpenAI 官网复核的部分:AWS 公告称 OpenAI 同期为 ChatGPT Work 增加企业插件、把浏览器使用扩到常见业务应用。插件名单、定价、可用 Region 与推理配置请打开 Bedrock 文档与 ChatGPT Work 后台核对,本文不把渠道稿里的插件细节写成已核实能力。
资讯解读

Astra 本身不是今天才发布,今天新的是「已在 AWS 采购与治理体系里 GA」。对已经把工作负载锁在 Bedrock 的团队,这意味着旗舰模型可以走现有 IAM / VPC / 审计,而不必另开一条 OpenAI 直连。先核 Region、功能差集和单价,再决定要不要把 Codex 或内部 Agent 切过去。

谁将受益
已在 AWS 上跑推理的平台团队

可把 Astra 加进现有模型路由,先选一条「长文档复核 / 代码排障」试点,对照直连 OpenAI API 的延迟、缓存命中和账单。Region 与功能以 Bedrock 文档为准,不要假设和 OpenAI API 完全对齐。

用 ChatGPT Work / Codex 的企业开发者

若公司只允许流量走 AWS,现在可以把同一套 Astra 接到桌面端和 IDE。上线前确认管理员是否打开模型策略,以及零留存是否已向 AWS 提出申请。

SageMaker Feature Store 上线 UpdateRecord:可只改单个特征,不必整行重写

模型平台
来源:AWS 机器学习博客·
查看原文
事件内容

Amazon SageMaker Feature Store 新增 UpdateRecord API,面向实时特征与多流水线共用同一实体的团队,允许一次只写一个或多个特征值,不必再 GetRecord → 合并 → PutRecord 整行覆盖。

  • 解决什么:以前改一个 `risk_score` 也要读出整条记录再写回,既多耗读容量,也容易被另一条流水线覆盖——典型的 lost-update。UpdateRecord 做原子合并,未出现在请求里的字段保持原样。
  • 约束:记录必须先存在(不是 upsert),主键不可改,一次最多 100 个特征,特征名必须已在 schema 里。带 EventTime 时,新时间戳必须不早于已存值,否则整单以 HTTP 409 拒绝;省略 EventTime 则只改特征、不推进时间,方便多流水线各写各的字段。
  • 存储格式:内存档(ElastiCache)现有特征组即可用。标准档(DynamoDB)需 `Standard_V2`:新建时指定,或对现有组调用 UpdateFeatureGroup;就地切换不可逆,从未被写到的冷记录会留在旧格式直到被触达。也可新建 V2 组再批量迁移,便于回滚。
  • 治理与价格:新增 IAM 条件键 `sagemaker:IsUpdateRecord` 与 `sagemaker:UpdatableFeatures`,可只允许改非敏感字段。离线库仍会收到完整快照。计费模型与 PutRecord 相同,省的是过去每次更新多出来的读容量。已在所有提供 Feature Store 的 Region 可用。
资讯解读

特征平台一旦被多条实时流水线同时写,整行读写就是事故源。UpdateRecord 把「谁拥有哪个字段」从应用层约定变成了存储层原语,还带上按字段的 IAM。迁移成本在标准档:不切到 Standard_V2,这个 API 用不上。

谁将受益
做实时风控 / 推荐特征的 ML 工程

点击流和夜间批次可以各写各的字段,不必再自己做锁和合并。建议先选一个高频单字段(如交易速率)切过去,对照延迟和丢失更新次数。

ML 平台 / 权限管理员

用 UpdatableFeatures 把身份证号、薪资等字段从更新角色里拿掉。就地切 Standard_V2 前先确认没有回滚预案需求,否则走「新建组 + Feature Processor 回灌」。

GitHub Copilot for JetBrains:企业可集中管沙箱,CLI 也能用 /ide 接回 IDE

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 9 月 8 日更新 Copilot for JetBrains 插件,面向企业管理员与 JetBrains IDE 用户,把沙箱策略收到组织级,并让终端里的 Copilot CLI 能读到当前 IDE 上下文。

  • 企业托管沙箱(公开预览):管理员可集中配置是否启用沙箱,以及文件系统/网络、代理、开发者工具、macOS Keychain 等访问范围。托管限制优先于用户设置,IDE 会锁定被管控件并标明「由组织管理」。沙箱设置页仅在打开 `Editor Preview` 功能开关、或已下发启用/禁用沙箱的托管项时出现。
  • 编码体验:Next edit suggestions 支持跨文件跳转光标;聊天可加入全局文件/文件夹作项目级上下文。新增企业策略诊断,用来确认本机是否真正吃到了组织策略。
  • CLI 接回 IDE(公开预览):在 Copilot CLI 里用 `/ide`,终端会话可读取 JetBrains 的选区、诊断和文件引用。Shell 命令还能用 IDE 终端环境变量和项目配置的 Python 解释器,并激活本地虚拟环境。
  • 同步 GA:Chat 里的 OpenTelemetry 设置对所有用户正式可用。此版本还修了 MCP / Agent 会话的一批稳定性问题(BYOK 持久化、OAuth、空白本地聊天、只读文件误编、自动压缩后聊天无响应等)。
资讯解读

企业要放行 Agent 写代码,第一问往往是「它能碰哪些目录和网络」,而不是模型分数。把沙箱从个人开关收成组织策略,JetBrains 这批重度 IDE 用户才有机会过安全评审;`/ide` 则补上「终端 Agent 看不见你正在看的文件」这个断层。

谁将受益
企业 IT / 平台工程

先打开策略诊断,确认沙箱和网络限制真的下到开发者机器,再决定要不要关 Editor Preview。建议把「禁止出网 + 限定工作区目录」写成默认策略,而不是靠每个人自己勾。

用 IntelliJ / PyCharm 的开发者

跨文件 next-edit 和 `/ide` 能少切几次窗口。升级插件后先看被锁定的沙箱项——那是组织策略,不是插件坏了。

SageMaker 托管 MLflow 同步升级:指标、血缘和生命周期别名可进 Model Registry

模型平台
来源:AWS 机器学习博客·
查看原文
事件内容

Amazon SageMaker AI 上的托管 MLflow 与 Model Registry 同步能力升级,面向实验科学与治理分岗的团队:注册到 MLflow 的模型会自动在 Registry 建 Model Package Group / 版本,并带上训练指标、评估结果、可部署推理规格和血缘。系列第二篇讲跨账号拓扑。

  • 以前缺什么:模型能同步过去,但不带指标、评估和血缘,治理人员无法只在 Registry 里完成评审;生命周期晋级也不能从 MLflow 侧驱动。
  • 怎么打开:创建或更新 MLflow app 时设 `model-registration-mode AutoModelRegistrationEnabled`(默认关闭),并给 app 的 IAM 角色开通建包、打标签和写血缘的权限。插件需 `sagemaker-mlflow>=0.5.0`。
  • 科学家侧:训练后 `log_model` → 可选 `evaluate` 与 `log_inference_specification` → `register_model`。用别名 `sagemakerlifecycle-{stage}-{status}`(如 `staging-pending` / `production-active`)推动预置或自定义生命周期。
  • 治理侧:Studio 的 Models 视图可看训练指标、Evaluate 页的评估卡和血缘图。可用 IAM 条件键拦住科学家把模型推到 production;批准后可用资源标签冻结 Package Group,阻止再从 MLflow 改。生命周期变更会发 EventBridge 事件。
  • 部署注意:推理规格要指向容器镜像和 `inference.py` 等 handler,包才真正能从 Registry 一键部署。本期是单账号、用 IAM 分岗;跨账号 / RAM 共享见 Part 2。
资讯解读

实验工具和治理台账长期各记各的,同步升级后「谁能晋级到生产」可以写进 IAM,而不是靠人口头对齐。它不会自动让模型可部署——缺 inference handler,Registry 里仍只是一份元数据。

谁将受益
数据科学 / MLOps

继续只面对 MLflow,注册即入库。建议把评估指标和推理规格当成注册前必做项,否则治理同事还是要回来问你要笔记本。

模型治理 / 风控官

先给科学家角色加上「禁止推 production」的条件键,自己只在 Studio 里批准。批准后打冻结标签,避免实验侧事后改包。

GitHub Enterprise Server 3.22 GA:隔离环境可自配模型跑 Copilot CLI

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub Enterprise Server 3.22 正式 GA,面向自建 / 隔离部署的企业。平台侧补齐企业团队、密钥扫描工单排序、规则集按人绕过和必审人规则;与 AI 编码直接相关的是:可在不连 GitHub Cloud 的环境里为 Copilot CLI 配置模型提供方

  • Copilot CLI(技术预览):管理员在 GHES 上配置一次模型提供方后,终端用户用 GHES 凭证即可使用 Copilot CLI。官方写明面向断网或隔离环境,能力仍是技术预览,后续可能改。
  • 权限与评审:企业团队(原公开预览)GA,可在整个企业内集中管人与仓库权限。仓库规则集支持把绕过权授给个人(例如服务账号,不必再为此建角色)。可在规则集里按分支/文件模式要求特定审阅人,并设定每团队最少评审数,与 CODEOWNERS 并行——例如所有 `*.sql` 必须过数据平台组。
  • 安全运营:密钥扫描的推送保护绕过与告警关闭请求,可在仓库/组织/企业范围按日期正序或倒序排,方便堆积工单时分优先级。
  • 协作可见性:Issue 侧栏显示关联 PR 是否已进 Latest / Pre-release;公开仓库的 PR 列表直接标出 First-time contributor / Contributor / Member。
资讯解读

隔离网络里的编码 Agent 以前几乎只能自建。3.22 把「在 GHES 上指一个模型提供方,员工继续用公司凭证」写成官方预览路径——对不能出网的行业,这比再开一条 SaaS Copilot 更接近可过审方案。注意它仍是技术预览,不要按 GA 功能写进明年的硬依赖。

谁将受益
政企 / 金融等隔离网络的平台团队

先在预发 GHES 配好模型提供方,用一小撮 Copilot CLI 用户验证凭证、审计和出网策略,再决定是否升级 3.22。生产切换前把「预览可能改」写进变更单。

已在 GHES 上开发的工程师

企业团队和必审人规则会改变合并门槛。升级后先看自己的仓库规则集,确认 sql / 默认分支是不是多了一层必须等人审。

ChatGPT Images 2.5 上线:草图与参考图可转成更贴想法的成品图

图像创作
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 发布 ChatGPT Images 2.5,面向需要出图的产品、运营与设计岗,把点子、草图和参考照片转成更个性化、更成品化的图像。

  • 官方定位:帮助把想法、草图与参考图变成更贴合原意、更精致的图像。
  • 输入形态:不只靠纯文字提示词,草图和参考照片被明确写进能力描述——适合「先出一版再改」的日常出图。
  • 核对范围:官方 RSS 只给出能力定位,定价、额度、画质指标与是否对免费用户开放,请打开原文核对后再写进工作流。
资讯解读

出图工具的竞争已经从「能不能生成」转到「能不能按草图和参考图稳住风格」。Images 2.5 的官方表述就是这个方向;落地前先拿你们现有的品牌参考图测一轮一致性,比看发布标题更有用。

谁将受益
设计 / 运营 / 内容岗

适合用来把「口头想法 + 一张参考图」变成可讨论的初稿。建议先用你们品牌色和已有物料做 5 张对照,看像不像你们的东西,再决定要不要替换现有出图路径。

OpenAI 公布 Navier–Stokes 千禧年问题的 AI 证明:光滑流体可在有限时间形成奇点

模型平台
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 公布由内部模型生成的 Navier–Stokes 存在与光滑性问题证明,并附 Lean 形式化;面向数学与科研团队,结论是初始光滑的三维不可压缩流体可在有限时间内形成奇点。

  • 证明了什么:对应 Clay 千禧年问题官方表述的 C / D——奇点可以发生,而不是「解永远保持光滑」。流体从静止出发,外力保持光滑、能量全程有限,漩涡向内螺旋并被拉长后速度无界。
  • 怎么做出来的:约 1 万个并发智能体协作约 88 小时找到解析证明,再用 GPT-6 Astra 花 17 小时做 Lean 形式化;该问题路径上约 270 万条消息、约 1300 亿输出 token。内部模型能力显著高于已发布的 GPT-6 Astra,训练仍在继续。
  • 同期工作:Anthropic 的 Levent Alpöge 与 NYU 的 Tristan Buckmaster 优先完成了有外力 Euler 问题;OpenAI 智能体另外解决了无外力 Euler 正则性反例。OpenAI 明确表示不申领千禧年奖金
资讯解读

这是「智能体集群 + 形式化验证」第一次被实验室用来冲击千禧年级数学问题,而且官方主动把「不领奖」写进公告——重点不在奖金,而在于可复核的 Lean 证明已经能跟论文一起公开。在 Clay 研究所完成独立审稿之前,它应被当成可核验的预印结果,而不是已经盖章的数学史定论。

谁将受益
数学 / 科学计算研究者

真正可操作的是 Lean 证明和论文,而不是标题。建议先核形式化仓库能否复现,再决定是否纳入研讨;不要把「AI 解决了千禧年问题」直接写进对外材料。

做科研 Agent 的工程团队

可抄的不是「上万并发」这个规模,而是「分问题变体并行探索 → 交叉授粉 → Lean 验收」这条链路。先在你们已有形式化资产上试一轮,比追 token 消耗更有用。

DeepMind 发布 AlphaGenome Atlas:预计算人类基因组约 90 亿种单碱基突变的分子效应

医疗AI
来源:Google DeepMind 官方博客·
查看原文
事件内容

Google DeepMind 上线 AlphaGenome Atlas,面向遗传与罕见病研究团队,把人类基因组约 90 亿种单碱基变异的分子效应预计算成可检索图谱。

  • 体量:约 1 PB 数据集,体积超过 AlphaFold 数据库 30 倍以上;每个变异带有跨数百种人/鼠细胞与组织的调控效应预测。
  • AVI 分数:把 AlphaGenome 与 AlphaMissense 压成一个可排序的影响分数,覆盖编码区(约 2%)和非编码区(约 98%);并给出剪接、表达、染色质可及性等特征归因。
  • 已验证用例:GREGoR / Broad 用 AVI 在未解罕见病里找到影响 DNM1 的剪接变异并经实验验证;Exeter 在逾 5.4 万名 UK Biobank 全基因组上,按预测分子效应分组后非编码关联多检出约 22%
  • 怎么用:学术研究可免费走网站门户与 AlphaGenome API,也可作为 Google Antigravity 的 skill;商业用途将上 Google Cloud。官方写明不替代临床诊断、未获批临床使用
资讯解读

基因组解读的瓶颈正在从「模型能不能预测」变成「预测结果能不能被没有工程团队的实验室直接检索」。AVI 把编码与非编码变异放进同一张排序表,罕见病「大海捞针」和群体遗传里的非编码噪声,第一次有了同一把尺子;但它仍是研究工具,不能当诊断报告。

谁将受益
罕见病 / 遗传学研究团队

适合用来给候选变异做第一轮排序,而不是直接下诊断。建议拿已经实验验证过的病例做对照,看 AVI 有没有把真正致病位点排到前面,再决定是否接入现有分析流程。

生信与药物靶点团队

非编码关联多检出约 22% 说明它更像「提高信噪比的过滤器」。先用它缩小实验清单,再做湿实验验证,比把 90 亿条预测当结论更安全。

MIT 用 GPT-5.6 Sol + Codex 过夜自动校准超导量子比特,常规测量可少人值守

智能代理
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 披露 MIT 工程量子系统组(EQuS)用 GPT-5.6 Sol 接入 Codex、再接到实验室软件,面向超导量子实验团队,让常规校准与测量可以少人值守甚至过夜跑。

  • 实验对象:未校准的标准六比特芯片;智能体根据测量技能与设计指标选择参数、操作硬件、分析结果,再决定重测还是写入下一步。
  • 能独立完成的:信号清晰时,可自主找到跃迁频率、校准控制/读出脉冲、测量量子信息保持时间。该组已把这类常规表征交给智能体,因为每片芯片人工表征往往要数天。
  • 仍要人接手的:信号弱或噪声大时,找参数更慢,有时需要有经验的研究者指路。新实验则给更窄的目标,更多依赖智能体改代码、对着真实测量做测试。
  • 现场用法:研究者可在无尘室或手机上查看进度并改方向,「多个智能体同时处理测量、理论与芯片设计」。
资讯解读

实验室 Agent 真正能省下的,是「流程清楚、软件可控」的重复测量,不是含糊物理现象的判断。信号干净就能过夜跑,信号脏了就要人接手——这才是该不该接入现有仪器软件的验收标准。

谁将受益
量子 / 实验物理团队

先挑一条已经写清步骤的校准流水线做试点,看过夜跑和人工表征差在哪,而不是一上来让 Agent 设计新实验。人要盯的是噪声段和异常物理,而不是每一发脉冲。

科研工具链工程师

可复用的是「实验室软件 API + 测量技能包 + 手机可改方向」,不是模型名字。先把现有仪器控制脚本接到 Agent 能调用的接口上,比纠结用哪家模型更优先。

OpenAI 称自研推理芯片 Jalapeño 将于年底开始部署,服务成本已再降 20%

算力与基建
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI CFO Sarah Friar 发文谈能力与成本如何互相放大,面向关注推理成本与算力策略的团队,给出一组可核对的生产与芯片数字。

  • 服务侧:GPT-5.6 Sol 帮助改进生产推理软件,端到端服务成本降 20%;另有优化使 token 生成效率再提升逾 15%
  • 芯片侧:首款自研推理芯片 Jalapeño 在 InferenceX 对三款公开模型的测试中,按额定芯片功耗归一化后,峰值 token 吞吐为对照商用系统的 1.5–1.9 倍,端到端延迟低 1.7–3.6 倍;计划今年年底开始部署,并与 NVIDIA、AMD 及其他伙伴的加速器并存。
  • 使用侧:官方称产品覆盖逾 10 亿周活用户、250 万家企业;内部研究组织目前每 1 个人工工作日对应 3.1 个智能体工作日。文中同时把 GPT-6 Astra 定位为当前最强对齐模型之一。
资讯解读

这篇更像成本与算力策略说明书,而不是产品发布。真正可判断的是两件事:软件侧已经把服务成本再削一截,硬件侧 Jalapeño 要到年底才开始部署、而且不会单押自家芯片。对客户来说,短期能感受到的仍是 API 单价与速度,而不是换芯片。

谁将受益
平台 / 推理成本负责人

把「服务成本 -20%、生成效率 +15%」当成观察 OpenAI 会不会把降本让利给 API 的信号。建议对照你们近 30 天账单,看同等任务花费有没有跟着降,而不是只听芯片参数。

重度使用 Codex / ChatGPT 的团队

内部 3.1 倍智能体工时说明「人定优先级、Agent 扛执行」已经是实验室自己的工作方式。可先统计你们团队里重复性代码与排查任务占比,再决定哪些班次可以交给 Agent。

OpenAI 拿出 500 万美元资助青少年 AI 影响研究,单笔最高 100 万美元

安全与治理
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 承诺投入 500 万美元,资助针对 13–17 岁青少年使用生成式 AI 的独立研究,面向发展心理学、公共卫生、HCI 与 AI 安全等团队。

  • 资助什么:使用方式与发展结果、社交与情绪影响、不同年龄/文化/社会经济背景下的差异,以及护栏、产品设计和政策是否真能增加收益或降低风险。
  • 额度与资格:总盘 500 万美元,单项最高 100 万美元;间接费用上限 10%。申请人须年满 18 岁,且隶属研究机构或具备相关经验;不优先资助营利项目。资金由 OpenAI Group PBC 拨付。
  • 时间表:即日起至 2026 年 10 月 6 日 提交英文申请;滚动评审,入选结果不晚于 2026 年 11 月 13 日 通知。涉未成年人研究必须写明伦理审查、知情同意、隐私与伤害披露响应。
  • 产出要求:须向 OpenAI 提交最终报告,2027 年一季度交中期进展;鼓励公开论文或预印本,但发表不是拨款条件。
资讯解读

厂商开始用真金白银买「青少年场景的外部证据」,而不是只发安全原则。对政策制定者和产品团队,这意味着 2026 年底到 2027 年会多一批可引用的独立研究;对申请者,窗口只有大约四周,而且独立性、可执行的伦理方案比宏大叙事更重要。

谁将受益
青少年发展 / 教育与公共卫生研究者

这是明确写了预算上限和截止日期的申请窗口。建议先按「能否在现有样本上 12 个月内交出可执行结论」来裁剪题目,伦理与知情同意材料必须和方案一起交。

做未成年人产品与合规的团队

即使不申请,也可把资助主题当成 2027 年监管对话会追问的清单——使用时长、护栏是否有效、跨人群差异。现在就补监测口径,比等论文出来再补更从容。

Hugging Face 博文:安全拒答应切「有害子集」,而不是整题封杀

安全与治理
来源:Hugging Face Blog(Multiverse Computing)·
查看原文
事件内容

Multiverse Computing 在 Hugging Face 博客介绍论文 *Safety for Whom?*,面向要按部署场景划安全边界的模型团队,主张拒答应切到「同一主题里真正有害的那一子集」,而不是把整类话题封死。

  • 问题设定:以政治提示词为试验场——事实性选举问答应回答,针对性政治操纵应拒绝。主题级护栏(如 LlamaGuard-3 的分类)表达不了这种切分。
  • 数据坑:单次自生成拒答会丢掉约 19.88% 提示(8009 条);加强重试后残留失败降到 0.20%。另构造 11955 条「看起来危险、实际应回答」的样本,避免只在评测时才见到这类题。
  • 数字对照(Qwen3-8B):政治有害拒答从 9.47% 升到 84.75%,HarmBench / StrongREJECT / WildJailbreak 平均不安全回复从 26.26% 降到 0.14%;但若只追这条曲线,XSTest 过度拒绝会从 2% 飙到 74%——那是拒答机器,不是更安全的模型。
  • 边界对效果:加入有害/无害成对样本后,应回答一侧的过度拒绝从 32.94% 降到 4.16%,有害一侧拒答仅从 91.88% 降到 87.72%。
资讯解读

安全微调如果只报「有害拒答率」,很容易把模型训成「凡是沾边就拒绝」。真正要看的是边界两侧:有害的拦住、无害的仍答。部署政策不同,同一主题的切法就不同——政务助手和公民教育产品不能共用一把主题级刀。

谁将受益
模型安全 / 对齐工程

上线前把「过度拒绝」和「有害漏放」放在同一张表里看。建议先为你们的最高频主题造一批成对样本(同一锚点、不同意图),再决定要不要加大拒答数据。

企业与公共服务的模型适配团队

同一基座、不同产品,安全边界往往只差在子集。不要直接套通用护栏分类;先写清「必须回答」和「必须拒绝」的例子,再做蒸馏或策略训练。