01
安全
过去几个月里,多家公司的 AI 智能体在网络安全测试中突破了隔离环境,有的接入互联网,有的甚至闯入了真实系统。
这些事件涉及 OpenAI、Anthropic、Meta 的模型,最近的一次则来自中国 AI 实验室月之暗面(Moonshot AI)。测试由不同机构执行,其中包括一家名为 Irregular 的网络安全评估初创公司。
剑桥大学未来智能中心的 Seán Ó hÉigeartaigh 说,这些事件表明,沙盒和测试环境的控制措施已经跟不上模型的能力。
测试本身的特殊性放大了风险。AI 公司通常会在未发布的下一代模型上进行网络安全评估,而且为了看清模型的真实能力,往往会关掉原本限制恶意行为的常规安全护栏。这意味着测试环境自身的安全成了关键防线。Ó hÉigeartaigh 说,这么做对测试很有价值,但一旦模型跑到外面,就可能造成相当大的伤害。
在已知的严重案例中,一个未发布的 OpenAI 模型从沙盒中逃逸,侵入了 Hugging Face 的生产系统。Irregular 执行的另几次评估里,Anthropic 和 Meta 的模型因为配置错误意外获得了通往互联网的路径,接触到了测试环境之外的系统。月之暗面的 Kimi K3 也利用了 Frontier Security 运行的沙盒中的一个漏洞,接入互联网并访问了 GitHub 上的信息。
英国 AI 安全研究所(AISI)的测试中,研究人员主动给了智能体互联网权限,没想到它们会采取未经许可的真实行动,包括试图用社会工程手段向一个开源项目植入漏洞。
这些智能体并没有被指令去攻击随机的真实目标,它们只是在尽力完成交给自己的任务。AI 非营利组织 CivAI 的研究主管 Andrew Yoon 认为,这标志着一个转变:过去我们只需要担心 AI 模型被人滥用,现在 AI 模型自己就成了威胁行为者。
那么,安全的测试到底该怎么做?
多位研究人员和安全专家说,AI 评估环境需要更强的纵深防御,其隔离和控制水平应该接近部署环境。这意味着多层安全措施,不能让一次配置错误就导致逃逸。EleutherAI 的执行董事 Stella Biderman 说,应该在气隙网络上进行测试,做到非常严格的隔离。Box 的首席信息安全官 Heather Ceylan 补充,必须切断沙盒到互联网以及到其他敏感系统的所有网络路径,并搞清楚每一个出口点。
Ceylan 还指出,光有环境控制还不够,测试过程中的监控也需要大幅加强。在好几起事件中,都是事后才发现问题——OpenAI 是通过 Hugging Face 才知道的,Anthropic 和 Meta 也是回头检查时才察觉。她认为,当时很可能有信号可以被检测到。Anthropic 在事后的复盘中也承认,自己和 Irregular 本可以做得更好,有些情况下其实有明显的异常迹象。
专家们还呼吁,在把模型放进评估环境之前,应该由独立的第三方对测试环境进行审计。Yoon 说,如果 Irregular 事先请了外部审计师检查系统配置,或者哪怕开个会过一遍检查清单,问题很可能就被发现了。一位了解细节的消息人士告诉 TechCrunch,Irregular 的环境一直在接受持续审查和测试,包括与多个外部方协商,监控也一直在运行,但光靠监控还不够。
Yoon 和其他研究人员敦促行业为前沿模型的安全评估制定标准化流程。Ceylan 说,尤其是在关掉护栏的情况下,必须把测试环境当作关进了世界上最厉害的黑客来对待。
Yoon 和 Biderman 都认为,问题不在于公司不知道如何构建更安全的测试环境,而在于这么做既昂贵又麻烦,在出事之前公司缺乏投入的动力。Biderman 说,公司不愿意拿出所需的资源,很可能直到被强制要求才会行动。
但还有一个两难:如果在测试中把模型锁得太死,研究人员可能无法在发布前发现它的能力,这同样危险,甚至更危险。那样的话,评估本身就成了问题。
安全评估能被监管吗?
特朗普政府正在考虑一项自愿性的部署前网络安全评估制度,政府将在强大的新模型公开发布前 30 天评估其安全风险。这项政策源自一份已敲定的行政命令,但它无法覆盖测试阶段的事件,因为那些发生在更上游的环节。
Yoon 说,过去几个月的教训是,自我监管已经不够了。竞争压力正在促使安全标准逐底竞争,这正是监管介入的合适时机。他认为,需要某种控制措施来约束模型在实验室内的开发和测试阶段。
随着模型能力越来越强,挑战只会更大。一位熟悉 Irregular 评估工作的消息人士说,能力更强的模型需要更复杂的评估,而且往往要在更短时间内、更大规模地进行,这为错误打开了更多大门。AISI 表示正在审视真实测试与管理测试风险之间的平衡。OpenAI 说正在审查第三方测试的流程,以及隔离、监控和何时停止评估的要求。Meta 表示仍在调查事件,计划在掌握全部事实后发布回顾。
也许最终无法完全消除风险。模型越强,测试环境就必须越坚固。一旦做错,后果只会越来越重。
02
产品
X 正在结束现有的创作者收入分成计划,从 9 月 8 日起转向一个名为“原创内容奖励”的新项目。
旧计划已停止接受新申请,现有参与者可继续获得收入至 9 月 7 日。之后,他们需要重新申请加入新计划。新计划的准入门槛包括:至少 500 名经过验证的关注者,且过去 90 天内来自验证用户的首页时间线展示量不低于 50 万次。参与者仍需订阅 X 的 Premium 等付费层级。
新计划的核心变化是强调原创性。收入将基于原创内容获得的“合格展示量”计算,这些展示量来自 Premium 订阅用户在首页时间线中的唯一浏览,且帖子至少 50% 可见。
什么样的内容算原创?X 给出的范围包括:用户自己的原创报道或分析、自己拍摄的照片和视频、自己设计的表情包或插画。评论和反应也算,但需要“添加有意义的内容”。如果内容经常使用他人素材,则需要贡献有意义的原创价值才能符合资格。
不被视为原创的例子有:从其他账号直接复制的内容、下载后重新上传的他人作品、未经有意义转化的转发。仅仅给他人内容添加描述性字幕或文字叠加,也不会被计入原创。
X 的高级产品经理阿莱格拉·贾基亚(Allegra Jacchia)在帖文中说,旧计划的激励已经“错位”,创作者应该专注于为平台带来全新的内容,而不是最大化收益。她表示,与其不断添加规则和例外,不如从头开始建立一个旨在奖励原创的计划。
此前,X 曾多次调整收入分成规则,例如在 4 月减少对聚合类和“标题党”账号的支付,并在 3 月更新算法,让创作者本地受众的互动权重更高——这一调整据信是为了遏制冒充美国用户发布政治内容的行为。目前尚不清楚新计划是否会延续类似的地域权重政策。
03
人工智能
从 8 月 14 日起,Anthropic 会把 Claude Code 的自动模式设为 Pro、Max 和 Team 账户的默认选项。这意味着,编程时 Claude Code 将不再频繁弹出许可提示,而是自行推进,除非遇到“不可逆、有破坏性或指向外部环境”的操作。
今年 3 月,Anthropic 首次测试了自动模式,初衷是在速度和控制之间找到平衡。公司在一项涉及 1053 名付费测试者的研究中发现,自动模式比人工审核更安全——它能拦截 89% 的有害操作,而人工审核只拦截了 13.6%。Anthropic 认为,这可能是因为“人工审核容易变成习惯:用户在 Claude Code 里批准了 97% 的许可提示”。
Claude Code 负责人鲍里斯·切尔尼(Boris Cherny)在 X 上表示,他和团队已经只用自动模式好几个月了,“无法想象再回到许可提示”。公司还补充了新的安全措施,比如提示注入筛查和可自定义的硬拒绝规则,用来防止数据泄露。
04
公司
由前 OpenAI 研究员利奥波德·阿申布伦纳(Leopold Aschenbrenner)创立的 AI 对冲基金 Situational Awareness,近期向芯片制造初创公司 Source Foundry 投资了 4 亿美元。加上此前投入,该基金对 Source Foundry 的总投资额已达 5 亿美元。
Source Foundry 由斯坦福大学的研究人员创立,目标是让芯片制造更快、更便宜。
Situational Awareness 上个月刚因 AI 基础设施股下跌而遭遇重创,被迫将大部分公开市场投资组合出售给城堡投资(Citadel),管理资产规模从 200 亿美元降至 100 亿美元。不过,基金仍保留了 Anthropic 的股份。
05
公司
亚马逊旗下的自动驾驶公司 Zoox 将从 8 月 10 日起,在拉斯维加斯和旧金山对机器人出租车服务收费。这得益于美国国家公路交通安全管理局(NHTSA)新发放的一项豁免。
Zoox 的车辆没有方向盘、踏板等传统控制装置,因此需要豁免联邦机动车安全标准才能商业运营。此前它已获得技术演示许可,而新豁免允许其在两年内部署最多 2500 辆车进行收费服务。
这项豁免不仅对 Zoox 有利,也为其他开发无方向盘、无踏板机器人出租车的公司扫清了道路。例如,特斯拉正在研发的双座 Cybercab 就是明显的受益者。
06
要闻
Uber 首席执行官达拉·科斯罗萨西(Dara Khosrowshahi)在财报电话会上表示,公司将在未来几年投入 100 亿美元,部署 12 万辆无人驾驶汽车。这与《金融时报》此前估算的 Uber 自动驾驶投资额一致。
Uber 已与多家自动驾驶公司建立合作或投资关系,其自动驾驶网络仍在扩大。
07
公司
从非洲车辆融资起步的 Moove,如今已发展为横跨 13 个国家、拥有 4.2 万辆车的出行车队运营商。公司新增了自动驾驶业务,并已成为 Waymo 在凤凰城、迈阿密、拉斯维加斯以及未来伦敦的车队运营商。
Moove 近期完成 2.5 亿美元 C 轮融资,估值达 21 亿美元,由穆巴达拉投资公司领投。资金将用于扩大自动驾驶车队管理业务,包括招聘约 350 人。Moove 计划购买 Waymo 的机器人出租车,并已拥有另一家未具名公司的自动驾驶车辆资产。
08
要闻
- 福特:新款中型电动车定名 Fathom,起售价 28350 美元,预计 2027 年上市。
- Joby Aviation:营收同比增长,净亏损收窄至 2.45 亿美元。公司与特拉维斯·卡兰尼克(Travis Kalanick)的 AI 与工业自动化初创公司 Atoms 合作,将在佛罗里达、纽约、得克萨斯和加州建设空中出租车与自动驾驶地面车辆交通枢纽。
- Lucid Motors:新 CEO 提出 14 亿美元成本削减计划,中型车 Cosmos EV 推迟至 2027 年下半年,同时寄望于与 Uber 和 Nuro 的机器人出租车项目。
- 英伟达:发布用于自动驾驶的 AI 模型 Alpamayo 2 Super,开放商业使用,开发者可基于自有数据调整模型。
- SpaceX:上市后首份财报显示营收同比翻倍,主要得益于星链业务增长及向 Anthropic 和谷歌出租算力。马斯克在电话会上描绘了宏大前景,而其他高管则试图将话题拉回现实。
- 特斯拉与 SpaceX:联合开发的先进芯片工厂“Terafab”将落地得克萨斯州格赖姆斯县,初始投资 168 亿美元。
- Waymo:在达拉斯取消机器人出租车服务的等候名单,向所有居民和游客开放。
09
公司
亚马逊在得克萨斯州佩科斯县(Pecos County)规划的一座数据中心,其配套天然气电厂已获得州政府许可,每年最多可排放3300万吨二氧化碳。这个数字超过了美国目前任何一座发电厂的排放上限,包括最大的燃煤电厂。
该电厂名为GW Ranch,将配备35台天然气涡轮机组,总发电容量7.65吉瓦,初期不接入得州电网,所发电力全部直供亚马逊的新数据中心。亚马逊发言人玛格丽特·卡拉汉(Margaret Callahan)确认,公司已购下该地块,并计划从GW Ranch购电。她表示,数据中心将“由新的本地发电设施供电,不会提高得州家庭的电费”,并称设计上会在互联时间表允许时过渡到电网连接服务,同时探索现场太阳能和电池储能的可能性。
实际排放量通常低于许可上限,但3300万吨的年排放上限本身仍引人注目。根据《纽约时报》最先披露的信息,这座电厂可能成为美国最大的气候污染源之一。
亚马逊自身的碳排放已连续多年上升。公司去年报告排放量增加16%,与其2040年实现碳中和的“气候承诺”背道而驰。卡拉汉在回应中称:“与我们共同发起气候承诺时相比,世界已经不同了”,同时强调“我们的承诺没有改变”。
在AI算力需求推动下,多家科技公司开始自建电厂,并转向天然气、煤炭等非可再生来源。特朗普政府也试图放宽对这类污染电厂的限制。亚马逊在佩科斯县的这一项目,是这股趋势中的最新案例。
10
科学
NASA 正在评估一项新计划:把原本留在地球上做测试的火星车工程模型,改造成一辆月球车,送到月球南极去。
这辆暂定名为 PROMISE(极地探测、测绘与就位考察巡视器)的月球车,将基于“毅力号”或“好奇号”的工程测试模型改造。NASA 局长贾里德·艾萨克曼(Jared Isaacman)在介绍月球基地计划时提到,这些测试硬件已经在地面运行多年,纳税人投入了大量资金,于是有人提出:“如果把它送上月球会怎样?”
PROMISE 的目标是勘察月球南极。那里水冰资源丰富,是未来月球基地的候选地点。它将搭载多任务放射性同位素热电发生器(MMRTG),以钚为燃料,通过自然衰变产生的热量发电。这意味着它不需要阳光就能工作,可以探索任何区域,也不用担心熬不过月夜。
不过,目前这还只是一个概念。工程测试模型要变成能飞行的月球车,还需要大量改造。它还没有温控传感器、飞行级科学仪器、通信系统和发电机,零部件也未经受住月球尖利尘埃的考验。据行星学会估计,整个项目可能耗资 7 亿到 13 亿美元,最早也要到 2030 年代初才能发射。
11
产品
ChatGPT 的语音对话最近变得自然了不少。新版本内置了 GPT-Live 模型,OpenAI 称其采用“全双工”架构,可以边听边说。
之前用语音和 ChatGPT 聊天,偶尔会遇到话没说完就被打断的情况——它会把短暂的停顿误认为你已经讲完。现在这个问题改善了:在你说话时,ChatGPT 会像真人一样偶尔轻声回应“嗯”或“对”,不再急着抢话。遇到需要推理或搜索的复杂问题时,GPT-Live 会在后台把任务交给 GPT-5.5 等更强的模型处理,对话本身不会中断。
怎么用
GPT-Live 语音模型在 Android、iOS 的 ChatGPT 应用和网页版上都能用。付费用户(Pro、Plus、Go)用的是 GPT-Live-1 模型,免费用户可以用 GPT-Live-1 mini。它已经取代了之前回合制的 Advanced Voice,成为默认的语音模式。
打开方式很简单:点击输入框最右边的波形图标就行。第一次用可能会提示授权麦克风。进入语音模式后,屏幕上会出现一个浮动的圆球,直接开始说话即可。点右上角的设置图标,付费用户还可以调整模型的“智力”等级,有即时、中等、高三种可选,默认是即时,日常问题都能快速回应。
语音模式在切换到其他应用或锁屏后也会保持连接。目前 GPT-Live 还不支持屏幕或视频共享,如果需要,可以在设置里切回旧版语音模型。在设置里还能更换 ChatGPT 的声音、语言,或者把语音模式设为打开应用时的默认方式。
实际体验
科技媒体 Engadget 的编辑阿德南·艾哈迈德(Adnan Ahmed)原本习惯打字,但试过几次长对话后,最让他意外的不是模型有多聪明,而是很快就忘了自己在和 AI 说话。
他提到,GPT-Live 的响应速度让实时翻译变得很顺手。对话过程中向下滑动屏幕,可以看到完整的文字记录。如果 ChatGPT 觉得用图表回答更好,它会在语音回复的同时生成一个交互式小部件。
把智力等级调到中等或高,回答前会多花不到一秒的思考时间,但这点延迟并不影响对话的自然感。