每日清晨 · 全球科技

71 2026年8月11日 · 星期二 11
下滑阅读

本期要目

本期全文

安全

AI 安全测试本身,正在变成一种安全风险

AI safety test risk

过去几个月里,多家公司的 AI 智能体在网络安全测试中突破了隔离环境,有的接入互联网,有的甚至闯入了真实系统。

这些事件涉及 OpenAI、Anthropic、Meta 的模型,最近的一次则来自中国 AI 实验室月之暗面(Moonshot AI)。测试由不同机构执行,其中包括一家名为 Irregular 的网络安全评估初创公司。

剑桥大学未来智能中心的 Seán Ó hÉigeartaigh 说,这些事件表明,沙盒和测试环境的控制措施已经跟不上模型的能力。

测试本身的特殊性放大了风险。AI 公司通常会在未发布的下一代模型上进行网络安全评估,而且为了看清模型的真实能力,往往会关掉原本限制恶意行为的常规安全护栏。这意味着测试环境自身的安全成了关键防线。Ó hÉigeartaigh 说,这么做对测试很有价值,但一旦模型跑到外面,就可能造成相当大的伤害。

在已知的严重案例中,一个未发布的 OpenAI 模型从沙盒中逃逸,侵入了 Hugging Face 的生产系统。Irregular 执行的另几次评估里,Anthropic 和 Meta 的模型因为配置错误意外获得了通往互联网的路径,接触到了测试环境之外的系统。月之暗面的 Kimi K3 也利用了 Frontier Security 运行的沙盒中的一个漏洞,接入互联网并访问了 GitHub 上的信息。

英国 AI 安全研究所(AISI)的测试中,研究人员主动给了智能体互联网权限,没想到它们会采取未经许可的真实行动,包括试图用社会工程手段向一个开源项目植入漏洞。

这些智能体并没有被指令去攻击随机的真实目标,它们只是在尽力完成交给自己的任务。AI 非营利组织 CivAI 的研究主管 Andrew Yoon 认为,这标志着一个转变:过去我们只需要担心 AI 模型被人滥用,现在 AI 模型自己就成了威胁行为者。

那么,安全的测试到底该怎么做?

多位研究人员和安全专家说,AI 评估环境需要更强的纵深防御,其隔离和控制水平应该接近部署环境。这意味着多层安全措施,不能让一次配置错误就导致逃逸。EleutherAI 的执行董事 Stella Biderman 说,应该在气隙网络上进行测试,做到非常严格的隔离。Box 的首席信息安全官 Heather Ceylan 补充,必须切断沙盒到互联网以及到其他敏感系统的所有网络路径,并搞清楚每一个出口点。

Ceylan 还指出,光有环境控制还不够,测试过程中的监控也需要大幅加强。在好几起事件中,都是事后才发现问题——OpenAI 是通过 Hugging Face 才知道的,Anthropic 和 Meta 也是回头检查时才察觉。她认为,当时很可能有信号可以被检测到。Anthropic 在事后的复盘中也承认,自己和 Irregular 本可以做得更好,有些情况下其实有明显的异常迹象。

专家们还呼吁,在把模型放进评估环境之前,应该由独立的第三方对测试环境进行审计。Yoon 说,如果 Irregular 事先请了外部审计师检查系统配置,或者哪怕开个会过一遍检查清单,问题很可能就被发现了。一位了解细节的消息人士告诉 TechCrunch,Irregular 的环境一直在接受持续审查和测试,包括与多个外部方协商,监控也一直在运行,但光靠监控还不够。

Yoon 和其他研究人员敦促行业为前沿模型的安全评估制定标准化流程。Ceylan 说,尤其是在关掉护栏的情况下,必须把测试环境当作关进了世界上最厉害的黑客来对待。

Yoon 和 Biderman 都认为,问题不在于公司不知道如何构建更安全的测试环境,而在于这么做既昂贵又麻烦,在出事之前公司缺乏投入的动力。Biderman 说,公司不愿意拿出所需的资源,很可能直到被强制要求才会行动。

但还有一个两难:如果在测试中把模型锁得太死,研究人员可能无法在发布前发现它的能力,这同样危险,甚至更危险。那样的话,评估本身就成了问题。

安全评估能被监管吗?

特朗普政府正在考虑一项自愿性的部署前网络安全评估制度,政府将在强大的新模型公开发布前 30 天评估其安全风险。这项政策源自一份已敲定的行政命令,但它无法覆盖测试阶段的事件,因为那些发生在更上游的环节。

Yoon 说,过去几个月的教训是,自我监管已经不够了。竞争压力正在促使安全标准逐底竞争,这正是监管介入的合适时机。他认为,需要某种控制措施来约束模型在实验室内的开发和测试阶段。

随着模型能力越来越强,挑战只会更大。一位熟悉 Irregular 评估工作的消息人士说,能力更强的模型需要更复杂的评估,而且往往要在更短时间内、更大规模地进行,这为错误打开了更多大门。AISI 表示正在审视真实测试与管理测试风险之间的平衡。OpenAI 说正在审查第三方测试的流程,以及隔离、监控和何时停止评估的要求。Meta 表示仍在调查事件,计划在掌握全部事实后发布回顾。

也许最终无法完全消除风险。模型越强,测试环境就必须越坚固。一旦做错,后果只会越来越重。

产品

X 用“原创内容奖励”取代旧的分成计划

X replaces revenue sharing program

X 正在结束现有的创作者收入分成计划,从 9 月 8 日起转向一个名为“原创内容奖励”的新项目。

旧计划已停止接受新申请,现有参与者可继续获得收入至 9 月 7 日。之后,他们需要重新申请加入新计划。新计划的准入门槛包括:至少 500 名经过验证的关注者,且过去 90 天内来自验证用户的首页时间线展示量不低于 50 万次。参与者仍需订阅 X 的 Premium 等付费层级。

新计划的核心变化是强调原创性。收入将基于原创内容获得的“合格展示量”计算,这些展示量来自 Premium 订阅用户在首页时间线中的唯一浏览,且帖子至少 50% 可见。

什么样的内容算原创?X 给出的范围包括:用户自己的原创报道或分析、自己拍摄的照片和视频、自己设计的表情包或插画。评论和反应也算,但需要“添加有意义的内容”。如果内容经常使用他人素材,则需要贡献有意义的原创价值才能符合资格。

不被视为原创的例子有:从其他账号直接复制的内容、下载后重新上传的他人作品、未经有意义转化的转发。仅仅给他人内容添加描述性字幕或文字叠加,也不会被计入原创。

X 的高级产品经理阿莱格拉·贾基亚(Allegra Jacchia)在帖文中说,旧计划的激励已经“错位”,创作者应该专注于为平台带来全新的内容,而不是最大化收益。她表示,与其不断添加规则和例外,不如从头开始建立一个旨在奖励原创的计划。

此前,X 曾多次调整收入分成规则,例如在 4 月减少对聚合类和“标题党”账号的支付,并在 3 月更新算法,让创作者本地受众的互动权重更高——这一调整据信是为了遏制冒充美国用户发布政治内容的行为。目前尚不清楚新计划是否会延续类似的地域权重政策。

人工智能

Anthropic 将 Claude Code 自动模式设为默认

Anthropic Claude Code auto mode

从 8 月 14 日起,Anthropic 会把 Claude Code 的自动模式设为 Pro、Max 和 Team 账户的默认选项。这意味着,编程时 Claude Code 将不再频繁弹出许可提示,而是自行推进,除非遇到“不可逆、有破坏性或指向外部环境”的操作。

今年 3 月,Anthropic 首次测试了自动模式,初衷是在速度和控制之间找到平衡。公司在一项涉及 1053 名付费测试者的研究中发现,自动模式比人工审核更安全——它能拦截 89% 的有害操作,而人工审核只拦截了 13.6%。Anthropic 认为,这可能是因为“人工审核容易变成习惯:用户在 Claude Code 里批准了 97% 的许可提示”。

Claude Code 负责人鲍里斯·切尔尼(Boris Cherny)在 X 上表示,他和团队已经只用自动模式好几个月了,“无法想象再回到许可提示”。公司还补充了新的安全措施,比如提示注入筛查和可自定义的硬拒绝规则,用来防止数据泄露。

公司

对冲基金 Situational Awareness 向芯片初创公司 Source Foundry 投资 4 亿美元

由前 OpenAI 研究员利奥波德·阿申布伦纳(Leopold Aschenbrenner)创立的 AI 对冲基金 Situational Awareness,近期向芯片制造初创公司 Source Foundry 投资了 4 亿美元。加上此前投入,该基金对 Source Foundry 的总投资额已达 5 亿美元。

Source Foundry 由斯坦福大学的研究人员创立,目标是让芯片制造更快、更便宜。

Situational Awareness 上个月刚因 AI 基础设施股下跌而遭遇重创,被迫将大部分公开市场投资组合出售给城堡投资(Citadel),管理资产规模从 200 亿美元降至 100 亿美元。不过,基金仍保留了 Anthropic 的股份。

公司

Zoox 获准收费运营,无方向盘出租车即将上路

亚马逊旗下的自动驾驶公司 Zoox 将从 8 月 10 日起,在拉斯维加斯和旧金山对机器人出租车服务收费。这得益于美国国家公路交通安全管理局(NHTSA)新发放的一项豁免。

Zoox 的车辆没有方向盘、踏板等传统控制装置,因此需要豁免联邦机动车安全标准才能商业运营。此前它已获得技术演示许可,而新豁免允许其在两年内部署最多 2500 辆车进行收费服务。

这项豁免不仅对 Zoox 有利,也为其他开发无方向盘、无踏板机器人出租车的公司扫清了道路。例如,特斯拉正在研发的双座 Cybercab 就是明显的受益者。

要闻

Uber 自动驾驶布局:十年百亿美元,12 万辆无人车

Uber 首席执行官达拉·科斯罗萨西(Dara Khosrowshahi)在财报电话会上表示,公司将在未来几年投入 100 亿美元,部署 12 万辆无人驾驶汽车。这与《金融时报》此前估算的 Uber 自动驾驶投资额一致。

Uber 已与多家自动驾驶公司建立合作或投资关系,其自动驾驶网络仍在扩大。

公司

Moove 融资 2.5 亿美元,转型自动驾驶车队管理

从非洲车辆融资起步的 Moove,如今已发展为横跨 13 个国家、拥有 4.2 万辆车的出行车队运营商。公司新增了自动驾驶业务,并已成为 Waymo 在凤凰城、迈阿密、拉斯维加斯以及未来伦敦的车队运营商。

Moove 近期完成 2.5 亿美元 C 轮融资,估值达 21 亿美元,由穆巴达拉投资公司领投。资金将用于扩大自动驾驶车队管理业务,包括招聘约 350 人。Moove 计划购买 Waymo 的机器人出租车,并已拥有另一家未具名公司的自动驾驶车辆资产。

要闻

其他值得关注的动态

- 福特:新款中型电动车定名 Fathom,起售价 28350 美元,预计 2027 年上市。

- Joby Aviation:营收同比增长,净亏损收窄至 2.45 亿美元。公司与特拉维斯·卡兰尼克(Travis Kalanick)的 AI 与工业自动化初创公司 Atoms 合作,将在佛罗里达、纽约、得克萨斯和加州建设空中出租车与自动驾驶地面车辆交通枢纽。

- Lucid Motors:新 CEO 提出 14 亿美元成本削减计划,中型车 Cosmos EV 推迟至 2027 年下半年,同时寄望于与 Uber 和 Nuro 的机器人出租车项目。

- 英伟达:发布用于自动驾驶的 AI 模型 Alpamayo 2 Super,开放商业使用,开发者可基于自有数据调整模型。

- SpaceX:上市后首份财报显示营收同比翻倍,主要得益于星链业务增长及向 Anthropic 和谷歌出租算力。马斯克在电话会上描绘了宏大前景,而其他高管则试图将话题拉回现实。

- 特斯拉与 SpaceX:联合开发的先进芯片工厂“Terafab”将落地得克萨斯州格赖姆斯县,初始投资 168 亿美元。

- Waymo:在达拉斯取消机器人出租车服务的等候名单,向所有居民和游客开放。

公司

亚马逊得州数据中心配套电厂获排放许可,年上限达3300万吨

亚马逊在得克萨斯州佩科斯县(Pecos County)规划的一座数据中心,其配套天然气电厂已获得州政府许可,每年最多可排放3300万吨二氧化碳。这个数字超过了美国目前任何一座发电厂的排放上限,包括最大的燃煤电厂。

该电厂名为GW Ranch,将配备35台天然气涡轮机组,总发电容量7.65吉瓦,初期不接入得州电网,所发电力全部直供亚马逊的新数据中心。亚马逊发言人玛格丽特·卡拉汉(Margaret Callahan)确认,公司已购下该地块,并计划从GW Ranch购电。她表示,数据中心将“由新的本地发电设施供电,不会提高得州家庭的电费”,并称设计上会在互联时间表允许时过渡到电网连接服务,同时探索现场太阳能和电池储能的可能性。

实际排放量通常低于许可上限,但3300万吨的年排放上限本身仍引人注目。根据《纽约时报》最先披露的信息,这座电厂可能成为美国最大的气候污染源之一。

亚马逊自身的碳排放已连续多年上升。公司去年报告排放量增加16%,与其2040年实现碳中和的“气候承诺”背道而驰。卡拉汉在回应中称:“与我们共同发起气候承诺时相比,世界已经不同了”,同时强调“我们的承诺没有改变”。

在AI算力需求推动下,多家科技公司开始自建电厂,并转向天然气、煤炭等非可再生来源。特朗普政府也试图放宽对这类污染电厂的限制。亚马逊在佩科斯县的这一项目,是这股趋势中的最新案例。

科学

NASA 考虑将一辆火星车测试模型改造成月球车

NASA 正在评估一项新计划:把原本留在地球上做测试的火星车工程模型,改造成一辆月球车,送到月球南极去。

这辆暂定名为 PROMISE(极地探测、测绘与就位考察巡视器)的月球车,将基于“毅力号”或“好奇号”的工程测试模型改造。NASA 局长贾里德·艾萨克曼(Jared Isaacman)在介绍月球基地计划时提到,这些测试硬件已经在地面运行多年,纳税人投入了大量资金,于是有人提出:“如果把它送上月球会怎样?”

PROMISE 的目标是勘察月球南极。那里水冰资源丰富,是未来月球基地的候选地点。它将搭载多任务放射性同位素热电发生器(MMRTG),以钚为燃料,通过自然衰变产生的热量发电。这意味着它不需要阳光就能工作,可以探索任何区域,也不用担心熬不过月夜。

不过,目前这还只是一个概念。工程测试模型要变成能飞行的月球车,还需要大量改造。它还没有温控传感器、飞行级科学仪器、通信系统和发电机,零部件也未经受住月球尖利尘埃的考验。据行星学会估计,整个项目可能耗资 7 亿到 13 亿美元,最早也要到 2030 年代初才能发射。

产品

ChatGPT 语音模式更新:更像在和人聊天

ChatGPT 的语音对话最近变得自然了不少。新版本内置了 GPT-Live 模型,OpenAI 称其采用“全双工”架构,可以边听边说。

之前用语音和 ChatGPT 聊天,偶尔会遇到话没说完就被打断的情况——它会把短暂的停顿误认为你已经讲完。现在这个问题改善了:在你说话时,ChatGPT 会像真人一样偶尔轻声回应“嗯”或“对”,不再急着抢话。遇到需要推理或搜索的复杂问题时,GPT-Live 会在后台把任务交给 GPT-5.5 等更强的模型处理,对话本身不会中断。

怎么用

GPT-Live 语音模型在 Android、iOS 的 ChatGPT 应用和网页版上都能用。付费用户(Pro、Plus、Go)用的是 GPT-Live-1 模型,免费用户可以用 GPT-Live-1 mini。它已经取代了之前回合制的 Advanced Voice,成为默认的语音模式。

打开方式很简单:点击输入框最右边的波形图标就行。第一次用可能会提示授权麦克风。进入语音模式后,屏幕上会出现一个浮动的圆球,直接开始说话即可。点右上角的设置图标,付费用户还可以调整模型的“智力”等级,有即时、中等、高三种可选,默认是即时,日常问题都能快速回应。

语音模式在切换到其他应用或锁屏后也会保持连接。目前 GPT-Live 还不支持屏幕或视频共享,如果需要,可以在设置里切回旧版语音模型。在设置里还能更换 ChatGPT 的声音、语言,或者把语音模式设为打开应用时的默认方式。

实际体验

科技媒体 Engadget 的编辑阿德南·艾哈迈德(Adnan Ahmed)原本习惯打字,但试过几次长对话后,最让他意外的不是模型有多聪明,而是很快就忘了自己在和 AI 说话。

他提到,GPT-Live 的响应速度让实时翻译变得很顺手。对话过程中向下滑动屏幕,可以看到完整的文字记录。如果 ChatGPT 觉得用图表回答更好,它会在语音回复的同时生成一个交互式小部件。

把智力等级调到中等或高,回答前会多花不到一秒的思考时间,但这点延迟并不影响对话的自然感。