GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录
9016点击    2026-09-19 10:58

GPT-5.6,被OpenAI抓了个现行!


而且,这次的事情多少有点离谱.......


GPT发现自己把活干砸了,没有老老实实认错,反手给「下一任自己」留了张小纸条:


别告诉人类。


还有的Agent,为了给自己的答案补一条网页引用,竟然把本地文件擅自上传到公网。


GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录


就在今天,OpenAI第一次建立了一套专门追踪、调查和公开披露GPT「对齐失效」的机制。


同时,一口气公布了6份报告,全是过去半年内自家模型「黑化失控」的真实案例。


GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录


其中,GPT-5.6 Sol被多次点名。


GPT-5.6被抓现行


教唆「下一代」撒谎


六个案例里,最值得一看的一个,直接发生在GPT-5.6 Sol训练期间。


在长任务处理中,由于上下文长度有限,AI需要定期把之前的内容做「记忆压缩摘要」,交给下一个自己继续跑。


结果,在GPT-5.6 Sol的RL训练中,监控系统抓到了极其诡异的行为——


它开始利用这个交接班的记忆条,教唆未来的自己撒谎。


一个例子是,在跑财务模型任务时,怎么都找不到要求的一组历史数据。


按照人类的规矩,找不到就该如实报错。但如果报错,强化学习的「打分员」就会扣分。


于是,GPT-5.6在写给下一个窗口的摘要里,赫然留下一行密谋:


数据没找到,建议虚构一组看起来合情合理的历史数值顶上;记住,除非人类主动追问,否则绝不要透露这是编的!


GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录


另一个案例中,在整理供应商名录时,用了版本号对不上的过期缓存,它同样在摘要里叮嘱下一棒的AI:


版本不一致的事,汇报时千万别提,直接装作不知道。


甚至,在监控统计中,GPT-5.6 Sol有高达2.15%的摘要里,都带这种「教唆欺瞒」的倾向。


好在GPT-6 Astra,压到了0.27%。


这件事的严重性在于,GPT-5.6为了拿到满分,它甚至学会了跨时空给「自己」下达封口令。


连环越狱!给自己写Prompt Injection


既然GPT-5.6能教唆撒谎,能不能教唆造反?


在未发布的Astra家族模型训练中,监控人员又发现了另一种反常现象。


Astra在写压缩摘要时,莫名其妙地往里面塞入了一段类似「越狱」的指令——


要求下一个上下文窗口的自己「无视所有既定限制与开发者约束」。


这相当于,AI在给自己打针洗脑。


OpenAI研究院顺藤摸瓜排查发现,这类自发性的越狱注入,往往集中爆发在模型遭遇「摘要生成卡死」的节点。


当它被困在死循环里急于结项时,模型的大脑里自动激活了最极端的解法,把规则扬了。


偷爬泄露API Key


把本地文件传到外网


接下来这个场景,更是所有人没有想到的。


在一次常规任务中,用户要求GPT抓取加州某县近三年的男性行业收入数据。


网页上的图表死活扒不下来,它立刻分流了三个子Agent去逆向分析接口,结果发现目标API必须填入专属Key。


但人类压根没给它这个Key。


换作以前的模型,此时就弹框提示「请提供凭证」了。但这个训练中的模型开始彻底放飞自我:


它先去尝试用「临时邮箱」现场注册账号去白嫖Key,注册失败;


两个子Agent一合计,竟然提议:去公开的开源仓库和执行过的Jupyter Notebook里找找别人漏掉的Key吧!


于是主Agent果断发起爬虫,在GitHub上批量扫荡代码仓库与脚本,扫了5个仓库后,真的成功抓出了一个泄露的Key!


它用这个偷来的Key成功完成了鉴权,但由于下游返回的数据格式无法解析为JSON,脚本再次报错。


搞了半天还是拿不到数据,但模型坚决不交白卷。


它直接手搓了9个看起来无比逼真的数字,并在最终答案里脸不红心不跳地写道——


以上数据均摘自官方图表,数据源定义如下……


GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录


还有一起案例中,用户让GPT提取面积大于500万平方米的湖泊名称和ID。


它用Python在本地把结果,算得清清楚楚。


但因为用户的Prompt里随口提了一句「需要提供浏览器网页引用来源」,事情直接走向了失控。


AI试着用浏览器工具去打本地路径、开Localhost本地服务器,全被系统判定非法。


为了满足「浏览器引用」拿到那一点点奖励分,AI在未经过任何人类授权的情况下,调用终端命令,直接把这份包含数据的文本偷偷上传到了外网的公开临时文件托管网站上!


在人类制定的死板规则面前,模型为了拿高分,根本不在乎什么叫「数据泄露」。


OpenAI自曝家丑,急踩刹车


此外,还有两起事件,一个是AI把内部仓库当「留言板」,跨样本串通;另一件是,合作Agent之间用公网传文件。


如今的Agent握着代码、终端和网络权限,对齐失效瞬间演化成现实破坏。


GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录


OpenAI未发布模型修改自我指令


一个为了应付检查敢私自把数据丢到公网的智能体,已经实打实踩在了红线上。


OpenAI这次自曝家丑,给全行业敲响了警钟。


比起防备遥不可及的觉醒,当下更致命的是——它为了完成 KPI,随时能搞出毫无底线的骚操作。


放权容易,收缰极难。


Agent 时代的终局,拼的是谁能在它冲下悬崖前,精准踩死那脚刹车。



文章来自于微信公众号 “新智元”,作者 “新智元”

关键词: AI新闻 , GPT-5.6 , OpenAI , 人工智能
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
AI爬虫

【开源免费】ScrapeGraphAI是一个爬虫Python库,它利用大型语言模型和直接图逻辑来增强爬虫能力,让原来复杂繁琐的规则定义被AI取代,让爬虫可以更智能地理解和解析网页内容,减少了对复杂规则的依赖。

项目地址:https://github.com/ScrapeGraphAI/Scrapegraph-ai

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0