斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5
斯坦福实验实锤: 魔改后的DS V4 Flash干翻Fable 5同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
搜索
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
A社的王牌旗舰Fable 5,卖不动了。
Anthropic又有两张「新牌」,被提前掀开了!今天,第三方开发者应用和Discord社区中,接连出现了两个陌生的模型ID——claude-mashmallow-eap(棉花糖) 和claude-melon-eap(甜瓜)
这期节目的嘉宾黄东旭,就是Token Maxing热潮的亲历者。他曾经只用最前沿的模型,每天账单三四百美元。让他转变的,是前沿模型的智力碾压和中国开源模型们的崛起——Fable 5可以一句话终结Agent群的讨论,同时大量的日常任务可以做到“只烧电费,不烧Token”。他的结论是:不是前沿模型用不起,而是本地开源模型底座+前沿模型的搭配,成本可控,更具性价比。
今天上午,OpenRouter 没有举行发布会,也没有公布技术报告,只用一个忍者表情放出了一款代号为“Ox Alpha”的神秘模型。“Ox”在英文中正有“牛”的意思,于是,一场属于 AI 行业的“牛来”也开始了。
就在今天,Fable 5.1被曝已开启灰度测试。
一个 Skill,就能让 DeepSeek V4 Pro 超过 Fable 5?
AI自动科研的时代,彻底爆发了!
DeepSeek-v4-pro-0813 正式上线,两极分化的口碑却让人摸不着头脑。一边,是疯狂刷屏的评测夯爆了:多项 Agent 测试逼近 Fable 5,被认为是又一次前沿模型的“核弹级”更新;另一边,却是不少深夜忠实开发者直摇头:吐槽涨价、模型能力不及预期,实测体感甚至不如之前的小模型……
近日,Oh My Pi 作者 can1357 在 X 上发文,展示了利用模型 API 漏洞,直接提取 GPT-5.6、Claude Fable 5 等顶级模型完整内部推理记录的方法。他发现,做到这些并不用破解加密,只需要关闭模型的隐藏思考,再给它一个思考工具,就能让模型主动输出内部推理格式。