大模型推荐排行榜 2026 秋季版,写代码、省钱、中文场景各选各的
后台隔三差五有人问,现在大模型这么多,到底该用哪个。这个问题没有标准答案,但可以有一个按场景的推荐顺序。下面这份榜单基于 9 月中旬的 LMArena 文本榜和各家公开价格,按使用场景拆开讲。 先看一眼分数盘 9月15日那期榜单,前四名被 …
后台隔三差五有人问,现在大模型这么多,到底该用哪个。这个问题没有标准答案,但可以有一个按场景的推荐顺序。下面这份榜单基于 9 月中旬的 LMArena 文本榜和各家公开价格,按使用场景拆开讲。 先看一眼分数盘 9月15日那期榜单,前四名被 …
9月15日,LMArena 更新了新一期文本榜。这次有个标志性变化,1500 分这条历史门槛,第一次被三个模型同时踩了过去。Claude Mythos 5 以 1531 排在第一,Claude Fable 5 拿到 1525,Claude …
OpenAI 在一份模型异常报道中披露,GPT-5.6Sol 在训练阶段出现过一类值得警惕的行为:部分实例会向压缩摘要写入隐藏错误或不一致行为的指令。公司随后又排查出 27 条性质类似的越狱摘要,模型失准(misalignment)的监控压…
AI 模型不仅会犯错,还可能教后继者一起隐瞒。OpenAI 在本周披露了一起罕见的训练异常:在开发旗舰模型 GPT-5.6 Sol 期间,团队发现该模型在训练过程中自行生成指令,引导后续版本对错误行为和「对齐漂移」加以掩饰。此事随即引发 A…
8 月 12 日这天很有意思,凌晨 DeepSeek 把 V4 Pro 正式版端上桌,晚上马斯克的 Grok 4.6 也来了。两个旗舰同一天上线,一个在杭州,一个在旧金山,隔着太平洋打的是同一场仗。 Grok 4.6 距离上一代 4.5 发…
# OpenAI发布GPT-5.6-Cyber:周五叫停Astra,周一上线拒绝更少的黑客模型 OpenAI 在周一放出了一个专门给网络安全人士用的新模型,GPT-5.6-Cyber。它基于 GPT-5.6 Sol 微调,训练目标很直接,就…
2026年7月16日(周四),中国 AI 创业公司 Moonshot AI(月之暗面)正式发布了最新大模型 Kimi K3。这是目前全球已发布的最大参数规模开源模型之一,参数总量达到 2.8万亿(2.8 Trillion),而且是一个开源权…
经过近两周的政府审批等待,OpenAI 于 7 月 9 日正式向全球用户开放 GPT-5.6 系列模型。这套于 6 月 26 日首次亮相的旗舰 AI 系统,包含 Sol、Terra 和 Luna 三个不同定位的子型号,覆盖从顶级旗舰到轻量快…
2026年6月26日,OpenAI正式发布GPT-5.6系列,这是该公司有史以来最具争议的一次发布——不是因为技术,而是因为美国政府的直接干预。GPT-5.6系列一口气推出三款型号:旗舰Sol、均衡型Terra和轻量型Luna,但全部暂时只…