OpenAI o3 与 o4-mini 推理模型解析:MMMU 82.9% 超越 o1,图像直接接入推理链
结论先行:2025 年 4 月 16 日,OpenAI 发布了 o 系列的两款新推理模型——o3 与 o4-mini。真正值得关注的不是”又涨了几个点”,而是 o3 做出了一个此前没有过的动作:把图像直接放進思维链,…
结论先行:2025 年 4 月 16 日,OpenAI 发布了 o 系列的两款新推理模型——o3 与 o4-mini。真正值得关注的不是”又涨了几个点”,而是 o3 做出了一个此前没有过的动作:把图像直接放進思维链,…
结论先行:Qwen VLo 是阿里达摩院通义千问团队在 2025 年 6 月 26 日发布的多模态模型,主打”从感知到生成“的统一——同一个模型既能理解图像内容,也能根据自然语言指令完成高质量的图像生成与编辑。它的两…
结论先行:蚂蚁集团在 2025 年 6 月 26 日发布的 AI 健康应用 AQ,核心并不是”又一个聊天机器人”,而是把大模型能力接到真实医疗资源上。官方公布的数据显示,它已接入全国超 5000 家医院、近百万医生资…
结论先行:腾讯在 2025 年 5 月 20 日发布的”混元游戏”视觉生成平台,主打首个面向游戏工业级内容生产的 AIGC 引擎。官方给出最具冲击力的一组对比是:部分传统流程中需要耗时 12 小时的建模准备工作,在该…
结论先行:微软在 2025 年 4 月发布的 UFO²(Desktop AgentOS),把桌面智能代理从”自动化脚本”升级为一套操作系统级方案。官方测试数据显示,在两组不同的自动化任务场景中,UFO² 的成功率分别…
结论先行:MiniMax(稀宇科技)在 2025 年 6 月 17 日发布的 MiniMax-M1,是一枚主打开源的大规模混合架构推理模型。它把参数量做到 4560 亿(456B),上下文输入上限拉到 100 万 Token,推理输出长度做…
一句话结论:2025 年 2 月 25 日,Anthropic 发布 Claude 3.7 Sonnet——它被称为首款「混合推理模型」,同时具备推理模式与传统实时生成模式,并首次让开发者通过「草稿纸」精确控制模型的思考方式与响应时间(可限…
一句话结论:2025 年 3 月 16 日,百度推出新一代原生多模态基础大模型文心大模型 4.5,在文心一言官网免费开放,并通过千帆平台开放 API——输入价格低至 0.004 元/千 tokens,输出 0.016 元/千 tokens。…
一句话结论:MoonshotAI 开源的音频基础模型 Kimi-Audio,用「音频分词器 + 音频大模型 + 音频去分词器」的三段式集成架构,把语音识别、音频理解、音频转文本和语音对话四类任务收进同一个模型,在 LibriSpeech 测…
一句话结论:2025 年 3 月 4 日,智谱发布 CogView4,这是全球首个支持生成汉字的开源文生图模型,在 DPG-Bench 基准测试中综合评分排名第一,达到当时开源文生图模型的最先进水平(SOTA),并遵循 Apache 2.0…