在国际公认难度最高的软件工程评测基准SWE-bench-Live(Lite分榜)中,联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash,以71%的问题解决率登顶全球第一,并正式通过官方Verified审核认证。
为什么这个第一有含金量
不同于传统代码测试只考单函数生成,SWE-bench-Live以真实GitHub项目为基础,要求模型生成可执行的代码补丁并通过验收测试,是当前全球软件工程领域最权威的动态评测基准。官方设有Verified核验机制,所有参评方案必须提交全链路智能体运行轨迹,由官方团队严格审查信息隔离环境,并彻底排查是否存在向智能体泄露测试用例或结果的可能。
TianxiCode的技术底座
若把TianxiCode配合DeepSeek-v4.1-Flash比作一个软件工程师,DeepSeek-v4.1-Flash是大脑负责语义理解与构思解法,TianxiCode则是执行者——负责跨文件多跳检索、精准上下文管理、自驱动多轮工具调用、闭环补丁生成与测试驱动自愈。遇到Bug会主动列排错计划、运行测试、翻阅日志,比肩真人程序员的工程习惯。
代码智能体进入第一梯队
联想天禧AI聚焦代码生成与工程开发的子能力,未来将直接应用到联想AI硬件产品中。业内评价认为,缺乏顶层智能体架构协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策——TianxiCode此次登顶,证明了自研工程底座的决定性力量。
智能体框架的下一站
代码智能体的最终价值,不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本。联想天禧AI表示,将持续推动TianxiCode的技术成果向开发者实际工具链沉淀,让安全、高效、真正具备自主问题解决能力的专业代码工具深度赋能到联想的硬件设备中。延伸阅读:字节Seed揭示DeepSeek-V4位置效应,同一信息换个位置检索准确率相差40.2%
相关阅读:字节Seed揭示DeepSeek-V4位置效应:同题准确率最大相差40.2个百分点、字节Seed发现DeepSeek-V4相位敏感性:同一信息换个位置准确率相差40.2%
延伸阅读
- DeepSeek Harness 桌面端安装教程:官网下载、4种模式与安全边界2 周前
- 阿里巴巴云栖大会:Qwen 4 训练中,真武V900 芯片 3 倍算力、50 万卡集群4 天前
- 美团 LongCat-2.5-Preview 发布:1.6T参数、1M上下文,多模态进基座2 周前
- Kimi K3.1 后台标识泄露,100 万 Token 配三档推理2 周前
