联想天禧TianxiCode登顶SWE-bench:71%准确率超越GPT-6

联想天禧AI自主研发的专业代码智能体框架TianxiCode,配合DeepSeek大模型,在国际公认难度最高的软件工程评测SWE-bench-Live分榜中斩获全球第一,以71%的问题解决率刷新纪录。SWE-bench是评估智能体生成代码补丁、修复真实GitHub项目问题能力的权威榜单,提供可复现的执行环境,并要求提交全链路智能体运行轨迹供官方审查,被视为代码智能体领域的「奥林匹克」。

真实工程能力获国际认证

与单纯考查代码片段生成的评测不同,SWE-bench-Live要求智能体完整处理从问题定位到补丁生成的全流程,并经官方团队严格审查信息隔离环境,确保没有向智能体泄露标准答案。TianxiCode此次超越包括GPT-6在内的一众顶级模型,意味着联想在代码智能体领域已跻身国际第一梯队。

三大系统工程能力拆解

TianxiCode展现出跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大核心能力。遇到Bug时,它会主动列出排错计划、打开终端运行测试、翻阅日志、比对修改记录;遇到解决不了的问题还会灵活换思路继续推进。在隔离环境中自动运行代码,发现新代码报错即立刻自我反思与修改,直至补丁通过项目验收。

天禧AI生态再落关键棋子

此次TianxiCode登顶,是联想天禧AI生态在专业技术领域的关键布局。TianxiCode负责阅读代码、理解语义、构思解法,而大模型则充当工程师的大脑,两者配合突破了「聪明大脑缺手」的困境。未来天禧AI将持续推动TianxiCode向开发者实际工具链沉淀,降低一线工程师的排错与工程协同成本。

相关阅读:星动纪元VPP2登顶RoboDojo:真机58.5%超越GPT-6