大模型“自动修 bug”能力将提升，豆包团队开源首个多语言代码修复基准 Multi-SWE-bench

2025-04-10 02:30

4 月 10 日消息，豆包大模型团队今日通过官方公众号宣布，首个多语言类 SWE 数据集 Multi-SWE-bench 现已正式开源，可用于评估和提升大模型“自动修 Bug”能力。在 SWE-bench 基础上，Multi-SWE-bench 首次覆盖 Python 之外的 7 种主流编程语言，是真正面向“全栈工程”的评测基准。其数据均来自 GitHub issue，历时近一年构建，以尽可能准确测评和提高大模型高阶编程智能水平。

4 月 10 日消息，豆包大模型团队今日通过官方公众号宣布，首个多语言类 SWE 数据集 Multi-SWE-bench 现已正式开源，可用于评估和提升大模型“自动修 Bug”能力。

在 SWE-bench 基础上，Multi-SWE-bench 首次覆盖 Python 之外的 7 种主流编程语言，是真正面向“全栈工程”的评测基准。其数据均来自 GitHub issue，历时近一年构建，以尽可能准确测评和提高大模型高阶编程智能水平。

大模型“自动修 bug”能力将提升，豆包团队开源首个多语言代码修复基准 Multi-SWE-bench

Multi-SWE-bench 旨在推动自动编程技术从仅能解决单一语言（如 Python）和低复杂度的任务，朝着支持多语言、具备真实问题解决能力的通用型智能体迈进。

SWE-bench 是当前最具代表性的代码修复评测基准，强调任务真实、难度高。它基于 GitHub issue，要求模型自动定位并修复 Bug，兼具跨文件修改、复杂语义推理与上下文理解等挑战。

Multi-SWE-bench 旨在补全现有同类基准语言覆盖方面的不足，系统性评估大模型在复杂开发环境下的“多语言泛化能力”，推动多语言软件开发 Agent 的评估与研究，其主要特性如下：

首次覆盖 7 种主流编程语言（包括 Java、Go、Rust、C、C++、TypeScript、JavaScript），构建多语言开发环境下的代码修复任务，系统评估模型的跨语言适应与泛化能力；
引入任务难度分级机制，将问题划分为简单（Easy）、中等（Medium）和困难（Hard）三类，涵盖从一行修改到多文件、多步骤、多语义依赖的开发挑战；
1,632 个实例全部来源于真实开源仓库，并经过统一的测试标准和专业开发者的审核筛选，确保每个样本具备清晰的问题描述、正确的修复补丁以及可复现的运行测试环境。

大模型“自动修 bug”能力将提升，豆包团队开源首个多语言代码修复基准 Multi-SWE-bench

IT之家附开源链接：

Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving：

论文链接：https://arxiv.org/ abs / 2504.02605
榜单链接：https://multi-swe-bench.github.io
代码链接：https://github.com/ multi-swe-bench / multi-swe-bench
数据链接：https://huggingface.co/ datasets / ByteDance-Seed / Multi-SWE-bench

Ollama的介绍与测试

一、Ollama介绍Ollama是一个开源工具，专为在本地机器上便捷部署和运行大型语言模型（LLM）而设计。它提供了一个简洁高效的界面，让用户能够轻松地创建、执行和管理这些复杂的模型。此外，Ollama还配备了一个丰富的预构建模型库，使得这些模型能够无缝集成到各种应用程序之中，大大提升了开发效率和用户体验。

3/10/2025 8:30:00 AM

Python伊甸园

Ollama的配置修改与接口调用

一、修改环境变量1.1 配置远程访问在我们本地部署好ollama之后，仅支持本机访问，我们可以通过修改环境变量让其他人可以远程访问。在wins电脑上增加环境变量：复制1.2 配置本地模型路径1.2.1 本地模型默认路径wins本地模型默认路径：C:\Users\%username%\.ollama\models。这里 %username% 是当前登录的用户名。

3/10/2025 9:00:00 AM

Python伊甸园