定位:一个开放科学合作项目
StarCoder 不是某家公司的产品线,而是 BigCode 这个开放科学合作项目的产出。官网对项目的定义是「致力于负责任地开发与使用面向代码的大语言模型」,并公开列出一批支持机构。这个出身决定了两件事:一是一切东西——模型权重、训练数据、评测方法、许可条款——都以公开文档的形式呈现;二是它更在意数据合规与可复现,而不是把模型包成一个卖钱的接口。理解这一点,才能理解为什么它连「数据怎么申请移除」都写成了文档。
StarCoderStarCoder 是 BigCode 开源科学合作项目产出的代码模型线:StarCoder2 有 3B、7B、15B 三档,用覆盖 600 多种语言的 The Stack v2 训练、上下文 16K;项目同时公开经过许可净化的代码数据集与评测工具。

深度介绍
StarCoder 不是某家公司的产品线,而是 BigCode 这个开放科学合作项目的产出。官网对项目的定义是「致力于负责任地开发与使用面向代码的大语言模型」,并公开列出一批支持机构。这个出身决定了两件事:一是一切东西——模型权重、训练数据、评测方法、许可条款——都以公开文档的形式呈现;二是它更在意数据合规与可复现,而不是把模型包成一个卖钱的接口。理解这一点,才能理解为什么它连「数据怎么申请移除」都写成了文档。
官方模型文档把这条线列得很完整。较早的 SantaCoder 相当于「小号 StarCoder」:架构相同,但只用 Python、Java、JavaScript 三种语言训练。随后是 StarCoderBase,用 The Stack 里 80 多种语言训练;StarCoder 则是在它基础上继续用 Python 训练;StarCoder+ 是继续用英文网页数据训练。此外还有编码器模型 StarEncoder 与基于它的人名信息检测模型 StarPii。当前的主力是 StarCoder2,提供 3B、7B 与 15B 三档参数。
官方仓库给出的规格是:StarCoder2 用 The Stack v2 里 600 多种编程语言加上一部分自然语言语料(官方举例包括维基百科、论文与代码托管平台的议题)训练;采用分组查询注意力,上下文窗口 16,384 个 token,并配 4,096 token 的滑动窗口注意力;3B 与 7B 两档训练了 3 万亿以上 token,15B 档训练了 4 万亿以上 token。官方还提供了技术论文供核对细节。对想在有限显存里跑起来的团队,这套档位划分比单一超大模型更实用。
官方仓库里有一句必须提前知道的话:StarCoder2 系列是「为代码补全设计的,不是指令模型」,像「写一个计算平方根的函数」这样的命令式提问效果并不好。这句提示能省下不少试错时间——如果你的场景是让模型执行任务而不是续写代码,应当去找指令微调版本或别的模型。项目确实另外放出了指令微调版本,官方也用自举方式构造了指令数据,但主线模型的设计目标始终是补全。
官方文档直接给了内存数字,方便先算硬件再决定档位:15B 模型全精度加载约 32.2 GB 显存,8 位量化降到约 16.9 GB,4 位量化约 9.2 GB。部署路径有三条——用 transformers 直接加载并指定半精度或量化配置、用文本生成推理的官方容器镜像起一个服务、或用管道接口在脚本里调用;多卡可以交给自动设备映射。这些说明都写在仓库里,不需要自己试错。
项目最常被引用的产出其实是数据集。官方文档说明 The Stack 是一份 6.4 TB、覆盖 358 种编程语言、只收录宽松许可源码的数据集。版本演进也写得很清楚:初始版本收录 30 种语言与 18 种宽松许可,其中三类弱著佐权许可(MPL、EPL、LGPL)后来被剔除,宽松许可清单扩展到 193 种,语言数量也一并增加;近重复去重后的规模约 3 TB。后续还发布了第二代数据集,用于训练 StarCoder2。
这个项目在数据合规上做了几件少见的事:提供「我的代码是否在数据集里」的检索工具,提供移除申请通道,并说明可以将数据排除在未来版本之外;公布的许可条款是面向负责任使用的开放许可,模型与数据集各有对应条款。此外还有专门的人名等个人信息检测模型,用于筛查语料中的敏感信息。对需要向法务或客户解释训练数据来源的团队,这套文档本身就是可引用的依据。
项目的近期重心转向评测。官方在 2025 年 10 月公布了一个代码生成的「人类在环」擂台:让人给出编程任务,两个模型分别生成方案,平台把两段代码都实际执行,再由用户看运行结果投票,结果汇总成排行榜。官方称这是第一个通过执行来评测代码生成模型的此类平台。同一篇公告还放出两个新基准,一个用于评测奖励模型,一个做自动化代码生成评测,并把相关代码开源。需要注意的是,模型仓库本身自 2024 年 3 月起就没有新的提交,说明团队当前的精力主要放在评测与工具上,而不是继续出新一代模型。
产品特点
这条线不只放模型权重,还把 6.4 TB、覆盖 358 种语言、只含宽松许可源码的训练数据集一并公开,并附上检索与退出工具。对想自己微调、又必须在数据来源上说清楚的团队,这种透明度省掉了大量尽调成本。
仓库文档明确写着这批模型为代码补全而设计、不擅长命令式提问。选型时这条提示很值钱:如果你的需求是「让它按一句话完成任务」,直接换指令微调版本或别的模型,比在这条线上反复调提示词更省时间。
官方把 15B 模型在全精度、8 位与 4 位三种加载方式下的内存占用都列了出来,分别是约 32 GB、17 GB 与 9 GB 量级。买卡或租卡之前就能算清楚跑哪一档,不必先下载再发现放不下。
项目的擂台不是让人读代码打分,而是把两个模型的输出都跑起来、看实际运行结果再投票,并配套开源了奖励模型评测与自动化评测两个基准。对关心「模型写的东西到底能不能跑」的人来说,这比只看合成基准分数更有参考价值。
最近动态
官方公告称已上线代码生成的人类在环评测平台:用户提交编程任务,两个模型各自生成方案,平台实际执行两段代码,再由用户依据运行结果投票,结果汇入排行榜。公告同时提到平台已积累数月的社区评测数据,并披露了语言与框架流行度、用户交互模式等观察;另配套发布两个新基准,分别面向代码奖励模型评测与自动化代码生成评测,相关实现全部开源。
项目的模型库里在这一时期新增了 15B 档的指令微调版本,同时公开了一份通过执行过滤得到的自举指令数据集。这条路线可以理解为:主线模型负责补全,指令能力通过额外的微调与数据构造补齐。对需要指令式交互又要开源权重的团队,这一版比直接使用补全模型更合适。
官方在这一时期发布了 StarCoder2 的 3B、7B 与 15B 三档模型,训练数据换成覆盖 600 多种语言的第二代数据集并混入部分自然语言语料,采用分组查询注意力、16K 上下文与 4K 滑动窗口注意力,参数较小的两档训练了 3 万亿以上 token、最大档 4 万亿以上,并同步发布技术论文。这是这条线上最近的一次模型代际更新。
StarCoder 不是某家公司的商业产品,而是 BigCode 这个开放科学合作项目的产出。项目官网把自己定义为「致力于负责任地开发与使用面向代码的大语言模型」,并公开列出一批支持机构。这决定了它的形态:模型权重、训练数据、评测方法与许可条款都以公开文档呈现,重点在数据合规与可复现。 模型线按时间顺序是:SantaCoder,架构与后续模型相同但只用 Python、Java、JavaScript 三种语言训练;StarCoderBase,用 The Stack 里 80 多种语言训练;StarCoder,在它基础上继续用 Python 训练;StarCoder+,继续用英文网页数据训练;另有编码器模型 StarEncoder 与基于它的人名信息检测模型 StarPii。当前主力 StarCoder2 提供 3B、7B、15B 三档,用 The Stack v2 的 600 多种编程语言加部分自然语言语料训练,采用分组查询注意力、16,384 token 上下文与 4,096 token 滑动窗口注意力;3B 与 7B 训练了 3 万亿以上 token,15B 训练了 4 万亿以上。官方仓库特别说明这批模型是为代码补全设计的、不是指令模型,命令式提问效果不好。显存方面官方给出了参考值:15B 全精度约 32.2 GB、8 位约 16.9 GB、4 位约 9.2 GB,部署可用 transformers、官方容器镜像或管道接口。 数据集方面,The Stack 是 6.4 TB、覆盖 358 种编程语言、只含宽松许可源码的语料库;初始版本收录 30 种语言与 18 种宽松许可,随后剔除了 MPL、EPL、LGPL 三类弱著佐权许可并把宽松许可清单扩到 193 种、语言数量同步增加,近重复去重后约 3 TB,后续还发布了第二代用于训练 StarCoder2。治理上提供「代码是否在数据集中」的检索工具、移除申请通道、可排除未来版本的选项,以及人脸之外的个人信息检测模型,许可条款为面向负责任使用的开放许可。 近期重心转向评测:官方在 2025 年 10 月公布了一个代码生成的人类在环擂台,让人提交任务、两个模型分别生成、平台实际执行代码后由用户依据运行结果投票并汇入排行榜,官方称这是第一个通过执行来评测代码生成模型的此类平台,同时放出面向奖励模型与自动化生成的两个新基准并开源实现。需要如实说明的是,模型仓库自 2024 年 3 月起没有新的提交,团队当前精力主要放在评测与工具上。
核验信息
本页事实来自官方渠道:项目官网(开放科学合作定位与目标)、模型总览文档(SantaCoder 与 StarCoderBase 与 StarCoder 与 StarCoder+ 与编码器及个人信息检测模型的谱系、配套工具与许可入口)、数据集与治理文档(6.4 TB 与 358 种语言与宽松许可口径、各版本的语言与许可变化、检索与移除与排除未来版本的处理方式)、StarCoder2 官方仓库与模型卡(三档参数、训练数据来源与语言数量、分组查询注意力与 16K 上下文与 4K 滑动窗口、训练 token 规模、仅面向补全而非指令的说明、三种精度下的内存占用与部署路径、技术论文)、代码模型排行榜与评测擂台页面,以及 2025 年 10 月的官方评测平台公告(人类在环与执行结果投票机制、两个新基准与开源说明)。页内未列出第三方模型名称。价格与状态核验于 2026 年 9 月 22 日。
StarCoder介绍页面对您是否有帮助?