Permissively licensed source code dataset spanning over 300 programming languages, used to pretrain code-generation LLMs.
The Stack is a large-scale source code dataset assembled by the BigCode project, aggregating permissively licensed code from public repositories across more than 300 programming languages. The dataset is deduplicated and filtered to prioritize code released under licenses that permit reuse, with tooling provided for repository owners to opt out of inclusion. It represents one of the most comprehensive open corpora available for training code-focused language models.
The Stack Is Primarily Used To Pretrain And Fine-tune Large Language Models For Code Generation, Code Completion, And Code Understanding Tasks. Researchers Use It To Study Cross-language Code Representation, Program Synthesis, And The Effect Of Code Data Scale And Diversity On Model Performance. It Has Been Foundational In Training Several Open-source Code Llms, Including The Starcoder Family Of Models.
Other
© 2026 - Copyright AIKosh. All rights reserved.