A strong model starts with strong data.
Behind MiniCPM5-2B is a growing body of open-source training data from OpenBMB.
The latest releases include UltraData-Code, UltraData-SFT-Agent-2609, UltraData-RL-2609, and UltraX, covering code, agent training, RL, and large-scale data refinement.
🔹 UltraX A function-calling approach to data refinement, turning fine-grained edits into executable operations. Its open preview contains ~100B tokens across five refined web datasets.
🔹 UltraData-Code UltraData-Code-L2 (~400B tokens) and UltraData-Code-L3 (~150B tokens) across 11 programming languages.
🔹 UltraData-SFT-Agent-2609 ~500K agent training samples spanning Search, Code Agent, General Agent, and tool use, with tasks covering web search, software engineering, multi-turn memory, database interaction, and more.
🔹 UltraData-RL-2609 80K+ RL samples across math, coding, knowledge, and long-context tasks, carefully filtered for verifiability, reward reliability, and difficulty matching.