Code datasets for pretraining
Orion
Orion-zhen
AI & ML interests
Eco-friendly training using Tesla P4. Prefers (FSDP+)QLoRA.
Recent Activity
updated a Space 7 days ago
Orion-zhen/tokenize-it updated a Space 23 days ago
Orion-zhen/vertin-tts updated a dataset 23 days ago
Orion-zhen/vertin-voicesOrganizations
Qwen3-Dense-AWQ
AWQ quantization of Qwen3 Dense series at Day0!
🤯Emoji datasets
All for emoji!
Calibration datasets
Datasets used for various calibrations
Unalignments
Datasets used to unalign models
Free Spaces
Powerful apps built on free HF space
Qwen2.5 Series
Llama3-Orion
My llama3 models
-
Orion-zhen/Llama3-70B-Orion-Chinese
Text Generation • 71B • Updated • 11 • • 14 -
Orion-zhen/Llama3-70B-Orion-Chinese-SE
Text Generation • 71B • Updated • 10 -
Orion-zhen/Llama3-70B-Orion-Chinese-Plus
Text Generation • 71B • Updated • 11 -
Orion-zhen/Llama3-70B-Orion-Chinese-Ultra
Text Generation • 71B • Updated • 9 • 1
Reasoning
Datasets focus on reasoning
Code4Pretrain
Code datasets for pretraining
Free Spaces
Powerful apps built on free HF space
Qwen3-Dense-AWQ
AWQ quantization of Qwen3 Dense series at Day0!
Qwen2.5 Series
🤯Emoji datasets
All for emoji!
Llama3-Orion
My llama3 models
-
Orion-zhen/Llama3-70B-Orion-Chinese
Text Generation • 71B • Updated • 11 • • 14 -
Orion-zhen/Llama3-70B-Orion-Chinese-SE
Text Generation • 71B • Updated • 10 -
Orion-zhen/Llama3-70B-Orion-Chinese-Plus
Text Generation • 71B • Updated • 11 -
Orion-zhen/Llama3-70B-Orion-Chinese-Ultra
Text Generation • 71B • Updated • 9 • 1
Calibration datasets
Datasets used for various calibrations
Reasoning
Datasets focus on reasoning
Unalignments
Datasets used to unalign models