CrisisOps
OpenEnv RL env where agents act as crisis commanders: verify reports, allocate resources, and publish sitreps.
Hosted on HuggingFace.
124M LLM checkpoints from scratch training, continued pre-training, and SFT.
123.6M-parameter decoder-only LM trained from scratch on 2B FineWeb-Edu tokens. RoPE, RMSNorm, SwiGLU, tied embeddings.
Continued pre-training checkpoint: 1B additional tokens on a mixed recipe atop mrinaal-124m-base.
Instruction-tuned checkpoint: mrinaal-124m-base-v2 SFT on the first 50k valid SmolTalk examples.
Continued pre-training checkpoint: 1.5B additional math-heavy mixed-recipe tokens atop mrinaal-124m-base-v2; best val loss 2.6333.
Instruction-tuned checkpoint: mrinaal-124m-base-v3-mathmix SFT on 150k valid SmolTalk examples; best val loss 1.6581.
LoRA cold-start SFT teaching structured reasoning to Nanbeige4-3B-Base from distilled frontier traces.
OpenEnv RL env where agents act as crisis commanders: verify reports, allocate resources, and publish sitreps.
OpenEnv RL env for biology experiment planning under partial observability, noisy outputs, and budget limits.
OpenEnv RL env where agents clean malformed JSON to a target schema across four difficulty levels.