shubhamprshr
/

Llama-3.2-3B-Instruct_blocksworld1246_sgrpo_classic_0.5_0.5_True_300

Text Generation

Generated from Trainer

text-generation-inference

Model card Files Files and versions Community

Llama-3.2-3B-Instruct_blocksworld1246_sgrpo_classic_0.5_0.5_True_300 / .hydra /overrides.yaml

shubhamprshr's picture

Training in progress, step 300

c3e7cbc verified 14 days ago

history blame contribute delete

319 Bytes

	- mode=train
	- task=blocksworld1246
	- algorithm=sgrpo
	- model=llama3
	- algorithm.training.per_device_train_batch_size=2
	- algorithm.training.curriculum_schedule=classic
	- algorithm.training.scheduler_params.mu_exp=0.5
	- algorithm.training.scheduler_params.sigma=0.5
	- algorithm.training.vllm_gpu_memory_utilization=0.5