Source symbols: scripts/base_train.py
Deterministic, value-free symbol metadata extracted from public source. Implementations and literal values are not copied into this page.
- Revision: master@92d63d4e8bb4df75c3b71618f31ddde2378b2bcd · 2026-07-04T18:18:25Z
- Declarations: 7
- Referenced calls: 95
Declared symbols
build_model_meta— def at line 129; referencesGPTConfig,device,GPT,asdict,print0,to_empty,init_weights,get_base_dir,join,load_checkpoint,load_state_dict,isinstance,min,from_recipe_name,sum,modules,convert_to_float8_training,typefp8_module_filter— def at line 178; referencesisinstance,min,from_recipe_name,sum,modules,convert_to_float8_training,type,print0disable_fp8— def at line 196; referencesnamed_modules,type,rsplit,get_submodule,append,Linear,setattr,compile,num_scaling_params,print0,items,estimate_flops,get_scaling_params,int,build_model_meta,round,log2,sqrt,setup_optimizer,load_state_dictget_scaling_params— def at line 263; referencesnum_scaling_params,int,build_model_meta,round,log2,print0,sqrt,setup_optimizer,load_state_dict,GradScaler,tokenizing_distributed_data_loader_with_state_bos_bestfit,tokenizing_distributed_data_loader_bos_bestfit,next,ValueError,cos,float,and,eval,build_val_loader,disable_fp8get_lr_multiplier— def at line 360; referencesround,cos,float,print0,and,eval,build_val_loader,disable_fp8,evaluate_bpb,logget_muon_momentum— def at line 372; referencesround,cos,float,print0,and,eval,build_val_loader,disable_fp8,evaluate_bpb,logget_weight_decay— def at line 385; referencescos,float,print0,and,eval,build_val_loader,disable_fp8,evaluate_bpb,log
File-level call references
print_banner— line 37ArgumentParser— line 41add_argument— line 43parse_args— line 80vars— line 81copy— line 81autodetect_device_type— line 85compute_init— line 86get_device_name— line 91get_peak_flops— line 92print0— line 93float— line 95DummyWandb— line 100init— line 100get_tokenizer— line 121get_token_bytes— line 122get_vocab_size— line 123GPTConfig— line 136device— line 141GPT— line 142build_model_meta— line 146asdict— line 148to_empty— line 150init_weights— line 151get_base_dir— line 154join— line 156load_checkpoint— line 160load_state_dict— line 161isinstance— line 179min— line 183from_recipe_name— line 187sum— line 188modules— line 188convert_to_float8_training— line 189type— line 190named_modules— line 206rsplit— line 209get_submodule— line 210append— line 214Linear— line 223setattr— line 233compile— line 246num_scaling_params— line 252items— line 254estimate_flops— line 257get_scaling_params— line 268int— line 269round— line 283log2— line 283sqrt— line 302setup_optimizer— line 308GradScaler— line 324tokenizing_distributed_data_loader_with_state_bos_bestfit— line 331tokenizing_distributed_data_loader_bos_bestfit— line 332next— line 333ValueError— line 353cos— line 386and— line 421eval— line 422build_val_loader— line 423disable_fp8— line 425evaluate_bpb— line 426log— line 430train— line 436evaluate_core— line 445Engine— line 468tokenizer— line 470generate_batch— line 472decode— line 473save_checkpoint— line 478state_dict— line 481synchronize— line 508time— line 509range— line 510model— line 511detach— line 512scale— line 515backward— line 515get_lr_multiplier— line 520get_muon_momentum— line 521get_weight_decay— line 522unscale_— line 529is_ddp_initialized— line 533_found_inf_per_device— line 534values— line 534all_reduce— line 535step— line 536update— line 537zero_grad— line 540item— line 541collect— line 590freeze— line 591disable— line 592finish— line 603compute_cleanup— line 604
Source: scripts/base_train.py