-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathtrain-tool-call-skill-ministral3-8b-bf16.sh
More file actions
executable file
·54 lines (46 loc) · 3.52 KB
/
Copy pathtrain-tool-call-skill-ministral3-8b-bf16.sh
File metadata and controls
executable file
·54 lines (46 loc) · 3.52 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
#!/bin/bash
set -euo pipefail
REPO_ROOT="$(cd "$(dirname "$0")" && pwd)"
cd "$REPO_ROOT"
export STORAGE_PATH="${STORAGE_PATH:-${SKILL_SP_OUTPUT_DIR:?SKILL_SP_OUTPUT_DIR must be set}/Skill-SP}"
export HUGGINGFACENAME="${HUGGINGFACENAME:-skill-sp}"
export API_BANK_DATA_DIR="${API_BANK_DATA_DIR:-${REPO_ROOT}/benchmarks/API-Bank}"
export SKILL_SP_LIBRARY_PATH="${SKILL_SP_LIBRARY_PATH:-${STORAGE_PATH}/skill_library/skills.json}"
export WANDB_PROJECT="${WANDB_PROJECT:-Skill-SP-ministral3-8b-bf16}"
export SKILL_SP_TRAINER_PROJECT_NAME="${SKILL_SP_TRAINER_PROJECT_NAME:-$WANDB_PROJECT}"
export MINISTRAL3_MODEL_PATH="${MINISTRAL3_MODEL_PATH:-${SKILL_SP_MODEL_ROOT:?SKILL_SP_MODEL_ROOT must be set}/Ministral-3-8B-Instruct-2512-BF16}"
export SKILL_SP_MAX_PROMPT_LENGTH=${SKILL_SP_MAX_PROMPT_LENGTH:-8192}
export SKILL_SP_MAX_RESPONSE_LENGTH=${SKILL_SP_MAX_RESPONSE_LENGTH:-8192}
export SKILL_SP_GENERATE_MAX_TOKENS=${SKILL_SP_GENERATE_MAX_TOKENS:-4096}
export SKILL_SP_EVALUATE_MAX_TOKENS=${SKILL_SP_EVALUATE_MAX_TOKENS:-$SKILL_SP_MAX_RESPONSE_LENGTH}
export SKILL_SP_REWARD_MAX_TOKENS=${SKILL_SP_REWARD_MAX_TOKENS:-$SKILL_SP_MAX_RESPONSE_LENGTH}
export SKILL_SP_BENCHMARK_MAX_TOKENS=${SKILL_SP_BENCHMARK_MAX_TOKENS:-$SKILL_SP_EVALUATE_MAX_TOKENS}
export SKILL_SP_MAX_NUM_BATCHED_TOKENS=${SKILL_SP_MAX_NUM_BATCHED_TOKENS:-$((SKILL_SP_MAX_PROMPT_LENGTH + SKILL_SP_MAX_RESPONSE_LENGTH))}
export SKILL_SP_MAX_MODEL_LEN=${SKILL_SP_MAX_MODEL_LEN:-$((SKILL_SP_MAX_PROMPT_LENGTH + SKILL_SP_MAX_RESPONSE_LENGTH))}
export SKILL_SP_QUESTIONER_MAX_RESPONSE_LENGTH=${SKILL_SP_QUESTIONER_MAX_RESPONSE_LENGTH:-4096}
export SKILL_SP_QUESTIONER_MAX_NUM_BATCHED_TOKENS=${SKILL_SP_QUESTIONER_MAX_NUM_BATCHED_TOKENS:-$((SKILL_SP_MAX_PROMPT_LENGTH + SKILL_SP_QUESTIONER_MAX_RESPONSE_LENGTH))}
export SKILL_SP_QUESTIONER_TEMPERATURE=${SKILL_SP_QUESTIONER_TEMPERATURE:-0.8}
export SKILL_SP_QUESTIONER_TOP_P=${SKILL_SP_QUESTIONER_TOP_P:-0.95}
export SKILL_SP_QUESTIONER_VAL_TEMPERATURE=${SKILL_SP_QUESTIONER_VAL_TEMPERATURE:-$SKILL_SP_QUESTIONER_TEMPERATURE}
export SKILL_SP_ENABLE_VLLM_CONTEXT_LIMIT=${SKILL_SP_ENABLE_VLLM_CONTEXT_LIMIT:-1}
export VLLM_DEEP_GEMM_WARMUP=${VLLM_DEEP_GEMM_WARMUP:-skip}
export SKILL_SP_DYNAMIC_TARGET_GROUPS=${SKILL_SP_DYNAMIC_TARGET_GROUPS:-128}
export SKILL_SP_SOLVER_DATASET_SIZE=${SKILL_SP_SOLVER_DATASET_SIZE:-8000}
export SKILL_SP_SOLVER_GENERATE_SAMPLES_PER_SHARD=${SKILL_SP_SOLVER_GENERATE_SAMPLES_PER_SHARD:-4000}
export SKILL_SP_SOLVER_DATA_MAX_ATTEMPTS=${SKILL_SP_SOLVER_DATA_MAX_ATTEMPTS:-10}
export SKILL_SP_TRAINER_EXTRA_ARGS=${SKILL_SP_TRAINER_EXTRA_ARGS:-"trainer.project_name=${SKILL_SP_TRAINER_PROJECT_NAME} worker.actor.model.freeze_vision_tower=true worker.actor.padding_free=false worker.actor.ulysses_sequence_parallel_size=1 worker.actor.use_torch_compile=false worker.actor.fsdp.torch_dtype=bf16 worker.rollout.dtype=bf16 worker.rollout.tensor_parallel_size=${MINISTRAL3_ROLLOUT_TENSOR_PARALLEL_SIZE:-2} worker.rollout.enforce_eager=true worker.rollout.enable_chunked_prefill=true worker.rollout.deep_gemm_warmup=skip worker.rollout.limit_images=0 worker.rollout.max_model_len=${SKILL_SP_MAX_MODEL_LEN}"}
mkdir -p \
"$STORAGE_PATH/evaluation" \
"$STORAGE_PATH/models" \
"$STORAGE_PATH/datasets" \
"$STORAGE_PATH/generated_question" \
"$STORAGE_PATH/temp_results"
bash scripts/skill_main.sh \
"$MINISTRAL3_MODEL_PATH" \
ministral3-8b-bf16 \
"$SKILL_SP_MAX_PROMPT_LENGTH" \
"$SKILL_SP_MAX_RESPONSE_LENGTH" \
"$SKILL_SP_GENERATE_MAX_TOKENS" \
"$SKILL_SP_EVALUATE_MAX_TOKENS" \
"$SKILL_SP_REWARD_MAX_TOKENS" \
"$SKILL_SP_MAX_NUM_BATCHED_TOKENS"