diff --git a/vllm/patches/vllm_for_multi_arc.patch b/vllm/patches/vllm_for_multi_arc.patch index 9e305f1b..89976a90 100644 --- a/vllm/patches/vllm_for_multi_arc.patch +++ b/vllm/patches/vllm_for_multi_arc.patch @@ -11851,16 +11851,17 @@ index 000000000..b01b55f70 + if "mlp.experts" in name: + continue + -+ name = name.replace(weight_name, param_name) ++ name_mapped = name.replace(weight_name, param_name) + # Skip loading extra bias for GPTQ models. -+ if name.endswith(".bias") and name not in params_dict: ++ if name_mapped.endswith(".bias") and name_mapped not in params_dict: + continue + # Skip layers on other devices. + if is_pp_missing_parameter(name, self): + continue + # name = apply_attn_prefix(name, params_dict) -+ if name not in params_dict: ++ if name_mapped not in params_dict: + continue ++ name = name_mapped + param = params_dict[name] + + # Use weight_loader_v2 for tuple shard_id (GDN projections). @@ -12604,15 +12605,16 @@ index 000000000..547c1885a + if "mlp.experts" in name: + continue + -+ name = name.replace(weight_name, param_name) ++ name_mapped = name.replace(weight_name, param_name) + # Skip loading extra bias for GPTQ models. -+ if name.endswith(".bias") and name not in params_dict: ++ if name_mapped.endswith(".bias") and name_mapped not in params_dict: + continue + # Skip layers on other devices. -+ if is_pp_missing_parameter(name, self): ++ if is_pp_missing_parameter(name_mapped, self): + continue + if name not in params_dict: + continue ++ name = name_mapped + param = params_dict[name] + weight_loader = param.weight_loader + weight_loader(param, loaded_weight, shard_id)