@@ -4425,6 +4425,7 @@ async def _load_model_impl(
44254425 n_layers = llama_backend.n_layers,
44264426 n_moe_layers = llama_backend.n_moe_layers,
44274427 gpu_ids = llama_backend.gpu_ids,
4428+ requested_gpu_ids = llama_backend.requested_gpu_ids,
44284429 )
44294430 else:
44304431 if (
@@ -4796,6 +4797,7 @@ async def _attempt_gguf_load(
47964797 n_layers = llama_backend.n_layers,
47974798 n_moe_layers = llama_backend.n_moe_layers,
47984799 gpu_ids = llama_backend.gpu_ids,
4800+ requested_gpu_ids = llama_backend.requested_gpu_ids,
47994801 )
48004802
48014803 # ── Standard path: load via Unsloth/transformers ──────────
@@ -5915,6 +5917,7 @@ async def get_status(current_subject: str = Depends(get_current_subject)):
59155917 n_layers = llama_backend.n_layers,
59165918 n_moe_layers = llama_backend.n_moe_layers,
59175919 gpu_ids = llama_backend.gpu_ids,
5920+ requested_gpu_ids = llama_backend.requested_gpu_ids,
59185921 llama_cpp_supports_mtp = _supports_mtp,
59195922 spec_fallback_reason = llama_backend.spec_fallback_reason,
59205923 llama_cpp_prebuilt_stale = _stale,
0 commit comments