@@ -220,43 +220,3 @@ def test_st_encode_failure_without_llama_binary_reraises(monkeypatch):
220220 embeddings ._reset_backend ()
221221 with pytest .raises (RuntimeError , match = "CUDA error during encode" ):
222222 embeddings .encode (["alpha" , "beta" ])
223-
224-
225- def _patch_auto_backend (monkeypatch , * , binary , is_vulkan , gpu_free ):
226- """Stub the hardware probes _resolve_auto reads."""
227- from core .inference .llama_cpp import LlamaCppBackend
228-
229- monkeypatch .setattr (LlamaCppBackend , "_find_llama_server_binary" , staticmethod (lambda : binary ))
230- monkeypatch .setattr (
231- LlamaCppBackend , "_is_vulkan_backend" , staticmethod (lambda b = None : is_vulkan )
232- )
233- monkeypatch .setattr (
234- LlamaCppBackend , "_get_gpu_free_memory" , staticmethod (lambda b = None : gpu_free )
235- )
236-
237-
238- def test_resolve_auto_cuda_gpu_picks_sentence_transformers (monkeypatch ):
239- # A torch-usable (CUDA/ROCm) GPU -> ST wins bulk indexing.
240- _patch_auto_backend (
241- monkeypatch , binary = "/fake/llama-server" , is_vulkan = False , gpu_free = [(0 , 24000 )]
242- )
243- assert embeddings ._resolve_auto () == "sentence-transformers"
244-
245-
246- def test_resolve_auto_vulkan_gpu_picks_llama_server (monkeypatch ):
247- # A Vulkan build's GPU is not torch-usable, so its free-memory report must
248- # NOT steer auto to ST (which would run on CPU/XPU); llama-server can use it.
249- _patch_auto_backend (
250- monkeypatch , binary = "/fake/llama-server" , is_vulkan = True , gpu_free = [(0 , 8000 )]
251- )
252- assert embeddings ._resolve_auto () == "llama-server"
253-
254-
255- def test_resolve_auto_cpu_host_with_binary_picks_llama_server (monkeypatch ):
256- _patch_auto_backend (monkeypatch , binary = "/fake/llama-server" , is_vulkan = False , gpu_free = [])
257- assert embeddings ._resolve_auto () == "llama-server"
258-
259-
260- def test_resolve_auto_cpu_host_without_binary_picks_sentence_transformers (monkeypatch ):
261- _patch_auto_backend (monkeypatch , binary = None , is_vulkan = False , gpu_free = [])
262- assert embeddings ._resolve_auto () == "sentence-transformers"
0 commit comments