sie-server 0.7.0__tar.gz → 0.7.2__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {sie_server-0.7.0 → sie_server-0.7.2}/.gitignore +2 -36
- {sie_server-0.7.0 → sie_server-0.7.2}/CONTRIBUTING.md +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/Dockerfile.cuda12 +6 -4
- {sie_server-0.7.0 → sie_server-0.7.2}/Dockerfile.cuda13 +16 -14
- {sie_server-0.7.0 → sie_server-0.7.2}/PKG-INFO +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/README.md +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/default.yaml +11 -2
- sie_server-0.7.0/bundles/gemma.yaml → sie_server-0.7.2/bundles/sglang-cu130.yaml +11 -11
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/sglang-embedding.yaml +2 -3
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Alibaba-NLP__gte-multilingual-base.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-reranker-large.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/EmergentMethods__gliner_large_news-v2.1.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/GritLM__GritLM-7B.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Ihor__gliner-biomed-large-v1.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Linq-AI-Research__Linq-Embed-Mistral.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/MoritzLaurer__ModernBERT-base-zeroshot-v2.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/MoritzLaurer__deberta-v3-base-zeroshot-v2.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/MoritzLaurer__deberta-v3-large-zeroshot-v2.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/NovaSearch__stella_en_400M_v5.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-0.6B.yaml +7 -10
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-4B-Instruct-2507.yaml +1 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3.5-4B.yaml +5 -7
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3.6-27B.yaml +7 -8
- sie_server-0.7.2/models/Qwen__Qwen3.8-27B-FP8.yaml +360 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Salesforce__SFR-Embedding-2_R.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Salesforce__SFR-Embedding-Mistral.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/cross-encoder__ms-marco-MiniLM-L-12-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/cross-encoder__nli-deberta-v3-base.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/defog__sqlcoder-7b-2.yaml +1 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/models/docling.yaml +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/models/facebook__bart-large-mnli.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/gliner-community__gliner_large-v2.5.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/gliner-community__gliner_medium-v2.5.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__gemma-4-26B-A4B-it.yaml +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__gemma-4-31B-it.yaml +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__gemma-4-E2B-it.yaml +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__gemma-4-E4B-it.yaml +2 -2
- sie_server-0.7.2/models/google__siglip-base-patch16-256.yaml +26 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__siglip-so400m-patch14-224.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/ibm-granite__granite-embedding-english-r2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/ibm-granite__granite-embedding-small-english-r2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__e5-large-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__e5-mistral-7b-instruct.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__multilingual-e5-large-instruct.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__multilingual-e5-large.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__multilingual-e5-small.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jackboyla__glirel-large-v0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__gliclass-base-v1.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__gliclass-small-v1.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__gliner-bi-base-v2.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__modern-gliner-bi-base-v1.0.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/microsoft__Florence-2-base.yaml +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mixedbread-ai__mxbai-rerank-large-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/naver-clova-ix__donut-base-finetuned-cord-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/naver-clova-ix__donut-base-finetuned-docvqa.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/naver__splade-cocondenser-selfdistil.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/naver__splade-v3.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nomic-ai__modernbert-embed-base.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/numind__NuNER_Zero-span.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nvidia__llama-nemoretriever-colembed-3b-v1.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nvidia__nemotron-colembed-vl-4b-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/openai__clip-vit-large-patch14.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-distill.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-mini.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-v1.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-v2-distill.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/rasyosef__splade-mini.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/sentence-transformers__all-MiniLM-L6-v2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/urchade__gliner_large-v2.1.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/urchade__gliner_medium-v2.1.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/vidore__colpali-v1.3-hf.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/vidore__colqwen2.5-v0.2.yaml +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/openapi.json +309 -14
- {sie_server-0.7.0 → sie_server-0.7.2}/pyproject.toml +4 -3
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_generation_base.py +53 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/clip/__init__.py +49 -27
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colpali/__init__.py +29 -23
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colqwen2/__init__.py +22 -15
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colqwen3/__init__.py +12 -14
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colsmol/__init__.py +12 -14
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/docling/adapter.py +34 -5
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/donut/__init__.py +8 -10
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/florence2/__init__.py +8 -10
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliclass/__init__.py +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliner/__init__.py +76 -23
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/glm_ocr/__init__.py +8 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/grounding_dino/adapter.py +6 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/lighton_ocr/adapter.py +8 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/mineru_vl/__init__.py +8 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/mlx/_server.py +16 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/mlx/generation.py +63 -39
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/nemo_colembed/__init__.py +6 -11
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/owlv2/adapter.py +6 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/paddleocr_vl/__init__.py +8 -9
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen3_vl_embedding/__init__.py +15 -18
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen3_vl_reranker/adapter.py +4 -13
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/_server.py +141 -8
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/embedding.py +61 -12
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/gemma.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/generation.py +63 -6
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang_vision_extract/adapter.py +3 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/siglip/adapter.py +42 -23
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/st_sparse_vision/adapter.py +6 -10
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/encode.py +51 -18
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/extract.py +10 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/generate.py +14 -6
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/health.py +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/helpers.py +164 -7
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/models.py +2 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openai_compat.py +187 -32
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openai_local.py +30 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/score.py +11 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/serialization.py +4 -8
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/app/app_state_config.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/cli.py +65 -5
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/config/engine.py +15 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/batcher.py +76 -16
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/disk_cache.py +74 -18
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/extract_cost.py +7 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/loader.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/logging.py +65 -6
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/model_loader.py +12 -0
- sie_server-0.7.2/src/sie_server/core/model_suggestions.py +87 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/prepared.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/image.py +43 -30
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/vision.py +22 -24
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/registry.py +50 -4
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/video_frames.py +9 -10
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/model_worker.py +278 -22
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/types.py +80 -15
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/worker_telemetry.py +30 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/streaming.py +23 -4
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/tool_call_grammar.py +1 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/queue_executor.py +14 -5
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/inputs.py +59 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/openapi.py +106 -3
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/requests.py +5 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/responses.py +22 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_bge_m3_flash.py +2 -2
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_clip.py +29 -0
- sie_server-0.7.2/tests/adapters/test_colqwen2_revision.py +56 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_docling.py +45 -3
- sie_server-0.7.2/tests/adapters/test_docling_smoke.py +201 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_donut.py +27 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_florence2.py +2 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_generation_base.py +159 -0
- sie_server-0.7.2/tests/adapters/test_gliner_metering.py +205 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_grounding_dino.py +23 -0
- sie_server-0.7.2/tests/adapters/test_image_decode_errors.py +56 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_lora_integration.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_mlx_generation.py +102 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_owlv2.py +23 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_qwen3_vl_embedding.py +16 -4
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_qwen3_vl_reranker.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_runtime_options.py +3 -3
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_sglang.py +255 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_sglang_generation.py +95 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_siglip.py +74 -0
- sie_server-0.7.2/tests/adapters/test_siglip_integration.py +187 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_st_sparse_vision.py +20 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_encode_dtype.py +12 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_encode_endpoint.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_encode_validation.py +43 -0
- sie_server-0.7.2/tests/api/test_error_code_hygiene.py +257 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_extract.py +38 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_extract_integration.py +1 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_generate.py +46 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_openai_compat.py +206 -7
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_openai_local.py +178 -23
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_score.py +55 -0
- sie_server-0.7.2/tests/api/test_usage_reporting.py +224 -0
- sie_server-0.7.2/tests/config/test_qwen38_generation_profiles.py +165 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/conftest.py +2 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_batcher.py +69 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_disk_cache.py +147 -0
- sie_server-0.7.2/tests/core/test_encode_worker_batching.py +299 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_load_rgb.py +11 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_logging.py +136 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_model_load_timeout.py +1 -1
- sie_server-0.7.2/tests/core/test_model_suggestions.py +87 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_preprocessor.py +86 -11
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_failed_state.py +1 -1
- sie_server-0.7.2/tests/core/test_unload_off_event_loop.py +186 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_video_frames.py +0 -20
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_core.py +253 -0
- sie_server-0.7.2/tests/core/test_worker_drain.py +414 -0
- sie_server-0.7.2/tests/fake_stack/test_model_loading_race.py +125 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/test_registry_races.py +39 -22
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_generation_diagnostics.py +6 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_worker_telemetry.py +1 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_streaming.py +35 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_all_models.py +1 -1
- sie_server-0.7.2/tests/test_cli_log_level.py +92 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_docker_integration.py +0 -2
- sie_server-0.7.2/tests/test_documented_model_ids.py +101 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_metering_units.py +3 -1
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_model_yaml_filenames.py +10 -12
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_openapi_export.py +39 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_sparse_integration.py +1 -1
- sie_server-0.7.2/tests/type_defs/test_decode_image.py +87 -0
- sie_server-0.7.0/tests/adapters/test_docling_smoke.py +0 -65
- sie_server-0.7.0/tests/fake_stack/test_model_loading_race.py +0 -85
- {sie_server-0.7.0 → sie_server-0.7.2}/Dockerfile.cpu +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/LICENSE +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/candle.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/fake.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/sglang-vision-extract.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/sglang.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/bundles/transformers5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Alibaba-NLP__gte-Qwen2-1.5B-instruct.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Alibaba-NLP__gte-Qwen2-7B-instruct.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Alibaba-NLP__gte-modernbert-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Alibaba-NLP__gte-reranker-modernbert-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-base-en-v1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-large-en-v1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-m3.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-reranker-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-reranker-v2-m3.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-small-en-v1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/BAAI__bge-small-zh-v1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/IDEA-Research__grounding-dino-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/IDEA-Research__grounding-dino-tiny.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Marqo__marqo-ecommerce-embeddings-B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Marqo__marqo-fashionSigLIP.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/NeuML__gliner-bert-tiny.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/NovaSearch__stella_en_1.5B_v5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/PaddlePaddle__PaddleOCR-VL-1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-Embedding-0.6B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-Embedding-4B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-Embedding-8B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-Reranker-0.6B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-Reranker-4B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-VL-Embedding-2B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3-VL-Reranker-2B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Qwen__Qwen3.6-35B-A3B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Snowflake__snowflake-arctic-embed-l-v2.0.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Snowflake__snowflake-arctic-embed-m-v2.0.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/Snowflake__snowflake-arctic-embed-s.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/TomoroAI__tomoro-colqwen3-embed-4b.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/WhereIsAI__UAE-Large-V1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/answerdotai__ModernBERT-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/answerdotai__ModernBERT-large.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/answerdotai__answerai-colbert-small-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/colbert-ir__colbertv2.0.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/cross-encoder__ms-marco-MiniLM-L-6-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/fastino__gliguard-LLMGuardrails-300M.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/fastino__gliner2-base-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/fastino__gliner2-large-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/gliner-community__gliner_small-v2.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__embeddinggemma-300m.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__owlv2-base-patch16-ensemble.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__owlv2-large-patch14-ensemble.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__siglip-so400m-patch14-384.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/google__siglip2-base-patch16-224.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/ibm-granite__granite-embedding-30m-sparse.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/ibm-granite__granite-embedding-97m-multilingual-r2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/ibm-granite__granite-guardian-3.0-2b.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__e5-base-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/intfloat__e5-small-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-colbert-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-base-code.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-base-de.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-base-en.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-base-es.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-base-zh.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-embeddings-v2-small-en.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/jinaai__jina-reranker-v2-base-multilingual.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__gliclass-large-v1.0.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/knowledgator__gliclass-large-v3.0.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/laion__CLIP-ViT-B-32-laion2B-s34B-b79K.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/laion__CLIP-ViT-H-14-laion2B-s32B-b79K.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/lightonai__GTE-ModernColBERT-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/lightonai__LightOnOCR-2-1B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/lightonai__Reason-ModernColBERT.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/lightonai__mLateOn.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/microsoft__Florence-2-base-ft.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/microsoft__Florence-2-large.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mixedbread-ai__mxbai-colbert-large-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mixedbread-ai__mxbai-edge-colbert-v0-32m.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mixedbread-ai__mxbai-embed-large-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mixedbread-ai__mxbai-rerank-base-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/mynkchaudhry__Florence-2-FT-DocVQA.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/naver__v-splade-quality.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nomic-ai__nomic-embed-text-v1.5.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nomic-ai__nomic-embed-text-v2-moe.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/numind__NuNER_Zero.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nvidia__NV-Embed-v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/nvidia__llama-embed-nemotron-8b.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/openai__clip-vit-base-patch32.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/openai__whisper-large-v3-turbo.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opendatalab__MinerU2.5-Pro-2604-1.2B.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-distill.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-gte.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/prithivida__Splade_PP_en_v2.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/sie-fake.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/sugiv__stablebridge-pruner-highlighter.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/tencent__R3-embedding-0.6b.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/tencent__R3-rerank-0.6b.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/thenlper__gte-base.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/thenlper__gte-large.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/thenlper__gte-small.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/topk-io__Iso-ModernColBERT.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/urchade__gliner_multi-v2.1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/urchade__gliner_multi_pii-v1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/urchade__gliner_small-v2.1.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/vidore__colSmol-256M.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/models/zai-org__GLM-OCR.yaml +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/scripts/generate_tokenize_fixture.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/_ipc_test_harness.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapter_call_loop.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_base_adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_colbert_projection.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_colbert_utils.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_flash_base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_flash_pack.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_multivector.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_pylate_dense.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_spec.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_types.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_utils.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/_vision_patch_embed.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bert_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bge_m3/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bge_m3_flag/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bge_m3_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/bge_m3_score_mixin.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colbert/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colbert_modernbert_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colbert_modernbert_flash/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/colbert_rotary_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/cross_encoder/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/docling/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/errors.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/fake/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/fake/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliner2/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliner2/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliner2/classification.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gliner_bi/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/glirel/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/grounding_dino/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/gte_sparse_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/jina_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/lighton_ocr/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/lora.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/mlx/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/modernbert_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/modernbert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/nli_classification/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/nli_classification_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/nomic_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/owlv2/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/peft_lora_mixin.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/pytorch_embedding/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen2_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen2_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen2_flash_cross_encoder/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/qwen3_vl_reranker/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/rope_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sentence_transformer/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/_compat/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/_compat/sitecustomize.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang/cuda13.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang_vision_extract/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang_vision_extract/_compat/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/sglang_vision_extract/_compat/sitecustomize.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/siglip/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/splade_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/splade_flash/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/st_sparse_vision/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/stablebridge_pruner/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/whisper/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/whisper/adapter.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/adapters/xlm_roberta_flash/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openai_audio.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openai_completions.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openai_responses.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/openapi.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/options.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/root.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/validation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/api/ws.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/app/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/app/app_factory.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/bundle_requirements.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/config/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/config/model.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/config/package_artifacts.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/adaptive_batching.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/deps.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/encode_pipeline.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/gpu_health.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/hf_env.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/hot_reload.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/inference.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/inference_output.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/load_errors.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/memory.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/oom.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/pool_isolation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/postprocessor.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/postprocessor_registry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/audio.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor/text.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/preprocessor_registry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/readiness.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/residency.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/runtime_options.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/score_cost.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/shutdown.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/text_tokens.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/timing.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/tokenizer.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/watcher.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/handlers/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/handlers/base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/handlers/encode.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/handlers/extract.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/handlers/score.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/core/worker/oom_recovery.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/health/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/health/saturation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/ipc_server.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/ipc_types.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/local_ingest_client.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/main.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/generation_diagnostics.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/gpu.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/telemetry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/observability/tracing.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/admission.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/grammar_cache.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/grammar_compile.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/tool_call_parser.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/processors/work_class_scheduler.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/grammar.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/outputs.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/src/sie_server/types/overflow_policy.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_adapter_revision_contract.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_bge_m3.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_colbert.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_colbert_modernbert_flash_projection.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_colbert_modernbert_flash_tokenizer.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_colbert_projection.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_colbert_punctuation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_factory_integration.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_fake.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_fake_catalog.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_fake_faults.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_flash_base.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_flash_pack.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_gliclass_contracts.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_gliclass_overflow_policy.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_gliner2.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_gliner_merge.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_glirel.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_glm_ocr.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_gte_sparse.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_jina_flash_cross_encoder.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_lighton_ocr.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_lora.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_mineru_vl.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_multivector.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_paddleocr_vl.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_pylate_dense.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_pytorch_embedding_model_encode.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_pytorch_embedding_revision.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_qwen2_flash_cross_encoder.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_sentence_transformer.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_sglang_vision_extract.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_sparse_aggregation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_splade_flash_parity.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_splade_packed_parity.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_splade_roberta_position_ids.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_stablebridge_integration.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_stablebridge_pruner.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_vision_patch_embed.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_visual_document.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_visual_muvera_postprocessors.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/adapters/test_whisper.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_canonical_profile_conformance.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_dtype_queue_http_parity.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_encode_json_schema.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_encode_timing.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_extract_oom.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_generate_stream.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_health.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_helpers_telemetry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_models.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_openai_audio.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_openai_completions.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_openai_responses.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_version_header.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/api/test_ws.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/app/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/app/test_app_factory.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_answerai_colbert_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_bundle_coverage.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_colbertv2_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_config.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_generation_mode_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_gte_modern_colbert_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_h100_fp8_generation_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_jina_colbert_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_model_prewarm_grammars.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_muvera_profile_postprocessors.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_mxbai_colbert_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_mxbai_edge_colbert_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_nvidia_nemo_colembed_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_package_artifacts.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_profile_backend_consistency.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_profile_template_inheritance.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_qwen_generation_profiles.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/config/test_visual_muvera_containment.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_adaptive_batching.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_bundle_requirements.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_encode_format_output.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_gpu_health.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_hot_reload.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_idle_evict.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_inference.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_loader.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_lora_generation_exclusion.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_memory.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_memory_synthetic.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_model_loader_cache.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_oom_detection.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_pool_isolation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_postprocessor.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_postprocessor_registry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_prepared.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_preprocessor_registry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_quantization.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_readiness.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_async.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_core.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_deps.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_memory.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_registry_multi_model.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_residency.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_revision_identity.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_runtime_options.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_shutdown.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_timing.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_watcher.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_backpressure.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_extract.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_lora.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_options.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_preformed.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/test_worker_score.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/worker/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/core/worker/test_oom_recovery.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/conftest.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/test_lost_result.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/test_oom_ladder.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/fake_stack/test_sdk_surface.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/health/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/health/test_saturation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/health/test_worker_id_consistency.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/integration/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/integration/test_chat_completions.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/integration/test_grammar_generate.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_telemetry.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_trace_propagation.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_tracing.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/observability/test_worker_telemetry_benchmark.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_grammar_cache.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_grammar_compile.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_grammar_prewarm.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_streaming_admission.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_streaming_integration.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_tool_call_grammar.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_tool_call_parser.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/processors/test_work_class_scheduler.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_adapter_call_loop.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_cli_devices.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_cli_pool.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_decode_item.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_ipc_server.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_ipc_types_raw_output.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_local_ingest_client.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_parity_run_batch.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_queue_executor.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_queue_executor_stage1d.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_readiness.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_sdk_integration.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_server_process_fixture.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_server_smoke.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/test_stage1d_byte_identity.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/type_defs/__init__.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/type_defs/test_inputs.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/type_defs/test_inputs_json_decode.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/type_defs/test_media_bytes.py +0 -0
- {sie_server-0.7.0 → sie_server-0.7.2}/tests/type_defs/test_types.py +0 -0
|
@@ -142,10 +142,8 @@ celerybeat.pid
|
|
|
142
142
|
|
|
143
143
|
# Environments
|
|
144
144
|
.env
|
|
145
|
-
#
|
|
146
|
-
|
|
147
|
-
# repo (audit §1/§14). Belt-and-braces so a local copy can never be committed.
|
|
148
|
-
*.sie-cloud-secrets.env
|
|
145
|
+
# Local service credential bundles must never be committed.
|
|
146
|
+
*-secrets.env
|
|
149
147
|
.env.cloud
|
|
150
148
|
.venv
|
|
151
149
|
env/
|
|
@@ -244,33 +242,6 @@ override.tf.json
|
|
|
244
242
|
# tfvars files may contain secrets
|
|
245
243
|
*.tfvars
|
|
246
244
|
*.tfvars.json
|
|
247
|
-
# Reviewed worker-AMI release contracts contain only immutable public package,
|
|
248
|
-
# AMI, and Terraform backend coordinates; the release workflow accepts only
|
|
249
|
-
# committed files from this exact internal path.
|
|
250
|
-
!deploy/terraform/aws/internal-examples/cloud-benchmark-runner/worker-ami/releases/*.tfvars.json
|
|
251
|
-
# Exception: this edge tfvars carries only a Secrets Manager ARN (a resource
|
|
252
|
-
# identifier, not a secret) so the staging-us edge apply needs no manual -var.
|
|
253
|
-
!deploy/cloud/terraform/aws-edge/staging-us.tfvars
|
|
254
|
-
# This dev adoption contract contains only public AWS resource identifiers; it
|
|
255
|
-
# is checked in so a reviewed plan cannot silently target a different orphan
|
|
256
|
-
# VPC/listener through an operator-local tfvars file.
|
|
257
|
-
!deploy/cloud/terraform/dev-controlplane-https-adoption/dev-us.tfvars
|
|
258
|
-
!deploy/cloud/terraform/dev-controlplane-https-adoption/.terraform.lock.hcl
|
|
259
|
-
# Managed release roots commit their exact provider selections. Release
|
|
260
|
-
# preflights and applies use these read-only instead of selecting a newer
|
|
261
|
-
# compatible provider during a long-running deployment.
|
|
262
|
-
!deploy/cloud/terraform/release-infrastructure/.terraform.lock.hcl
|
|
263
|
-
!deploy/cloud/terraform/aws-controlplane/.terraform.lock.hcl
|
|
264
|
-
!deploy/cloud/terraform/aws-edge/.terraform.lock.hcl
|
|
265
|
-
!deploy/cloud/terraform/s3-state/.terraform.lock.hcl
|
|
266
|
-
!deploy/cloud/terraform/vercel/.terraform.lock.hcl
|
|
267
|
-
!deploy/cloud/terraform/console-preview/.terraform.lock.hcl
|
|
268
|
-
!deploy/cloud/terraform/examples/dev/.terraform.lock.hcl
|
|
269
|
-
!deploy/cloud/terraform/examples/dev-eu/.terraform.lock.hcl
|
|
270
|
-
!deploy/cloud/terraform/examples/staging/.terraform.lock.hcl
|
|
271
|
-
!deploy/cloud/terraform/examples/staging-eu/.terraform.lock.hcl
|
|
272
|
-
!deploy/cloud/terraform/examples/prod-us/.terraform.lock.hcl
|
|
273
|
-
# Keep .terraform.lock.hcl for reproducibility (provider versions)
|
|
274
245
|
|
|
275
246
|
# Node.js
|
|
276
247
|
node_modules/
|
|
@@ -294,12 +265,7 @@ tmp/
|
|
|
294
265
|
.tmp/
|
|
295
266
|
.local/
|
|
296
267
|
|
|
297
|
-
.requirements-modal.txt
|
|
298
|
-
.mpa-i6pn-*-requirements-modal.txt
|
|
299
268
|
b6_results.json
|
|
300
|
-
# Raw dev-cloud load-test reports are local artifacts, not source-controlled baselines.
|
|
301
|
-
packages/sie_cloud/bench/results/dev-us-*/
|
|
302
|
-
|
|
303
269
|
# Personal mise overrides (per-developer toolchain tweaks, e.g. rustup
|
|
304
270
|
# component naming differences across rustup versions).
|
|
305
271
|
mise.local.toml
|
|
@@ -14,12 +14,12 @@ mise trust && mise install
|
|
|
14
14
|
## Running Tests
|
|
15
15
|
|
|
16
16
|
```bash
|
|
17
|
-
mise run test packages/sie_server
|
|
17
|
+
mise run test -- packages/sie_server
|
|
18
18
|
```
|
|
19
19
|
|
|
20
20
|
## Code Style
|
|
21
21
|
|
|
22
|
-
- Format with `mise run lint -f`
|
|
22
|
+
- Format with `mise run lint -- -f`
|
|
23
23
|
- Type check with `mise run typecheck`
|
|
24
24
|
|
|
25
25
|
## Pull Requests
|
|
@@ -165,7 +165,7 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
|
|
|
165
165
|
#
|
|
166
166
|
# Per-bundle CUDA wheel index. SGLang's sgl-kernel/flashinfer wheels live on the
|
|
167
167
|
# docs.sglang.ai cu129 index (not PyPI), so the SGLang-family bundles add it.
|
|
168
|
-
# The
|
|
168
|
+
# The sglang-cu130 bundle (sglang 0.5.13 / torch 2.11 / cu130, CUDA 13) is built by the
|
|
169
169
|
# separate ``cuda13`` platform — see Dockerfile.cuda13 — not here.
|
|
170
170
|
RUN --mount=type=cache,target=/root/.cache/pip \
|
|
171
171
|
--mount=type=cache,target=/root/.cache/uv \
|
|
@@ -216,9 +216,9 @@ ENV CUDA_HOME=/usr/local/cuda \
|
|
|
216
216
|
LD_LIBRARY_PATH="/usr/local/cuda/lib64:$LD_LIBRARY_PATH"
|
|
217
217
|
FROM runtime-sglang AS runtime-sglang-embedding
|
|
218
218
|
FROM runtime-sglang AS runtime-sglang-vision-extract
|
|
219
|
-
# NOTE: the
|
|
219
|
+
# NOTE: the sglang-cu130 bundle (CUDA 13 / sglang 0.5.13 / torch 2.11 cu130) is built by
|
|
220
220
|
# the separate ``cuda13`` platform — packages/sie_server/Dockerfile.cuda13 — so
|
|
221
|
-
# this CUDA-12 image never produces a (mislabelled) CUDA-13 ``cuda12-
|
|
221
|
+
# this CUDA-12 image never produces a (mislabelled) CUDA-13 ``cuda12-sglang-cu130``
|
|
222
222
|
# image. See #1415.
|
|
223
223
|
|
|
224
224
|
FROM runtime-${BUNDLE} AS runtime
|
|
@@ -294,7 +294,8 @@ COPY --link --from=base --chown=1000:1000 /app/bundles /app/bundles
|
|
|
294
294
|
# A `.pth` file in the shared venv puts /app/bundle-libs at sys.path[0] at startup.
|
|
295
295
|
COPY --link --from=builder --chown=1000:1000 /app/bundle-libs /app/bundle-libs
|
|
296
296
|
|
|
297
|
-
RUN mkdir -p /app/evals /app/.cache/huggingface
|
|
297
|
+
RUN mkdir -p /app/evals /app/.cache/huggingface /app/.cache/sie-kernels \
|
|
298
|
+
&& chown -R sie:sie /app/evals /app/.cache
|
|
298
299
|
|
|
299
300
|
# Declare the BUNDLE arg only here, where it is first used (LABEL + ENV),
|
|
300
301
|
# so every RUN/COPY layer above is bundle-agnostic in its cache key and the
|
|
@@ -309,6 +310,7 @@ ENV PATH="/app/.venv/bin:$PATH" \
|
|
|
309
310
|
PYTHONUNBUFFERED=1 \
|
|
310
311
|
PYTHONDONTWRITEBYTECODE=1 \
|
|
311
312
|
HF_HOME=/app/.cache/huggingface \
|
|
313
|
+
SIE_SGLANG_KERNEL_CACHE_ROOT=/app/.cache/sie-kernels \
|
|
312
314
|
NVIDIA_VISIBLE_DEVICES=all \
|
|
313
315
|
NVIDIA_DRIVER_CAPABILITIES=compute,utility \
|
|
314
316
|
SIE_BUNDLE="${BUNDLE}"
|
|
@@ -1,13 +1,13 @@
|
|
|
1
1
|
# syntax=docker/dockerfile:1
|
|
2
|
-
# SIE Server - CUDA 13 Image (
|
|
2
|
+
# SIE Server - CUDA 13 Image (SGLang cu130 bundles)
|
|
3
3
|
# Build from repo root:
|
|
4
|
-
# docker build -f packages/sie_server/Dockerfile.cuda13 --build-arg BUNDLE=
|
|
4
|
+
# docker build -f packages/sie_server/Dockerfile.cuda13 --build-arg BUNDLE=sglang-cu130 -t sie-server:cuda13-sglang-cu130 .
|
|
5
5
|
#
|
|
6
|
-
# WHY A SEPARATE PLATFORM: the
|
|
6
|
+
# WHY A SEPARATE PLATFORM: the sglang-cu130 bundle needs sglang 0.5.13, which pins
|
|
7
7
|
# torch==2.11.0 (cu130) + transformers 5.8.x and JIT-compiles cu130 kernels
|
|
8
8
|
# (flashinfer / tvm_ffi) through nvcc on first decode — so it requires a CUDA 13
|
|
9
9
|
# devel runtime. Keeping it here (platform ``cuda13``) instead of inside
|
|
10
|
-
# Dockerfile.cuda12 means a ``cuda13-
|
|
10
|
+
# Dockerfile.cuda12 means a ``cuda13-sglang-cu130`` image is honestly labelled CUDA 13,
|
|
11
11
|
# not a CUDA-13 image hiding under a ``cuda12-*`` tag (see #1415).
|
|
12
12
|
#
|
|
13
13
|
# STRUCTURE: mirrors Dockerfile.cuda12's deps→base→builder→runtime stages so the
|
|
@@ -18,18 +18,18 @@
|
|
|
18
18
|
# cu130 bundle), so there is no per-bundle runtime indirection.
|
|
19
19
|
#
|
|
20
20
|
# DUAL-TORCH CARRY: the shared base venv still installs torch 2.9 (cu129) from
|
|
21
|
-
# pyproject, and the
|
|
21
|
+
# pyproject, and the sglang-cu130 bundle overlays torch 2.11 (cu130) into bundle-libs
|
|
22
22
|
# (~+3 GB). Slimming torch out of sie-server core to drop the carry is a tracked
|
|
23
23
|
# follow-up (#1415).
|
|
24
24
|
|
|
25
|
-
ARG BUNDLE=
|
|
25
|
+
ARG BUNDLE=sglang-cu130
|
|
26
26
|
ARG UV_VERSION=0.9.28
|
|
27
27
|
|
|
28
|
-
# Build the
|
|
28
|
+
# Build the native Rust extension from checked-in source; it is not published
|
|
29
29
|
# to PyPI.
|
|
30
30
|
FROM ghcr.io/pyo3/maturin:v1.13.3 AS audio-prep-builder
|
|
31
31
|
WORKDIR /io
|
|
32
|
-
# The crate is a Cargo workspace member
|
|
32
|
+
# The crate is a Cargo workspace member: its pins live in the root
|
|
33
33
|
# Cargo.lock, and loading the workspace needs every member's manifest+sources.
|
|
34
34
|
COPY Cargo.toml Cargo.lock ./
|
|
35
35
|
COPY packages/sie_audio_prep/ packages/sie_audio_prep/
|
|
@@ -119,7 +119,7 @@ RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
|
|
|
119
119
|
|
|
120
120
|
# Register bundle-libs on sys.path via a .pth executed by site.py at startup.
|
|
121
121
|
# sys.path.insert(0, ...) puts bundle-libs at position 0 so bundle-specific
|
|
122
|
-
# versions SHADOW the shared venv (the
|
|
122
|
+
# versions SHADOW the shared venv (the cu130 torch/transformers/sglang
|
|
123
123
|
# overlay). Content is identical for every bundle, so writing it here keeps the
|
|
124
124
|
# shared venv layer byte-identical.
|
|
125
125
|
RUN echo "import sys; sys.path.insert(0, '/app/bundle-libs')" \
|
|
@@ -155,16 +155,16 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
|
|
|
155
155
|
&& cat /tmp/bundle-requirements.txt
|
|
156
156
|
|
|
157
157
|
# cu130 bundle deps go into a separate site-packages tree (``bundle-libs``,
|
|
158
|
-
# prepended to sys.path via the .pth above). The
|
|
158
|
+
# prepended to sys.path via the .pth above). The sglang-cu130 bundle needs torch 2.11
|
|
159
159
|
# from the cu130 PyTorch index, where the only ``2.11.0`` is the ``+cu130``
|
|
160
160
|
# local-version wheel; pip's multi-index resolution does not reliably prefer it
|
|
161
161
|
# over PyPI's default-CUDA build, so cuda13 bundles resolve with ``uv`` and
|
|
162
162
|
# ``--index-strategy unsafe-best-match`` against the cu130 PyTorch + sglang
|
|
163
163
|
# indexes (so torch 2.11 + sgl-kernel/flashinfer land for cu130). This uv +
|
|
164
|
-
# cu130-index resolution was validated
|
|
165
|
-
#
|
|
164
|
+
# cu130-index resolution was validated with sglang 0.5.13, torch 2.11, and a
|
|
165
|
+
# cu130 runtime in a fresh GPU environment.
|
|
166
166
|
#
|
|
167
|
-
# COVERAGE NOTE: the cuda13 image CI smoke (.github/workflows/
|
|
167
|
+
# COVERAGE NOTE: the cuda13 image CI smoke (.github/workflows/sglang-cu130-image.yml)
|
|
168
168
|
# builds this image and asserts on CPU that the bundle-libs cu130 overlay
|
|
169
169
|
# SHADOWS the base venv (import torch -> 2.11+cu130, transformers 5.x). It does
|
|
170
170
|
# NOT exercise GPU init: the cu12 base venv + cu130 bundle-libs both expose the
|
|
@@ -268,7 +268,8 @@ COPY --link --from=base --chown=1000:1000 /app/bundles /app/bundles
|
|
|
268
268
|
# Bundle-specific extras — last layer so shared layers above stay cached.
|
|
269
269
|
COPY --link --from=builder --chown=1000:1000 /app/bundle-libs /app/bundle-libs
|
|
270
270
|
|
|
271
|
-
RUN mkdir -p /app/evals /app/.cache/huggingface
|
|
271
|
+
RUN mkdir -p /app/evals /app/.cache/huggingface /app/.cache/sie-kernels \
|
|
272
|
+
&& chown -R sie:sie /app/evals /app/.cache
|
|
272
273
|
|
|
273
274
|
# Declare BUNDLE only here (LABEL + ENV) so layers above are bundle-agnostic.
|
|
274
275
|
ARG BUNDLE
|
|
@@ -281,6 +282,7 @@ ENV PATH="/app/.venv/bin:$PATH" \
|
|
|
281
282
|
PYTHONUNBUFFERED=1 \
|
|
282
283
|
PYTHONDONTWRITEBYTECODE=1 \
|
|
283
284
|
HF_HOME=/app/.cache/huggingface \
|
|
285
|
+
SIE_SGLANG_KERNEL_CACHE_ROOT=/app/.cache/sie-kernels \
|
|
284
286
|
NVIDIA_VISIBLE_DEVICES=all \
|
|
285
287
|
NVIDIA_DRIVER_CAPABILITIES=compute,utility \
|
|
286
288
|
SIE_BUNDLE="${BUNDLE}"
|
|
@@ -67,7 +67,7 @@ auto-retries; see `packages/sie_sdk/README.md` for client-side controls.
|
|
|
67
67
|
| Env var | Default | Effect |
|
|
68
68
|
|--|--|--|
|
|
69
69
|
| `SIE_MAX_BATCH_REQUESTS` | `64` | Maximum number of items per batched inference call. |
|
|
70
|
-
| `SIE_MAX_BATCH_WAIT_MS` | `
|
|
70
|
+
| `SIE_MAX_BATCH_WAIT_MS` | `15.0` | Initial value for the adaptive first-request batch timeout. At runtime the PI batching controller steers it between `SIE_ADAPTIVE_BATCHING__MIN_WAIT_MS` and `SIE_ADAPTIVE_BATCHING__MAX_WAIT_MS`, so it is a starting point rather than a fixed wait. |
|
|
71
71
|
| `SIE_MAX_CONCURRENT_REQUESTS` | `512` | Per-worker queue size; admission control returns `QUEUE_FULL` above this. |
|
|
72
72
|
| `SIE_MAX_LORAS_PER_MODEL` | `10` | Maximum concurrent LoRA adapters per base model. |
|
|
73
73
|
|
|
@@ -59,8 +59,17 @@ deps:
|
|
|
59
59
|
sentence-transformers: '>=5.0,<6'
|
|
60
60
|
# bge_m3_flag
|
|
61
61
|
FlagEmbedding: '>=1.3'
|
|
62
|
-
# grounding_dino
|
|
63
|
-
|
|
62
|
+
# grounding_dino. EXACT, not a range. `uv run --with-requirements` resolves the
|
|
63
|
+
# overlay live from PyPI, and `--frozen`/`--no-sync` govern only the project
|
|
64
|
+
# env, so any unbounded range here is re-resolved on every eval. The old
|
|
65
|
+
# `>=11,<12` (94430893c) was accidentally stable because the 11.x line is
|
|
66
|
+
# closed, but it contradicted sie-server's own `pillow>=12.2.0` since the
|
|
67
|
+
# security bump (27fd2063d), so every default-bundle eval served the superseded
|
|
68
|
+
# major. A bare `>=12.2.0` would fix that while making the pin float, which
|
|
69
|
+
# trades a stale-but-stable closure for a moving one.
|
|
70
|
+
# Pinned to the version the project lock holds, so overlay and lock agree.
|
|
71
|
+
# Changing this re-measures 13 gating floors (naver/v-splade-quality, docling).
|
|
72
|
+
pillow: '==12.3.0'
|
|
64
73
|
# grounding_dino
|
|
65
74
|
requests: ''
|
|
66
75
|
# gliner, gliner_bi
|
|
@@ -1,15 +1,14 @@
|
|
|
1
|
-
name:
|
|
1
|
+
name: sglang-cu130
|
|
2
2
|
priority: 20
|
|
3
3
|
default: false
|
|
4
4
|
# GPU platform this bundle targets — selects packages/sie_server/Dockerfile.cuda13
|
|
5
|
-
# and tags images ``cuda13-
|
|
5
|
+
# and tags images ``cuda13-sglang-cu130`` (not ``cuda12-*``). Gemma 4 needs sglang
|
|
6
6
|
# 0.5.13 / torch 2.11 cu130 on a CUDA 13 devel runtime (see below). Read by the
|
|
7
|
-
#
|
|
8
|
-
# matrix (.github/release-matrix.json). Bundles without this field default to
|
|
9
|
-
# ``cuda12``.
|
|
7
|
+
# image build. Bundles without this field default to ``cuda12``.
|
|
10
8
|
platform: cuda13
|
|
11
|
-
# CUDA 13 SGLang worker image, introduced for Google Gemma 4
|
|
12
|
-
# and
|
|
9
|
+
# General CUDA 13 / cu130 SGLang worker image, introduced for Google Gemma 4
|
|
10
|
+
# (see issue #1415) and shared by every profile that requires this newer engine
|
|
11
|
+
# and toolchain closure, including Qwen3.6 and Qwen3.8 native-window profiles.
|
|
13
12
|
#
|
|
14
13
|
# VALIDATED on a Modal L4 (driver 580.95.05 / CUDA 13.0) on 2026-06-18:
|
|
15
14
|
# google/gemma-4-E2B-it serves end-to-end on sglang 0.5.13 — the gemma4
|
|
@@ -17,8 +16,8 @@ platform: cuda13
|
|
|
17
16
|
# and /v1/chat/completions returns 200 (with --disable-cuda-graph, which the
|
|
18
17
|
# model configs set via adapter_options.loadtime.disable_cuda_graph).
|
|
19
18
|
#
|
|
20
|
-
# Kept SEPARATE from the `sglang` bundle so its Qwen3.x
|
|
21
|
-
#
|
|
19
|
+
# Kept SEPARATE from the `sglang` bundle so its older Qwen3.x profiles stay on
|
|
20
|
+
# sglang 0.5.10.post1 / torch 2.9.1. Qwen3.6-27B native-window
|
|
22
21
|
# variants opt into this image through the generic CUDA 13 adapter; their
|
|
23
22
|
# thinking variants add the strict-thinking behavior. The rest of the Qwen
|
|
24
23
|
# catalog remains untouched.
|
|
@@ -32,7 +31,7 @@ platform: cuda13
|
|
|
32
31
|
# this bundle's image carries torch 2.11 (cu130) on a CUDA 13 base — built by
|
|
33
32
|
# the dedicated ``cuda13`` platform (packages/sie_server/Dockerfile.cuda13),
|
|
34
33
|
# selected via the ``platform: cuda13`` field above. The shared base venv still
|
|
35
|
-
# ships torch 2.9.1, so the
|
|
34
|
+
# ships torch 2.9.1, so the cu130 image carries two torches (~+3 GB); slimming
|
|
36
35
|
# torch out of sie-server core would remove that (tracked follow-up in #1415).
|
|
37
36
|
#
|
|
38
37
|
# Distinct thin adapter modules scope routing here because bundle compatibility
|
|
@@ -47,7 +46,8 @@ deps:
|
|
|
47
46
|
# sglang 0.5.13 = the validated Gemma 4 engine (0.5.11 has the activation.cuh
|
|
48
47
|
# JIT bug above). Verified transitive resolution on the Modal L4 cu130 image:
|
|
49
48
|
# torch==2.11.0 (cu130), transformers==5.8.1, kernels==0.14.1,
|
|
50
|
-
# sglang-kernel
|
|
49
|
+
# sgl-deep-gemm==0.1.2, sglang-kernel==0.4.3, and
|
|
50
|
+
# flashinfer-python==0.6.12 (the exact SGLang 0.5.13 closure).
|
|
51
51
|
# These resolve from the cu130 wheel indexes at build/serve time
|
|
52
52
|
# (download.pytorch.org/whl/cu130 + https://docs.sglang.ai/whl/cu130/),
|
|
53
53
|
# supplied by the build (Dockerfile.cuda13 / Modal image). torch,
|
|
@@ -20,9 +20,8 @@ deps:
|
|
|
20
20
|
# a pre-release-only requirement. PyPI's ``flash-attn-4`` also publishes a
|
|
21
21
|
# stable ``0.0.1`` placeholder, which disables uv's "allow pre-releases
|
|
22
22
|
# when a package has nothing but pre-releases" rule, so a resolution that
|
|
23
|
-
# only names ``sglang`` is unsatisfiable
|
|
24
|
-
#
|
|
25
|
-
# pre-release specifier re-enables pre-releases for exactly this package.
|
|
23
|
+
# only names ``sglang`` is unsatisfiable. Declaring the dep here with an
|
|
24
|
+
# explicit pre-release specifier re-enables pre-releases for exactly this package.
|
|
26
25
|
# Runtime-inert for us: sglang's default attention backend is flashinfer;
|
|
27
26
|
# fa4 only needs to be importable to satisfy the dependency.
|
|
28
27
|
flash-attn-4: '==4.0.0b19'
|
|
@@ -15,11 +15,9 @@ tasks:
|
|
|
15
15
|
# to fit the full generation benchmark pack (casehold prompts reach ~1.8k
|
|
16
16
|
# tokens, gpqa ~1.3k) so the model is comparable to the rest of the fleet on
|
|
17
17
|
# every task, while KV stays trivial at this size (112 KB/token → 4096 ≈
|
|
18
|
-
# 0.46 GB).
|
|
19
|
-
#
|
|
20
|
-
#
|
|
21
|
-
# tools/bench_generation_matrix.py + run_generation_smoke.py) and caps itself
|
|
22
|
-
# to 1024 for that case.
|
|
18
|
+
# 0.46 GB). A deployment packing two SGLang instances onto one 22 GiB L4
|
|
19
|
+
# does NOT depend on this default: it passes an explicit
|
|
20
|
+
# ``--max-seq-length``/``--context-length`` and caps itself to 1024.
|
|
23
21
|
#
|
|
24
22
|
# ``context_length``, ``max_sequence_length``, and ``max_batch_tokens`` are
|
|
25
23
|
# three independent knobs (per-request context, SGLang --context-length,
|
|
@@ -39,8 +37,8 @@ max_sequence_length: 4096
|
|
|
39
37
|
# KV-cache memory math (Qwen3-0.6B, bf16):
|
|
40
38
|
# layers=28, kv_heads=8, head_dim=128, bytes_per_elem=2
|
|
41
39
|
# kv_bytes_per_token = 2 × 28 × 8 × 128 × 2 = 114,688 B ≈ 112 KB
|
|
42
|
-
# At ctx=4096 a single request's KV is ~0.46 GB — negligible.
|
|
43
|
-
#
|
|
40
|
+
# At ctx=4096 a single request's KV is ~0.46 GB — negligible. Co-resident
|
|
41
|
+
# deployments can still cap context explicitly when sharing a card.
|
|
44
42
|
profiles:
|
|
45
43
|
default:
|
|
46
44
|
max_batch_tokens: 4096
|
|
@@ -49,9 +47,8 @@ profiles:
|
|
|
49
47
|
kv_budget_tokens: 8192
|
|
50
48
|
adapter_options:
|
|
51
49
|
loadtime:
|
|
52
|
-
# 0.8 leaves headroom on a 22 GiB L4 for a second SGLang instance
|
|
53
|
-
#
|
|
54
|
-
# 0.6B is the only model on the card, 0.9 is fine.
|
|
50
|
+
# 0.8 leaves headroom on a 22 GiB L4 for a second SGLang instance. If
|
|
51
|
+
# the 0.6B is the only model on the card, 0.9 is fine.
|
|
55
52
|
mem_fraction_static: 0.8
|
|
56
53
|
served_model_name: Qwen/Qwen3-0.6B
|
|
57
54
|
# Modal sandbox lacks flashinfer's JIT prerequisites; switch backends.
|
|
@@ -38,8 +38,7 @@ tasks:
|
|
|
38
38
|
# them on ``delta.tool_calls`` for SSE and on
|
|
39
39
|
# ``message.tool_calls`` for non-streaming requests.
|
|
40
40
|
tools: true
|
|
41
|
-
# Validated for code generation
|
|
42
|
-
# Modal A100 (see benchmarks/generation/.../code/measured_baseline.json).
|
|
41
|
+
# Validated for code generation before enabling the code alias.
|
|
43
42
|
# Backs the model="code" alias. Informational (not request-gated).
|
|
44
43
|
code: true
|
|
45
44
|
# Backs the model="sql" alias. NOTE: this profile runs the outlines
|
|
@@ -31,8 +31,7 @@ tasks:
|
|
|
31
31
|
# NOTE: scoped to what the production backend (``outlines``, set
|
|
32
32
|
# per-profile under ``adapter_options.loadtime``) actually supports
|
|
33
33
|
# on SGLang. SGLang's outlines_backend explicitly skips ebnf with
|
|
34
|
-
# ``Skip unsupported key_type='ebnf'`` — confirmed
|
|
35
|
-
# 2026-05-26 (see ``benchmarks/generation/qwen35-outlines-smoke/``).
|
|
34
|
+
# ``Skip unsupported key_type='ebnf'`` — confirmed by a compatibility smoke.
|
|
36
35
|
# If an operator switches a Qwen3.5 profile to ``grammar_backend:
|
|
37
36
|
# xgrammar`` they should re-add ``"ebnf"`` here — xgrammar smoke on
|
|
38
37
|
# the same hardware passed all three modes (regex/json_schema/ebnf).
|
|
@@ -109,9 +108,8 @@ max_sequence_length: 8192
|
|
|
109
108
|
# effective_max_running_requests_per_dp = 48
|
|
110
109
|
#
|
|
111
110
|
# ``kv_budget_tokens`` is sized at ``token_capacity / 4``, matching the
|
|
112
|
-
# pattern set by Qwen3-4B-Instruct-2507. Re-calibrate
|
|
113
|
-
#
|
|
114
|
-
# ``mem_fraction_static`` changes.
|
|
111
|
+
# pattern set by Qwen3-4B-Instruct-2507. Re-calibrate with an SGLang capacity
|
|
112
|
+
# probe if its version or ``mem_fraction_static`` changes.
|
|
115
113
|
profiles:
|
|
116
114
|
# The bare model is the measured production A100-40GB shape. The
|
|
117
115
|
# ``a100-40gb`` alias below preserves the resolved profile identity used by
|
|
@@ -266,8 +264,8 @@ profiles:
|
|
|
266
264
|
max_batch_tokens: 65536
|
|
267
265
|
compute_precision: bfloat16
|
|
268
266
|
adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
|
|
269
|
-
# Analytical estimate — re-calibrate
|
|
270
|
-
#
|
|
267
|
+
# Analytical estimate — re-calibrate with an SGLang capacity probe once
|
|
268
|
+
# H100 access is set up. Scales ~2× off the A100-40GB number
|
|
271
269
|
# (80 GB / 40 GB), so ~420k tokens at context=32768.
|
|
272
270
|
kv_budget_tokens: 421888
|
|
273
271
|
adapter_options:
|
|
@@ -31,19 +31,18 @@ tasks:
|
|
|
31
31
|
grammar: ["json_schema", "regex"]
|
|
32
32
|
streaming: true
|
|
33
33
|
tools: true
|
|
34
|
-
# Validated on code + text-to-SQL —
|
|
35
|
-
# greedy+min_tokens=10
|
|
36
|
-
#
|
|
37
|
-
# Spider exec-acc 0.693. See code_sql_tools/measured_baseline.json.
|
|
34
|
+
# Validated on code + text-to-SQL — measured on H100 (bf16 no-spec,
|
|
35
|
+
# greedy+min_tokens=10). BF16 benchmark: HumanEval 0.933, MBPP 0.81
|
|
36
|
+
# (beats the 4B code default 0.866/0.74), Spider exec-acc 0.693.
|
|
38
37
|
# Informational (not request-gated); surfaces the high-end code/SQL option.
|
|
39
38
|
code: true
|
|
40
39
|
# CAVEAT: this flag is precision-agnostic, but FP8 weight quant regresses
|
|
41
40
|
# SQL ~13pts (Spider 0.71 BF16 -> 0.58 FP8, same-subset control; see the
|
|
42
|
-
#
|
|
41
|
+
# same-subset measurements). Code/tools/MC are FP8-safe. The RTX FP8 profile below is
|
|
43
42
|
# for code/tools/general. Route SQL-critical traffic to the BF16 profile
|
|
44
43
|
# or a BF16 bundle-qualified alias, e.g.
|
|
45
44
|
# SIE_GATEWAY_MODEL_ALIASES={"sql":"<bf16-bundle>:/Qwen/Qwen3.6-27B"}
|
|
46
|
-
# (gateway resolve_model_spec_with_aliases
|
|
45
|
+
# (gateway resolve_model_spec_with_aliases).
|
|
47
46
|
sql: true
|
|
48
47
|
# Qwen3.6 emits ``<think>...</think>`` reasoning by default. We
|
|
49
48
|
# disable it for the OpenAI-compat path so visible output is the
|
|
@@ -217,8 +216,8 @@ profiles:
|
|
|
217
216
|
# over H100 plus the FP8 weight saving is what makes 3/4 fit here.
|
|
218
217
|
#
|
|
219
218
|
# ACCURACY CONTRACT: FP8 is lossy. This profile is validated to within the
|
|
220
|
-
# Wilson 95% CI of the *BF16* baseline on all four generation tasks
|
|
221
|
-
#
|
|
219
|
+
# Wilson 95% CI of the *BF16* baseline on all four generation tasks. If FP8
|
|
220
|
+
# misses parity after bounded tuning, fall back to
|
|
222
221
|
# BF16 + NEXTN 3/4 (drop the ``--quantization fp8`` pair below; the 96 GB
|
|
223
222
|
# still fits the 3/4 draft in BF16). KV cache stays BF16 here — add
|
|
224
223
|
# ``--kv-cache-dtype fp8_e4m3`` only if memory/throughput needs it AND
|