sie-server 0.7.2__tar.gz → 0.8.0__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {sie_server-0.7.2 → sie_server-0.8.0}/.gitignore +2 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cpu +4 -2
- {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cuda12 +20 -6
- {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cuda13 +25 -19
- {sie_server-0.7.2 → sie_server-0.8.0}/PKG-INFO +1 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/README.md +9 -0
- sie_server-0.8.0/bundles/ctranslate2.yaml +6 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-cu130.yaml +40 -23
- sie_server-0.8.0/bundles/tensorrt-llm.yaml +39 -0
- sie_server-0.8.0/models/Qwen__Qwen3-VL-8B-Instruct.yaml +132 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.6-27B.yaml +3 -3
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.8-27B-FP8.yaml +16 -12
- sie_server-0.8.0/models/google__madlad400-3b-mt.yaml +44 -0
- sie_server-0.8.0/models/google__translategemma-4b-it.yaml +40 -0
- sie_server-0.8.0/models/zai-org__GLM-5.3-Flash.yaml +75 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/openapi.json +123 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/pyproject.toml +1 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_generation_base.py +450 -39
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_utils.py +5 -1
- sie_server-0.8.0/src/sie_server/adapters/ctranslate2/generation.py +747 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/fake/adapter.py +3 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/grounding_dino/adapter.py +48 -5
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mlx/generation.py +5 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/_compat/sitecustomize.py +23 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/_server.py +218 -20
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/cuda13.py +8 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/embedding.py +103 -15
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/gemma.py +10 -3
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/generation.py +607 -287
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang_vision_extract/_compat/sitecustomize.py +24 -0
- sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_compat/sitecustomize.py +13 -0
- sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_server.py +221 -0
- sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/compat.py +188 -0
- sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/generation.py +889 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/encode.py +2 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/extract.py +1 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/generate.py +228 -66
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/helpers.py +56 -2
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/models.py +2 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_compat.py +1 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_completions.py +125 -34
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_local.py +122 -9
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_responses.py +32 -12
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/score.py +2 -1
- sie_server-0.8.0/src/sie_server/config/device_groups.py +83 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/model.py +181 -3
- sie_server-0.8.0/src/sie_server/config/serving_artifacts.py +574 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/load_errors.py +21 -3
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/loader.py +170 -17
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/model_loader.py +78 -8
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/registry.py +740 -136
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/video_frames.py +70 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/ipc_server.py +67 -24
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/grammar_compile.py +16 -8
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/streaming.py +541 -199
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/tool_call_grammar.py +19 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/tool_call_parser.py +86 -5
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/grammar.py +6 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/openapi.py +51 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_adapter_revision_contract.py +18 -6
- sie_server-0.8.0/tests/adapters/test_ctranslate2_generation.py +511 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_docling_smoke.py +1 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_generation_base.py +195 -5
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_grounding_dino.py +39 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_mlx_generation.py +9 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang.py +244 -13
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang_generation.py +1671 -52
- sie_server-0.8.0/tests/adapters/test_sglang_launch_flags.py +200 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang_vision_extract.py +132 -0
- sie_server-0.8.0/tests/adapters/test_tensorrt_llm_compat.py +504 -0
- sie_server-0.8.0/tests/adapters/test_tensorrt_llm_generation.py +1847 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_error_code_hygiene.py +24 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract_oom.py +5 -3
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_generate.py +389 -4
- sie_server-0.8.0/tests/api/test_generate_stream.py +668 -0
- sie_server-0.8.0/tests/api/test_generation_cleanup_precedence.py +223 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_models.py +3 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_compat.py +3 -2
- sie_server-0.8.0/tests/api/test_openai_completions.py +722 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_local.py +258 -2
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_responses.py +182 -11
- sie_server-0.8.0/tests/api/test_request_body_limit.py +115 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_bundle_coverage.py +6 -0
- sie_server-0.8.0/tests/config/test_catalog_loadtime_options.py +95 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_qwen38_generation_profiles.py +7 -2
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_qwen_generation_profiles.py +2 -2
- sie_server-0.8.0/tests/config/test_serving_artifact_config.py +166 -0
- sie_server-0.8.0/tests/config/test_serving_artifacts.py +355 -0
- sie_server-0.8.0/tests/config/test_tensor_parallel_options.py +159 -0
- sie_server-0.8.0/tests/config/test_video_generation_profiles.py +130 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_loader.py +111 -0
- sie_server-0.8.0/tests/core/test_model_loader_cache.py +275 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_async.py +119 -0
- sie_server-0.8.0/tests/core/test_registry_device_groups.py +642 -0
- sie_server-0.8.0/tests/core/test_registry_generation_drain.py +302 -0
- sie_server-0.8.0/tests/core/test_registry_lifecycle_loop.py +180 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_memory.py +86 -0
- sie_server-0.8.0/tests/observability/__init__.py +0 -0
- sie_server-0.8.0/tests/processors/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_compile.py +64 -1
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming.py +1389 -33
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_tool_call_grammar.py +55 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_tool_call_parser.py +171 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_ipc_server.py +272 -7
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_model_yaml_filenames.py +34 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_openapi_export.py +52 -0
- sie_server-0.8.0/tests/type_defs/__init__.py +0 -0
- sie_server-0.7.2/tests/api/test_generate_stream.py +0 -229
- sie_server-0.7.2/tests/api/test_openai_completions.py +0 -362
- sie_server-0.7.2/tests/core/test_model_loader_cache.py +0 -72
- {sie_server-0.7.2 → sie_server-0.8.0}/CONTRIBUTING.md +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/LICENSE +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/candle.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/default.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/fake.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-embedding.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-vision-extract.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/bundles/transformers5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-Qwen2-1.5B-instruct.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-Qwen2-7B-instruct.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-modernbert-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-multilingual-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-reranker-modernbert-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-base-en-v1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-large-en-v1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-m3.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-large.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-v2-m3.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-small-en-v1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-small-zh-v1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/EmergentMethods__gliner_large_news-v2.1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/GritLM__GritLM-7B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/IDEA-Research__grounding-dino-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/IDEA-Research__grounding-dino-tiny.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Ihor__gliner-biomed-large-v1.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Linq-AI-Research__Linq-Embed-Mistral.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Marqo__marqo-ecommerce-embeddings-B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Marqo__marqo-fashionSigLIP.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__ModernBERT-base-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__deberta-v3-base-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__deberta-v3-large-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/NeuML__gliner-bert-tiny.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/NovaSearch__stella_en_1.5B_v5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/NovaSearch__stella_en_400M_v5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/PaddlePaddle__PaddleOCR-VL-1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-0.6B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-4B-Instruct-2507.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-0.6B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-4B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-8B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Reranker-0.6B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Reranker-4B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-VL-Embedding-2B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-VL-Reranker-2B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.5-4B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.6-35B-A3B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Salesforce__SFR-Embedding-2_R.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Salesforce__SFR-Embedding-Mistral.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-l-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-m-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-s.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/TomoroAI__tomoro-colqwen3-embed-4b.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/WhereIsAI__UAE-Large-V1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__ModernBERT-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__ModernBERT-large.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__answerai-colbert-small-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/colbert-ir__colbertv2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__ms-marco-MiniLM-L-12-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__ms-marco-MiniLM-L-6-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__nli-deberta-v3-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/defog__sqlcoder-7b-2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/docling.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/facebook__bart-large-mnli.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliguard-LLMGuardrails-300M.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliner2-base-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliner2-large-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_large-v2.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_medium-v2.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_small-v2.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__embeddinggemma-300m.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-26B-A4B-it.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-31B-it.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-E2B-it.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-E4B-it.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__owlv2-base-patch16-ensemble.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__owlv2-large-patch14-ensemble.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-base-patch16-256.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-so400m-patch14-224.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-so400m-patch14-384.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip2-base-patch16-224.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-30m-sparse.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-97m-multilingual-r2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-english-r2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-small-english-r2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-guardian-3.0-2b.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-base-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-large-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-mistral-7b-instruct.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-small-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-large-instruct.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-large.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-small.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jackboyla__glirel-large-v0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-colbert-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-code.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-de.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-en.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-es.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-zh.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-small-en.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-reranker-v2-base-multilingual.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-base-v1.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-large-v1.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-large-v3.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-small-v1.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliner-bi-base-v2.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__modern-gliner-bi-base-v1.0.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/laion__CLIP-ViT-B-32-laion2B-s34B-b79K.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/laion__CLIP-ViT-H-14-laion2B-s32B-b79K.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__GTE-ModernColBERT-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__LightOnOCR-2-1B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__Reason-ModernColBERT.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__mLateOn.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-base-ft.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-large.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-colbert-large-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-edge-colbert-v0-32m.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-embed-large-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-rerank-base-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-rerank-large-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/mynkchaudhry__Florence-2-FT-DocVQA.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/naver-clova-ix__donut-base-finetuned-cord-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/naver-clova-ix__donut-base-finetuned-docvqa.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__splade-cocondenser-selfdistil.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__splade-v3.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__v-splade-quality.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__modernbert-embed-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__nomic-embed-text-v1.5.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__nomic-embed-text-v2-moe.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/numind__NuNER_Zero-span.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/numind__NuNER_Zero.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__NV-Embed-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__llama-embed-nemotron-8b.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__llama-nemoretriever-colembed-3b-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__nemotron-colembed-vl-4b-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__clip-vit-base-patch32.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__clip-vit-large-patch14.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__whisper-large-v3-turbo.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opendatalab__MinerU2.5-Pro-2604-1.2B.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-distill.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-mini.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-distill.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-gte.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-v2-distill.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/prithivida__Splade_PP_en_v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/rasyosef__splade-mini.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/sentence-transformers__all-MiniLM-L6-v2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/sie-fake.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/sugiv__stablebridge-pruner-highlighter.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/tencent__R3-embedding-0.6b.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/tencent__R3-rerank-0.6b.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-base.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-large.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-small.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/topk-io__Iso-ModernColBERT.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_large-v2.1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_medium-v2.1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_multi-v2.1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_multi_pii-v1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_small-v2.1.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colSmol-256M.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colpali-v1.3-hf.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colqwen2.5-v0.2.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/models/zai-org__GLM-OCR.yaml +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/scripts/generate_tokenize_fixture.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/_ipc_test_harness.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapter_call_loop.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_base_adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_colbert_projection.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_colbert_utils.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_flash_base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_flash_pack.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_multivector.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_pylate_dense.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_spec.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_types.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_vision_patch_embed.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bert_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_flag/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_score_mixin.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/clip/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_modernbert_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_modernbert_flash/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_rotary_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colpali/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colqwen2/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colqwen3/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colsmol/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/cross_encoder/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/docling → sie_server-0.8.0/src/sie_server/adapters/ctranslate2}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/fake → sie_server-0.8.0/src/sie_server/adapters/docling}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/docling/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/donut/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/errors.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/gliner2 → sie_server-0.8.0/src/sie_server/adapters/fake}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/florence2/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliclass/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/grounding_dino → sie_server-0.8.0/src/sie_server/adapters/gliner2}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner2/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner2/classification.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner_bi/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/glirel/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/glm_ocr/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/lighton_ocr → sie_server-0.8.0/src/sie_server/adapters/grounding_dino}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gte_sparse_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/jina_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/mlx → sie_server-0.8.0/src/sie_server/adapters/lighton_ocr}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/lighton_ocr/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/lora.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mineru_vl/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/owlv2 → sie_server-0.8.0/src/sie_server/adapters/mlx}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mlx/_server.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/modernbert_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/modernbert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nemo_colembed/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nli_classification/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nli_classification_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nomic_flash/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/qwen2_flash_cross_encoder → sie_server-0.8.0/src/sie_server/adapters/owlv2}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/owlv2/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/paddleocr_vl/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/peft_lora_mixin.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/pytorch_embedding/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen2_flash/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/qwen3_vl_reranker → sie_server-0.8.0/src/sie_server/adapters/qwen2_flash_cross_encoder}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen2_flash_cross_encoder/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen3_vl_embedding/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/sglang → sie_server-0.8.0/src/sie_server/adapters/qwen3_vl_reranker}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen3_vl_reranker/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/rope_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sentence_transformer/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/sglang/_compat → sie_server-0.8.0/src/sie_server/adapters/sglang}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/sglang_vision_extract → sie_server-0.8.0/src/sie_server/adapters/sglang/_compat}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/sglang_vision_extract/_compat → sie_server-0.8.0/src/sie_server/adapters/sglang_vision_extract}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/siglip → sie_server-0.8.0/src/sie_server/adapters/sglang_vision_extract/_compat}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang_vision_extract/adapter.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/splade_flash → sie_server-0.8.0/src/sie_server/adapters/siglip}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/siglip/adapter.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/st_sparse_vision → sie_server-0.8.0/src/sie_server/adapters/splade_flash}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/splade_flash/adapter.py +0 -0
- {sie_server-0.7.2/src/sie_server/adapters/whisper → sie_server-0.8.0/src/sie_server/adapters/st_sparse_vision}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/st_sparse_vision/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/stablebridge_pruner/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/app → sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/config → sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_compat}/__init__.py +0 -0
- {sie_server-0.7.2/src/sie_server/health → sie_server-0.8.0/src/sie_server/adapters/whisper}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/whisper/adapter.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/xlm_roberta_flash/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/health.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_audio.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openapi.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/options.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/root.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/serialization.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/validation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/ws.py +0 -0
- {sie_server-0.7.2/src/sie_server/observability → sie_server-0.8.0/src/sie_server/app}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/app/app_factory.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/app/app_state_config.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/bundle_requirements.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/cli.py +0 -0
- {sie_server-0.7.2/src/sie_server/processors → sie_server-0.8.0/src/sie_server/config}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/engine.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/package_artifacts.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/adaptive_batching.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/batcher.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/deps.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/disk_cache.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/encode_pipeline.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/extract_cost.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/gpu_health.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/hf_env.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/hot_reload.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/inference.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/inference_output.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/logging.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/memory.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/model_suggestions.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/oom.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/pool_isolation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/postprocessor.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/postprocessor_registry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/prepared.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/audio.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/image.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/text.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/vision.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor_registry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/readiness.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/residency.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/runtime_options.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/score_cost.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/shutdown.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/text_tokens.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/timing.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/tokenizer.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/watcher.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/encode.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/extract.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/score.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/model_worker.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/oom_recovery.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/types.py +0 -0
- {sie_server-0.7.2/tests/adapters → sie_server-0.8.0/src/sie_server/health}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/health/saturation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/ipc_types.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/local_ingest_client.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/main.py +0 -0
- {sie_server-0.7.2/tests/api → sie_server-0.8.0/src/sie_server/observability}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/generation_diagnostics.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/gpu.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/telemetry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/tracing.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/worker_telemetry.py +0 -0
- {sie_server-0.7.2/tests/app → sie_server-0.8.0/src/sie_server/processors}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/admission.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/grammar_cache.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/work_class_scheduler.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/queue_executor.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/inputs.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/outputs.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/overflow_policy.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/requests.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/responses.py +0 -0
- {sie_server-0.7.2/tests/config → sie_server-0.8.0/tests/adapters}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_bge_m3.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_bge_m3_flash.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_clip.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_modernbert_flash_projection.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_modernbert_flash_tokenizer.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_projection.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_punctuation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colqwen2_revision.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_docling.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_donut.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_factory_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake_catalog.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake_faults.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_flash_base.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_flash_pack.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_florence2.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliclass_contracts.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliclass_overflow_policy.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner2.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner_merge.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner_metering.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_glirel.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_glm_ocr.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gte_sparse.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_image_decode_errors.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_jina_flash_cross_encoder.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lighton_ocr.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lora.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lora_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_mineru_vl.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_multivector.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_owlv2.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_paddleocr_vl.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pylate_dense.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pytorch_embedding_model_encode.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pytorch_embedding_revision.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen2_flash_cross_encoder.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen3_vl_embedding.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen3_vl_reranker.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_runtime_options.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sentence_transformer.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_siglip.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_siglip_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sparse_aggregation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_flash_parity.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_packed_parity.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_roberta_position_ids.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_st_sparse_vision.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_stablebridge_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_stablebridge_pruner.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_vision_patch_embed.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_visual_document.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_visual_muvera_postprocessors.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_whisper.py +0 -0
- {sie_server-0.7.2/tests/core → sie_server-0.8.0/tests/api}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_canonical_profile_conformance.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_dtype_queue_http_parity.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_dtype.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_endpoint.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_json_schema.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_timing.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_validation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_health.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_helpers_telemetry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_audio.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_score.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_usage_reporting.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_version_header.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_ws.py +0 -0
- {sie_server-0.7.2/tests/core/worker → sie_server-0.8.0/tests/app}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/app/test_app_factory.py +0 -0
- {sie_server-0.7.2/tests/fake_stack → sie_server-0.8.0/tests/config}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_answerai_colbert_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_colbertv2_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_config.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_generation_mode_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_gte_modern_colbert_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_h100_fp8_generation_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_jina_colbert_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_model_prewarm_grammars.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_muvera_profile_postprocessors.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_mxbai_colbert_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_mxbai_edge_colbert_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_nvidia_nemo_colembed_profiles.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_package_artifacts.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_profile_backend_consistency.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_profile_template_inheritance.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_visual_muvera_containment.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/conftest.py +0 -0
- {sie_server-0.7.2/tests/health → sie_server-0.8.0/tests/core}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_adaptive_batching.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_batcher.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_bundle_requirements.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_disk_cache.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_encode_format_output.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_encode_worker_batching.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_gpu_health.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_hot_reload.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_idle_evict.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_inference.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_load_rgb.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_logging.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_lora_generation_exclusion.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_memory.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_memory_synthetic.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_model_load_timeout.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_model_suggestions.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_oom_detection.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_pool_isolation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_postprocessor.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_postprocessor_registry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_prepared.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_preprocessor.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_preprocessor_registry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_quantization.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_readiness.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_core.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_deps.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_failed_state.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_multi_model.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_residency.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_revision_identity.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_runtime_options.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_shutdown.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_timing.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_unload_off_event_loop.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_video_frames.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_watcher.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_backpressure.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_core.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_drain.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_extract.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_lora.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_options.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_preformed.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_score.py +0 -0
- {sie_server-0.7.2/tests/integration → sie_server-0.8.0/tests/core/worker}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/worker/test_oom_recovery.py +0 -0
- {sie_server-0.7.2/tests/observability → sie_server-0.8.0/tests/fake_stack}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/conftest.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_lost_result.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_model_loading_race.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_oom_ladder.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_registry_races.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_sdk_surface.py +0 -0
- {sie_server-0.7.2/tests/processors → sie_server-0.8.0/tests/health}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/health/test_saturation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/health/test_worker_id_consistency.py +0 -0
- {sie_server-0.7.2/tests/type_defs → sie_server-0.8.0/tests/integration}/__init__.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/integration/test_chat_completions.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/integration/test_grammar_generate.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_generation_diagnostics.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_telemetry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_trace_propagation.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_tracing.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_worker_telemetry.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_worker_telemetry_benchmark.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_cache.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_prewarm.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming_admission.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_work_class_scheduler.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_adapter_call_loop.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_all_models.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_devices.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_log_level.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_pool.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_decode_item.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_docker_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_documented_model_ids.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_ipc_types_raw_output.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_local_ingest_client.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_metering_units.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_parity_run_batch.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_queue_executor.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_queue_executor_stage1d.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_readiness.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_sdk_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_server_process_fixture.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_server_smoke.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_sparse_integration.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_stage1d_byte_identity.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_decode_image.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_inputs.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_inputs_json_decode.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_media_bytes.py +0 -0
- {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_types.py +0 -0
|
@@ -101,8 +101,10 @@ RUN --mount=type=cache,target=/root/.cache/pip \
|
|
|
101
101
|
# shared-deps resolver.
|
|
102
102
|
RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
|
|
103
103
|
|
|
104
|
-
# Register bundle-libs
|
|
105
|
-
|
|
104
|
+
# Register bundle-libs as a site directory so dependency-owned .pth files are
|
|
105
|
+
# processed, then move every discovered bundle path ahead of the shared venv so
|
|
106
|
+
# bundle versions shadow it. Content is identical across bundles.
|
|
107
|
+
RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
|
|
106
108
|
> /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
|
|
107
109
|
|
|
108
110
|
# .venv cleanup + stdlib trim — runs here so /app/.venv reaches its final
|
|
@@ -110,12 +110,12 @@ RUN --mount=type=cache,target=/root/.cache/pip \
|
|
|
110
110
|
# intentionally not imported here.
|
|
111
111
|
RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
|
|
112
112
|
|
|
113
|
-
# Register bundle-libs
|
|
114
|
-
# interpreter startup.
|
|
115
|
-
#
|
|
116
|
-
#
|
|
117
|
-
#
|
|
118
|
-
RUN echo "import sys; sys.path.
|
|
113
|
+
# Register bundle-libs as a site directory so dependency-owned .pth files are
|
|
114
|
+
# processed at interpreter startup. Then move every discovered bundle path
|
|
115
|
+
# ahead of the shared venv so bundle-specific versions SHADOW it (required for
|
|
116
|
+
# the transformers5 bundle). Content is identical for every bundle, so writing
|
|
117
|
+
# it here keeps the shared venv layer byte-identical.
|
|
118
|
+
RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
|
|
119
119
|
> /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
|
|
120
120
|
|
|
121
121
|
# Conservative venv cleanup — only things known to be runtime-safe. Keep
|
|
@@ -210,10 +210,24 @@ RUN set -eux; \
|
|
|
210
210
|
# smaller CUDA base runtime; SGLang-family bundles need the devel toolkit
|
|
211
211
|
# because flashinfer/tvm_ffi perform runtime JIT through nvcc on first decode.
|
|
212
212
|
FROM nvidia/cuda:12.4.1-base-ubuntu22.04 AS runtime-default
|
|
213
|
+
# The CTranslate2 bundle uses the CUDA runtime image, not the devel toolchain.
|
|
214
|
+
FROM nvidia/cuda:12.4.1-runtime-ubuntu22.04 AS runtime-ctranslate2
|
|
213
215
|
FROM nvidia/cuda:12.4.1-base-ubuntu22.04 AS runtime-transformers5
|
|
214
216
|
FROM nvidia/cuda:12.9.1-cudnn-devel-ubuntu22.04 AS runtime-sglang
|
|
215
217
|
ENV CUDA_HOME=/usr/local/cuda \
|
|
216
218
|
LD_LIBRARY_PATH="/usr/local/cuda/lib64:$LD_LIBRARY_PATH"
|
|
219
|
+
# FFmpeg shared libraries: SGLang decodes video inputs with torchcodec, which
|
|
220
|
+
# dlopens them at first use and has no bundled FFmpeg.
|
|
221
|
+
RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
|
|
222
|
+
--mount=type=cache,target=/var/lib/apt/lists,sharing=locked \
|
|
223
|
+
apt-get update && apt-get install -y --no-install-recommends \
|
|
224
|
+
libavcodec58 \
|
|
225
|
+
libavdevice58 \
|
|
226
|
+
libavfilter7 \
|
|
227
|
+
libavformat58 \
|
|
228
|
+
libavutil56 \
|
|
229
|
+
libswresample3 \
|
|
230
|
+
libswscale5
|
|
217
231
|
FROM runtime-sglang AS runtime-sglang-embedding
|
|
218
232
|
FROM runtime-sglang AS runtime-sglang-vision-extract
|
|
219
233
|
# NOTE: the sglang-cu130 bundle (CUDA 13 / sglang 0.5.13 / torch 2.11 cu130) is built by
|
|
@@ -1,14 +1,12 @@
|
|
|
1
1
|
# syntax=docker/dockerfile:1
|
|
2
|
-
# SIE Server - CUDA 13 Image (
|
|
2
|
+
# SIE Server - CUDA 13 Image (engine-isolated cu130 bundles)
|
|
3
3
|
# Build from repo root:
|
|
4
4
|
# docker build -f packages/sie_server/Dockerfile.cuda13 --build-arg BUNDLE=sglang-cu130 -t sie-server:cuda13-sglang-cu130 .
|
|
5
5
|
#
|
|
6
|
-
# WHY A SEPARATE PLATFORM:
|
|
7
|
-
#
|
|
8
|
-
# (
|
|
9
|
-
#
|
|
10
|
-
# Dockerfile.cuda12 means a ``cuda13-sglang-cu130`` image is honestly labelled CUDA 13,
|
|
11
|
-
# not a CUDA-13 image hiding under a ``cuda12-*`` tag (see #1415).
|
|
6
|
+
# WHY A SEPARATE PLATFORM: CUDA 13 engines carry independent exact Torch,
|
|
7
|
+
# Transformers, FlashInfer, and native-library closures. Keeping them here
|
|
8
|
+
# (platform ``cuda13``) instead of Dockerfile.cuda12 makes image tags honest
|
|
9
|
+
# while still sharing the expensive CUDA 13 base layers.
|
|
12
10
|
#
|
|
13
11
|
# STRUCTURE: mirrors Dockerfile.cuda12's deps→base→builder→runtime stages so the
|
|
14
12
|
# shared logic (standalone Python, editable installs, bundle-libs .pth shadow,
|
|
@@ -18,7 +16,7 @@
|
|
|
18
16
|
# cu130 bundle), so there is no per-bundle runtime indirection.
|
|
19
17
|
#
|
|
20
18
|
# DUAL-TORCH CARRY: the shared base venv still installs torch 2.9 (cu129) from
|
|
21
|
-
# pyproject, and
|
|
19
|
+
# pyproject, and CUDA 13 bundles overlay torch 2.11 (cu130) into bundle-libs
|
|
22
20
|
# (~+3 GB). Slimming torch out of sie-server core to drop the carry is a tracked
|
|
23
21
|
# follow-up (#1415).
|
|
24
22
|
|
|
@@ -50,13 +48,16 @@ ENV DEBIAN_FRONTEND=noninteractive \
|
|
|
50
48
|
UV_PYTHON_INSTALL_DIR=/opt/python \
|
|
51
49
|
PIP_DISABLE_PIP_VERSION_CHECK=1
|
|
52
50
|
|
|
53
|
-
# Minimal apt footprint:
|
|
51
|
+
# Minimal apt footprint: curl/git plus the MPI runtime required by
|
|
52
|
+
# TensorRT-LLM's Python import; no OpenMPI development headers are needed.
|
|
54
53
|
RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
|
|
55
54
|
--mount=type=cache,target=/var/lib/apt/lists,sharing=locked \
|
|
56
55
|
apt-get update && apt-get install -y --no-install-recommends \
|
|
57
56
|
ca-certificates \
|
|
58
57
|
curl \
|
|
59
|
-
git
|
|
58
|
+
git \
|
|
59
|
+
libopenmpi3 \
|
|
60
|
+
openmpi-bin
|
|
60
61
|
|
|
61
62
|
ARG UV_VERSION
|
|
62
63
|
RUN curl -LsSf https://astral.sh/uv/${UV_VERSION}/install.sh | sh \
|
|
@@ -117,12 +118,12 @@ RUN --mount=type=cache,target=/root/.cache/pip \
|
|
|
117
118
|
# Sanity-check shared venv imports.
|
|
118
119
|
RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
|
|
119
120
|
|
|
120
|
-
# Register bundle-libs
|
|
121
|
-
#
|
|
122
|
-
#
|
|
123
|
-
# overlay). Content is identical for every bundle, so
|
|
124
|
-
# shared venv layer byte-identical.
|
|
125
|
-
RUN echo "import sys; sys.path.
|
|
121
|
+
# Register bundle-libs as a site directory so dependency-owned .pth files are
|
|
122
|
+
# processed at interpreter startup. Then move every discovered bundle path
|
|
123
|
+
# ahead of the shared venv so bundle-specific versions SHADOW it (the cu130
|
|
124
|
+
# torch/transformers/engine overlay). Content is identical for every bundle, so
|
|
125
|
+
# writing it here keeps the shared venv layer byte-identical.
|
|
126
|
+
RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
|
|
126
127
|
> /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
|
|
127
128
|
|
|
128
129
|
# Conservative venv cleanup — only runtime-safe removals. Keep torch/include
|
|
@@ -155,7 +156,7 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
|
|
|
155
156
|
&& cat /tmp/bundle-requirements.txt
|
|
156
157
|
|
|
157
158
|
# cu130 bundle deps go into a separate site-packages tree (``bundle-libs``,
|
|
158
|
-
# prepended to sys.path via the .pth above).
|
|
159
|
+
# prepended to sys.path via the .pth above). CUDA 13 engines need torch 2.11
|
|
159
160
|
# from the cu130 PyTorch index, where the only ``2.11.0`` is the ``+cu130``
|
|
160
161
|
# local-version wheel; pip's multi-index resolution does not reliably prefer it
|
|
161
162
|
# over PyPI's default-CUDA build, so cuda13 bundles resolve with ``uv`` and
|
|
@@ -164,7 +165,7 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
|
|
|
164
165
|
# cu130-index resolution was validated with sglang 0.5.13, torch 2.11, and a
|
|
165
166
|
# cu130 runtime in a fresh GPU environment.
|
|
166
167
|
#
|
|
167
|
-
# COVERAGE NOTE: the
|
|
168
|
+
# COVERAGE NOTE: the CUDA 13 image CI callers
|
|
168
169
|
# builds this image and asserts on CPU that the bundle-libs cu130 overlay
|
|
169
170
|
# SHADOWS the base venv (import torch -> 2.11+cu130, transformers 5.x). It does
|
|
170
171
|
# NOT exercise GPU init: the cu12 base venv + cu130 bundle-libs both expose the
|
|
@@ -220,6 +221,8 @@ ENV DEBIAN_FRONTEND=noninteractive
|
|
|
220
221
|
# libnuma1: required by sgl_kernel; import fails with a misleading SM-arch error
|
|
221
222
|
# without it.
|
|
222
223
|
# libgomp1: torch OpenMP runtime.
|
|
224
|
+
# libopenmpi3/openmpi-bin: TensorRT-LLM imports MPI at runtime; headers are not
|
|
225
|
+
# required by the qualified wheel closure.
|
|
223
226
|
# libspatialindex-c6 / libgl1 / libglib2.0-0 / libice6 / libsm6 / libx11-6 /
|
|
224
227
|
# libxcb1 / libxext6: docling/opencv dlopen chain (kept symmetric with the
|
|
225
228
|
# cuda12 runtime so the same model bundle deps import cleanly).
|
|
@@ -235,9 +238,11 @@ RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
|
|
|
235
238
|
libgomp1 \
|
|
236
239
|
libice6 \
|
|
237
240
|
libnuma1 \
|
|
241
|
+
libopenmpi3 \
|
|
238
242
|
libsm6 \
|
|
239
243
|
libspatialindex-c6 \
|
|
240
244
|
ninja-build \
|
|
245
|
+
openmpi-bin \
|
|
241
246
|
libx11-6 \
|
|
242
247
|
libxcb1 \
|
|
243
248
|
libxext6
|
|
@@ -278,7 +283,8 @@ LABEL org.opencontainers.image.title="SIE Server" \
|
|
|
278
283
|
org.opencontainers.image.description="Search Inference Engine - ${BUNDLE} bundle (CUDA 13)" \
|
|
279
284
|
sie.bundle="${BUNDLE}"
|
|
280
285
|
|
|
281
|
-
|
|
286
|
+
# ``uv --target`` writes engine entrypoints beside the package overlay.
|
|
287
|
+
ENV PATH="/app/bundle-libs/bin:/app/.venv/bin:$PATH" \
|
|
282
288
|
PYTHONUNBUFFERED=1 \
|
|
283
289
|
PYTHONDONTWRITEBYTECODE=1 \
|
|
284
290
|
HF_HOME=/app/.cache/huggingface \
|
|
@@ -39,6 +39,15 @@ pip install sie-server
|
|
|
39
39
|
sie-server serve --port 8080 --device cuda:0
|
|
40
40
|
```
|
|
41
41
|
|
|
42
|
+
### TensorRT-LLM generation
|
|
43
|
+
|
|
44
|
+
TensorRT-LLM buffers completion token IDs and emits the final text together only
|
|
45
|
+
after generation finishes and the terminal stream is verified, even with
|
|
46
|
+
`stream=True`. This preserves context-sensitive spacing and punctuation and
|
|
47
|
+
removes matched stop sequences consistently from returned text, completion-token
|
|
48
|
+
usage, and logprobs. Long completions delay the first visible text; existing
|
|
49
|
+
request timeouts still apply. Other adapters are unaffected.
|
|
50
|
+
|
|
42
51
|
## Configuration
|
|
43
52
|
|
|
44
53
|
`sie-server` reads its config from `SIE_*` environment variables (Pydantic
|
|
@@ -2,8 +2,8 @@ name: sglang-cu130
|
|
|
2
2
|
priority: 20
|
|
3
3
|
default: false
|
|
4
4
|
# GPU platform this bundle targets — selects packages/sie_server/Dockerfile.cuda13
|
|
5
|
-
# and tags images ``cuda13-sglang-cu130`` (not ``cuda12-*``).
|
|
6
|
-
#
|
|
5
|
+
# and tags images ``cuda13-sglang-cu130`` (not ``cuda12-*``). The pinned engine
|
|
6
|
+
# needs torch cu130 on a CUDA 13 devel runtime (see below). Read by the
|
|
7
7
|
# image build. Bundles without this field default to ``cuda12``.
|
|
8
8
|
platform: cuda13
|
|
9
9
|
# General CUDA 13 / cu130 SGLang worker image, introduced for Google Gemma 4
|
|
@@ -26,13 +26,31 @@ platform: cuda13
|
|
|
26
26
|
# JIT kernel (jit_kernel/csrc/elementwise/activation.cuh) fails to compile
|
|
27
27
|
# under strict nvcc — "select_kernel ... expected a type, got
|
|
28
28
|
# ActivationKind::kSiLU" — confirmed broken on BOTH CUDA 12.9 and 13.0. 0.5.13
|
|
29
|
-
#
|
|
30
|
-
#
|
|
31
|
-
#
|
|
29
|
+
# fixed it, and this bundle pinned 0.5.13 until the move to 0.5.20 below.
|
|
30
|
+
#
|
|
31
|
+
# Now pinned to 0.5.20, which is the first release carrying the ``glm5_next``
|
|
32
|
+
# model (python/sglang/srt/models/glm5_next.py, EntryClass
|
|
33
|
+
# ``Glm5NextForConditionalGeneration``). 0.5.13 has no such module, so the
|
|
34
|
+
# architecture cannot load on it at any width. 0.5.20 moves its own exact pins
|
|
35
|
+
# with it: torch 2.11 -> 2.13 (cu130 wheels exist for both), transformers
|
|
36
|
+
# 5.8.1 -> 5.12.1, flashinfer-python 0.6.12 -> 0.6.18, sgl-deep-gemm
|
|
37
|
+
# 0.1.2 -> 0.2.0, sglang-kernel 0.4.3 -> 0.4.7, apache-tvm-ffi 0.1.9 -> 0.1.11,
|
|
38
|
+
# and it adds humming-kernels and quack-kernels. xgrammar stays at 0.2.1.
|
|
39
|
+
# Those versions are sglang's own ``==`` pins, not choices made here.
|
|
40
|
+
#
|
|
41
|
+
# 0.5.20 also renames launch flags SIE uses. ``--mamba-scheduler-strategy`` is
|
|
42
|
+
# now ``--mamba-radix-cache-strategy``; ``--cuda-graph-max-bs`` is split into
|
|
43
|
+
# ``--cuda-graph-max-bs-decode`` and ``--cuda-graph-max-bs-prefill``; and
|
|
44
|
+
# ``--disable-piecewise-cuda-graph`` is gone, the prefill-phase graph it turned
|
|
45
|
+
# off now controlled by ``--disable-prefill-cuda-graph``. The adapters routed
|
|
46
|
+
# here and the profiles that use them carry the new names. The ``sglang``
|
|
47
|
+
# bundle's engine keeps the old ones.
|
|
48
|
+
#
|
|
49
|
+
# The bundle's image carries torch (cu130) on a CUDA 13 base — built by
|
|
32
50
|
# the dedicated ``cuda13`` platform (packages/sie_server/Dockerfile.cuda13),
|
|
33
51
|
# selected via the ``platform: cuda13`` field above. The shared base venv still
|
|
34
|
-
# ships torch
|
|
35
|
-
# torch out of sie-server core would remove that
|
|
52
|
+
# ships its own torch, so the cu130 image carries two torches (~+3 GB); slimming
|
|
53
|
+
# torch out of sie-server core would remove that.
|
|
36
54
|
#
|
|
37
55
|
# Distinct thin adapter modules scope routing here because bundle compatibility
|
|
38
56
|
# keys on module paths. Gemma models use `...sglang.gemma`; Qwen profiles that
|
|
@@ -43,28 +61,27 @@ adapters:
|
|
|
43
61
|
- sie_server.adapters.sglang.gemma
|
|
44
62
|
- sie_server.adapters.sglang.cuda13
|
|
45
63
|
deps:
|
|
46
|
-
# sglang 0.5.
|
|
47
|
-
#
|
|
48
|
-
# torch==2.
|
|
49
|
-
# sgl-deep-gemm==0.
|
|
50
|
-
# flashinfer-python==0.6.
|
|
64
|
+
# sglang 0.5.20 (see the VERSION NOTE above). Verified transitive resolution
|
|
65
|
+
# on the Modal cu130 image:
|
|
66
|
+
# torch==2.13.0 (cu130), transformers==5.12.1, kernels==0.14.1,
|
|
67
|
+
# sgl-deep-gemm==0.2.0, sglang-kernel==0.4.7, and
|
|
68
|
+
# flashinfer-python==0.6.18 (the exact SGLang 0.5.20 closure).
|
|
51
69
|
# These resolve from the cu130 wheel indexes at build/serve time
|
|
52
70
|
# (download.pytorch.org/whl/cu130 + https://docs.sglang.ai/whl/cu130/),
|
|
53
71
|
# supplied by the build (Dockerfile.cuda13 / Modal image). torch,
|
|
54
|
-
# transformers, and kernels are intentionally NOT re-pinned here — sglang
|
|
55
|
-
#
|
|
56
|
-
#
|
|
57
|
-
#
|
|
58
|
-
|
|
59
|
-
sglang: '==0.5.13'
|
|
72
|
+
# transformers, and kernels are intentionally NOT re-pinned here — sglang's
|
|
73
|
+
# own exact pins drive them. (sglang declares a bare unpinned `kernels`, so
|
|
74
|
+
# without its transitive pin uv would grab the latest, which breaks sglang's
|
|
75
|
+
# import — let sglang constrain it.)
|
|
76
|
+
sglang: '==0.5.20'
|
|
60
77
|
# Structured-output backend the Gemma model configs select
|
|
61
78
|
# (tasks.generate ... grammar_backend: xgrammar). Pinned to the version
|
|
62
|
-
# sglang 0.5.
|
|
63
|
-
# bundle's rationale). NOTE:
|
|
64
|
-
# sglang bundle pins for the older engine.
|
|
79
|
+
# sglang 0.5.20 resolves, to prevent silent drift (mirrors the sglang
|
|
80
|
+
# bundle's rationale). NOTE: this engine uses xgrammar 0.2.x, not the 0.1.32
|
|
81
|
+
# the sglang bundle pins for the older engine.
|
|
65
82
|
xgrammar: '==0.2.1'
|
|
66
83
|
# XGrammar 0.2.1 imports ``tvm_ffi`` while its package metadata leaves the
|
|
67
|
-
# dependency open at >=0.1.9. SGLang 0.5.
|
|
84
|
+
# dependency open at >=0.1.9. SGLang 0.5.20 pins apache-tvm-ffi==0.1.11
|
|
68
85
|
# exactly, so declare the same version explicitly: this keeps the import in
|
|
69
86
|
# the image and lets the bundle resolve as one compatible dependency set.
|
|
70
|
-
apache-tvm-ffi: '==0.1.
|
|
87
|
+
apache-tvm-ffi: '==0.1.11'
|
|
@@ -0,0 +1,39 @@
|
|
|
1
|
+
name: tensorrt-llm
|
|
2
|
+
priority: 20
|
|
3
|
+
default: false
|
|
4
|
+
# Reusable direct-HF encoder-decoder runtime. This is a CUDA 13 engine lane,
|
|
5
|
+
# not a checkpoint-specific bundle; compatible T5/BART/mBART-family profiles
|
|
6
|
+
# opt in through the generic adapter module below.
|
|
7
|
+
platform: cuda13
|
|
8
|
+
adapters:
|
|
9
|
+
- sie_server.adapters.tensorrt_llm.generation
|
|
10
|
+
deps:
|
|
11
|
+
# Exact prerelease qualified from tag commit
|
|
12
|
+
# 1cef02e901be43081b1ba6d4981e94ed3bd9c1e8. Compatibility overlays verify
|
|
13
|
+
# the complete rc24 source files they patch and refuse any other build.
|
|
14
|
+
tensorrt-llm: '==1.3.0rc24'
|
|
15
|
+
# rc24's direct-HF T5 closure. Torch resolves to the +cu130 wheel through
|
|
16
|
+
# Dockerfile.cuda13's explicit PyTorch index.
|
|
17
|
+
torch: '==2.11.0'
|
|
18
|
+
transformers: '==5.5.4'
|
|
19
|
+
flashinfer-python: '==0.6.16'
|
|
20
|
+
# Keep the qualified build stable when the image resolver permits prereleases.
|
|
21
|
+
cuda-tile: '==1.6.0rc8'
|
|
22
|
+
triton: '==3.6.0'
|
|
23
|
+
nvidia-cutlass-dsl: '==4.5.0'
|
|
24
|
+
nvidia-cuda-tileiras: '==13.1.80'
|
|
25
|
+
nvidia-matmul-heuristics: '==0.1.0.27'
|
|
26
|
+
# cuda-python 13.3.1 permits cuda-pathfinder~=1.1, while cuda-core and
|
|
27
|
+
# cuda-bindings only require >=1.4.2. Pin the import-proven rc24 closure so
|
|
28
|
+
# a newer transitive release cannot silently change the engine image.
|
|
29
|
+
cuda-pathfinder: '==1.7.0'
|
|
30
|
+
# rc24 permits an NCCL range; lock the import-proven cu13 build so PyPI and
|
|
31
|
+
# the cu130 indexes cannot choose a different ABI-compatible-looking wheel.
|
|
32
|
+
nvidia-nccl-cu13: '==2.28.9'
|
|
33
|
+
flash-attn-4: '==4.0.0b11'
|
|
34
|
+
torch-c-dlpack-ext: '==0.1.3'
|
|
35
|
+
xgrammar: '==0.1.32'
|
|
36
|
+
apache-tvm-ffi: '==0.1.6'
|
|
37
|
+
# The published rc24 closure leaves mpmath open; a newer resolution breaks
|
|
38
|
+
# native import. 1.3.0 is the exact import-proven value.
|
|
39
|
+
mpmath: '==1.3.0'
|
|
@@ -0,0 +1,132 @@
|
|
|
1
|
+
sie_id: "Qwen/Qwen3-VL-8B-Instruct"
|
|
2
|
+
hf_id: "Qwen/Qwen3-VL-8B-Instruct"
|
|
3
|
+
hf_revision: 0c351dd01ed87e9c1b53cbc748cba10e6187ff3b
|
|
4
|
+
inputs:
|
|
5
|
+
# Video is served on the direct /v1/chat/completions route as one inline
|
|
6
|
+
# base64 ``video_url`` per request; the runtime samples frames per the
|
|
7
|
+
# ``video`` block of ``--mm-process-config`` below.
|
|
8
|
+
text: true
|
|
9
|
+
image: true
|
|
10
|
+
audio: false
|
|
11
|
+
video: true
|
|
12
|
+
tasks:
|
|
13
|
+
encode: null
|
|
14
|
+
score: null
|
|
15
|
+
extract: null
|
|
16
|
+
generate:
|
|
17
|
+
# Native context is 262,144 tokens; the served window is 32K so one
|
|
18
|
+
# admission fits a 16K-token video plus the model-card VL output length.
|
|
19
|
+
context_length: 32768
|
|
20
|
+
# Model card VL recommendation: out_seq_length=16384.
|
|
21
|
+
max_output_tokens: 16384
|
|
22
|
+
# Every profile is non-speculative (no MTP/NEXTN head in the checkpoint),
|
|
23
|
+
# so the grammar-safe fallback is the same launch shape.
|
|
24
|
+
grammar_profile: no-spec
|
|
25
|
+
capabilities:
|
|
26
|
+
grammar: ["json_schema", "regex"]
|
|
27
|
+
streaming: true
|
|
28
|
+
# The chat template renders Hermes-style <tool_call>{json}</tool_call>.
|
|
29
|
+
tools: true
|
|
30
|
+
max_sequence_length: 32768
|
|
31
|
+
# KV-cache math (text_config, bf16): 36 layers x 8 KV heads x head_dim 128
|
|
32
|
+
# kv_bytes_per_token = 2 (k+v) x 36 x 8 x 128 x 2 B = 147,456 B = 144 KiB
|
|
33
|
+
# RTX PRO 6000 (96 GB) at mem_fraction_static=0.85 with ~17.5 GB weights:
|
|
34
|
+
# (96 x 0.85 - 17.5) GB / 144 KiB ~= 430,000 tokens theoretical.
|
|
35
|
+
# kv_budget_tokens admits two full 32K-context requests, leaving headroom for
|
|
36
|
+
# vision-encoder activations on image/video prefill.
|
|
37
|
+
profiles:
|
|
38
|
+
default:
|
|
39
|
+
max_batch_tokens: 32768
|
|
40
|
+
compute_precision: bfloat16
|
|
41
|
+
adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
|
|
42
|
+
kv_budget_tokens: 65536
|
|
43
|
+
adapter_options:
|
|
44
|
+
loadtime:
|
|
45
|
+
mem_fraction_static: 0.85
|
|
46
|
+
served_model_name: Qwen/Qwen3-VL-8B-Instruct
|
|
47
|
+
grammar_backend: xgrammar
|
|
48
|
+
tool_call_parser: qwen25
|
|
49
|
+
speculative:
|
|
50
|
+
enabled: false
|
|
51
|
+
extra_launch_args:
|
|
52
|
+
- "--mm-process-config"
|
|
53
|
+
- '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
|
|
54
|
+
runtime:
|
|
55
|
+
first_chunk_timeout_s: 90
|
|
56
|
+
inter_chunk_timeout_s: 15
|
|
57
|
+
overall_timeout_s: 600
|
|
58
|
+
# Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
|
|
59
|
+
# presence_penalty 1.5. min_new_tokens=1: on an untemplated native
|
|
60
|
+
# generate prompt the model emits EOS as its first token (empty text).
|
|
61
|
+
default_sampling:
|
|
62
|
+
temperature: 0.7
|
|
63
|
+
top_p: 0.8
|
|
64
|
+
top_k: 20
|
|
65
|
+
presence_penalty: 1.5
|
|
66
|
+
min_new_tokens: 1
|
|
67
|
+
stop_tokens:
|
|
68
|
+
- "<|im_end|>"
|
|
69
|
+
# RTX PRO 6000 (96 GB, sm_120) shape; identical launch to ``default``.
|
|
70
|
+
rtx-pro-6000:
|
|
71
|
+
max_batch_tokens: 32768
|
|
72
|
+
compute_precision: bfloat16
|
|
73
|
+
adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
|
|
74
|
+
kv_budget_tokens: 65536
|
|
75
|
+
adapter_options:
|
|
76
|
+
loadtime:
|
|
77
|
+
mem_fraction_static: 0.85
|
|
78
|
+
served_model_name: Qwen/Qwen3-VL-8B-Instruct
|
|
79
|
+
grammar_backend: xgrammar
|
|
80
|
+
tool_call_parser: qwen25
|
|
81
|
+
speculative:
|
|
82
|
+
enabled: false
|
|
83
|
+
extra_launch_args:
|
|
84
|
+
- "--mm-process-config"
|
|
85
|
+
- '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
|
|
86
|
+
runtime:
|
|
87
|
+
first_chunk_timeout_s: 90
|
|
88
|
+
inter_chunk_timeout_s: 15
|
|
89
|
+
overall_timeout_s: 600
|
|
90
|
+
# Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
|
|
91
|
+
# presence_penalty 1.5. min_new_tokens=1: on an untemplated native
|
|
92
|
+
# generate prompt the model emits EOS as its first token (empty text).
|
|
93
|
+
default_sampling:
|
|
94
|
+
temperature: 0.7
|
|
95
|
+
top_p: 0.8
|
|
96
|
+
top_k: 20
|
|
97
|
+
presence_penalty: 1.5
|
|
98
|
+
min_new_tokens: 1
|
|
99
|
+
stop_tokens:
|
|
100
|
+
- "<|im_end|>"
|
|
101
|
+
# Grammar-safe fallback; identical launch to ``default``.
|
|
102
|
+
no-spec:
|
|
103
|
+
max_batch_tokens: 32768
|
|
104
|
+
compute_precision: bfloat16
|
|
105
|
+
adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
|
|
106
|
+
kv_budget_tokens: 65536
|
|
107
|
+
adapter_options:
|
|
108
|
+
loadtime:
|
|
109
|
+
mem_fraction_static: 0.85
|
|
110
|
+
served_model_name: Qwen/Qwen3-VL-8B-Instruct
|
|
111
|
+
grammar_backend: xgrammar
|
|
112
|
+
tool_call_parser: qwen25
|
|
113
|
+
speculative:
|
|
114
|
+
enabled: false
|
|
115
|
+
extra_launch_args:
|
|
116
|
+
- "--mm-process-config"
|
|
117
|
+
- '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
|
|
118
|
+
runtime:
|
|
119
|
+
first_chunk_timeout_s: 90
|
|
120
|
+
inter_chunk_timeout_s: 15
|
|
121
|
+
overall_timeout_s: 600
|
|
122
|
+
# Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
|
|
123
|
+
# presence_penalty 1.5. min_new_tokens=1: on an untemplated native
|
|
124
|
+
# generate prompt the model emits EOS as its first token (empty text).
|
|
125
|
+
default_sampling:
|
|
126
|
+
temperature: 0.7
|
|
127
|
+
top_p: 0.8
|
|
128
|
+
top_k: 20
|
|
129
|
+
presence_penalty: 1.5
|
|
130
|
+
min_new_tokens: 1
|
|
131
|
+
stop_tokens:
|
|
132
|
+
- "<|im_end|>"
|
|
@@ -337,7 +337,7 @@ profiles:
|
|
|
337
337
|
- '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
|
|
338
338
|
- "--quantization"
|
|
339
339
|
- "fp8"
|
|
340
|
-
- "--mamba-
|
|
340
|
+
- "--mamba-radix-cache-strategy"
|
|
341
341
|
- "extra_buffer"
|
|
342
342
|
- "--page-size"
|
|
343
343
|
- "64"
|
|
@@ -373,7 +373,7 @@ profiles:
|
|
|
373
373
|
- '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
|
|
374
374
|
- "--quantization"
|
|
375
375
|
- "fp8"
|
|
376
|
-
- "--mamba-
|
|
376
|
+
- "--mamba-radix-cache-strategy"
|
|
377
377
|
- "extra_buffer"
|
|
378
378
|
- "--page-size"
|
|
379
379
|
- "64"
|
|
@@ -410,7 +410,7 @@ profiles:
|
|
|
410
410
|
- '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
|
|
411
411
|
- "--quantization"
|
|
412
412
|
- "fp8"
|
|
413
|
-
- "--mamba-
|
|
413
|
+
- "--mamba-radix-cache-strategy"
|
|
414
414
|
- "extra_buffer"
|
|
415
415
|
- "--page-size"
|
|
416
416
|
- "64"
|
|
@@ -20,6 +20,7 @@ tasks:
|
|
|
20
20
|
# exact-hardware profiles whose admission and launch shapes are smoke-tested.
|
|
21
21
|
context_length: 8192
|
|
22
22
|
max_output_tokens: 4096
|
|
23
|
+
grammar_profile: no-spec
|
|
23
24
|
capabilities:
|
|
24
25
|
grammar: ["json_schema", "regex"]
|
|
25
26
|
streaming: true
|
|
@@ -80,6 +81,9 @@ profiles:
|
|
|
80
81
|
stop_tokens:
|
|
81
82
|
- "<|im_end|>"
|
|
82
83
|
|
|
84
|
+
no-spec:
|
|
85
|
+
extends: default
|
|
86
|
+
|
|
83
87
|
# H100-80GB: one native-window admission with in-checkpoint MTP. FA3 plus
|
|
84
88
|
# BF16 GDN state is the measured SM90 batch-one winner. Profile-scoped
|
|
85
89
|
# DeepGEMM fast warmup covers every decode M through 1024 and samples the
|
|
@@ -118,7 +122,7 @@ profiles:
|
|
|
118
122
|
- "bfloat16"
|
|
119
123
|
- "--mamba-ssm-dtype"
|
|
120
124
|
- "bfloat16"
|
|
121
|
-
- "--mamba-
|
|
125
|
+
- "--mamba-radix-cache-strategy"
|
|
122
126
|
- "extra_buffer"
|
|
123
127
|
- "--disable-overlap-schedule"
|
|
124
128
|
- "--page-size"
|
|
@@ -129,7 +133,7 @@ profiles:
|
|
|
129
133
|
- "32768"
|
|
130
134
|
- "--max-running-requests"
|
|
131
135
|
- "1"
|
|
132
|
-
- "--cuda-graph-max-bs"
|
|
136
|
+
- "--cuda-graph-max-bs-decode"
|
|
133
137
|
- "1"
|
|
134
138
|
runtime:
|
|
135
139
|
first_chunk_timeout_s: 900
|
|
@@ -163,7 +167,7 @@ profiles:
|
|
|
163
167
|
- "bfloat16"
|
|
164
168
|
- "--mamba-ssm-dtype"
|
|
165
169
|
- "bfloat16"
|
|
166
|
-
- "--mamba-
|
|
170
|
+
- "--mamba-radix-cache-strategy"
|
|
167
171
|
- "extra_buffer"
|
|
168
172
|
- "--disable-overlap-schedule"
|
|
169
173
|
- "--page-size"
|
|
@@ -174,7 +178,7 @@ profiles:
|
|
|
174
178
|
- "32768"
|
|
175
179
|
- "--max-running-requests"
|
|
176
180
|
- "1"
|
|
177
|
-
- "--cuda-graph-max-bs"
|
|
181
|
+
- "--cuda-graph-max-bs-decode"
|
|
178
182
|
- "1"
|
|
179
183
|
|
|
180
184
|
# H200-141GB: deliberately retain the measured H100 SM90 recipe and
|
|
@@ -210,7 +214,7 @@ profiles:
|
|
|
210
214
|
- "bfloat16"
|
|
211
215
|
- "--mamba-ssm-dtype"
|
|
212
216
|
- "bfloat16"
|
|
213
|
-
- "--mamba-
|
|
217
|
+
- "--mamba-radix-cache-strategy"
|
|
214
218
|
- "extra_buffer"
|
|
215
219
|
- "--disable-overlap-schedule"
|
|
216
220
|
- "--page-size"
|
|
@@ -221,7 +225,7 @@ profiles:
|
|
|
221
225
|
- "32768"
|
|
222
226
|
- "--max-running-requests"
|
|
223
227
|
- "1"
|
|
224
|
-
- "--cuda-graph-max-bs"
|
|
228
|
+
- "--cuda-graph-max-bs-decode"
|
|
225
229
|
- "1"
|
|
226
230
|
runtime:
|
|
227
231
|
first_chunk_timeout_s: 900
|
|
@@ -255,7 +259,7 @@ profiles:
|
|
|
255
259
|
- "bfloat16"
|
|
256
260
|
- "--mamba-ssm-dtype"
|
|
257
261
|
- "bfloat16"
|
|
258
|
-
- "--mamba-
|
|
262
|
+
- "--mamba-radix-cache-strategy"
|
|
259
263
|
- "extra_buffer"
|
|
260
264
|
- "--disable-overlap-schedule"
|
|
261
265
|
- "--page-size"
|
|
@@ -266,7 +270,7 @@ profiles:
|
|
|
266
270
|
- "32768"
|
|
267
271
|
- "--max-running-requests"
|
|
268
272
|
- "1"
|
|
269
|
-
- "--cuda-graph-max-bs"
|
|
273
|
+
- "--cuda-graph-max-bs-decode"
|
|
270
274
|
- "1"
|
|
271
275
|
|
|
272
276
|
# RTX PRO 6000 96GB (SM120): retain FlashInfer and 2K prefill chunks from the
|
|
@@ -304,7 +308,7 @@ profiles:
|
|
|
304
308
|
- "bfloat16"
|
|
305
309
|
- "--mamba-ssm-dtype"
|
|
306
310
|
- "bfloat16"
|
|
307
|
-
- "--mamba-
|
|
311
|
+
- "--mamba-radix-cache-strategy"
|
|
308
312
|
- "extra_buffer"
|
|
309
313
|
- "--disable-overlap-schedule"
|
|
310
314
|
- "--page-size"
|
|
@@ -313,7 +317,7 @@ profiles:
|
|
|
313
317
|
- "2048"
|
|
314
318
|
- "--max-running-requests"
|
|
315
319
|
- "1"
|
|
316
|
-
- "--cuda-graph-max-bs"
|
|
320
|
+
- "--cuda-graph-max-bs-decode"
|
|
317
321
|
- "1"
|
|
318
322
|
runtime:
|
|
319
323
|
first_chunk_timeout_s: 900
|
|
@@ -347,7 +351,7 @@ profiles:
|
|
|
347
351
|
- "bfloat16"
|
|
348
352
|
- "--mamba-ssm-dtype"
|
|
349
353
|
- "bfloat16"
|
|
350
|
-
- "--mamba-
|
|
354
|
+
- "--mamba-radix-cache-strategy"
|
|
351
355
|
- "extra_buffer"
|
|
352
356
|
- "--disable-overlap-schedule"
|
|
353
357
|
- "--page-size"
|
|
@@ -356,5 +360,5 @@ profiles:
|
|
|
356
360
|
- "2048"
|
|
357
361
|
- "--max-running-requests"
|
|
358
362
|
- "1"
|
|
359
|
-
- "--cuda-graph-max-bs"
|
|
363
|
+
- "--cuda-graph-max-bs-decode"
|
|
360
364
|
- "1"
|