sie-server 0.7.2__tar.gz → 0.8.0__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (648) hide show
  1. {sie_server-0.7.2 → sie_server-0.8.0}/.gitignore +2 -0
  2. {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cpu +4 -2
  3. {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cuda12 +20 -6
  4. {sie_server-0.7.2 → sie_server-0.8.0}/Dockerfile.cuda13 +25 -19
  5. {sie_server-0.7.2 → sie_server-0.8.0}/PKG-INFO +1 -1
  6. {sie_server-0.7.2 → sie_server-0.8.0}/README.md +9 -0
  7. sie_server-0.8.0/bundles/ctranslate2.yaml +6 -0
  8. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-cu130.yaml +40 -23
  9. sie_server-0.8.0/bundles/tensorrt-llm.yaml +39 -0
  10. sie_server-0.8.0/models/Qwen__Qwen3-VL-8B-Instruct.yaml +132 -0
  11. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.6-27B.yaml +3 -3
  12. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.8-27B-FP8.yaml +16 -12
  13. sie_server-0.8.0/models/google__madlad400-3b-mt.yaml +44 -0
  14. sie_server-0.8.0/models/google__translategemma-4b-it.yaml +40 -0
  15. sie_server-0.8.0/models/zai-org__GLM-5.3-Flash.yaml +75 -0
  16. {sie_server-0.7.2 → sie_server-0.8.0}/openapi.json +123 -1
  17. {sie_server-0.7.2 → sie_server-0.8.0}/pyproject.toml +1 -1
  18. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_generation_base.py +450 -39
  19. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_utils.py +5 -1
  20. sie_server-0.8.0/src/sie_server/adapters/ctranslate2/generation.py +747 -0
  21. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/fake/adapter.py +3 -1
  22. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/grounding_dino/adapter.py +48 -5
  23. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mlx/generation.py +5 -1
  24. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/_compat/sitecustomize.py +23 -0
  25. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/_server.py +218 -20
  26. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/cuda13.py +8 -1
  27. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/embedding.py +103 -15
  28. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/gemma.py +10 -3
  29. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang/generation.py +607 -287
  30. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang_vision_extract/_compat/sitecustomize.py +24 -0
  31. sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_compat/sitecustomize.py +13 -0
  32. sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_server.py +221 -0
  33. sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/compat.py +188 -0
  34. sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/generation.py +889 -0
  35. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/encode.py +2 -1
  36. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/extract.py +1 -0
  37. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/generate.py +228 -66
  38. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/helpers.py +56 -2
  39. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/models.py +2 -0
  40. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_compat.py +1 -1
  41. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_completions.py +125 -34
  42. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_local.py +122 -9
  43. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_responses.py +32 -12
  44. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/score.py +2 -1
  45. sie_server-0.8.0/src/sie_server/config/device_groups.py +83 -0
  46. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/model.py +181 -3
  47. sie_server-0.8.0/src/sie_server/config/serving_artifacts.py +574 -0
  48. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/load_errors.py +21 -3
  49. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/loader.py +170 -17
  50. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/model_loader.py +78 -8
  51. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/registry.py +740 -136
  52. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/video_frames.py +70 -0
  53. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/ipc_server.py +67 -24
  54. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/grammar_compile.py +16 -8
  55. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/streaming.py +541 -199
  56. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/tool_call_grammar.py +19 -0
  57. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/tool_call_parser.py +86 -5
  58. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/grammar.py +6 -0
  59. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/openapi.py +51 -0
  60. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_adapter_revision_contract.py +18 -6
  61. sie_server-0.8.0/tests/adapters/test_ctranslate2_generation.py +511 -0
  62. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_docling_smoke.py +1 -1
  63. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_generation_base.py +195 -5
  64. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_grounding_dino.py +39 -1
  65. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_mlx_generation.py +9 -1
  66. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang.py +244 -13
  67. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang_generation.py +1671 -52
  68. sie_server-0.8.0/tests/adapters/test_sglang_launch_flags.py +200 -0
  69. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sglang_vision_extract.py +132 -0
  70. sie_server-0.8.0/tests/adapters/test_tensorrt_llm_compat.py +504 -0
  71. sie_server-0.8.0/tests/adapters/test_tensorrt_llm_generation.py +1847 -0
  72. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_error_code_hygiene.py +24 -0
  73. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract_oom.py +5 -3
  74. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_generate.py +389 -4
  75. sie_server-0.8.0/tests/api/test_generate_stream.py +668 -0
  76. sie_server-0.8.0/tests/api/test_generation_cleanup_precedence.py +223 -0
  77. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_models.py +3 -0
  78. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_compat.py +3 -2
  79. sie_server-0.8.0/tests/api/test_openai_completions.py +722 -0
  80. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_local.py +258 -2
  81. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_responses.py +182 -11
  82. sie_server-0.8.0/tests/api/test_request_body_limit.py +115 -0
  83. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_bundle_coverage.py +6 -0
  84. sie_server-0.8.0/tests/config/test_catalog_loadtime_options.py +95 -0
  85. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_qwen38_generation_profiles.py +7 -2
  86. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_qwen_generation_profiles.py +2 -2
  87. sie_server-0.8.0/tests/config/test_serving_artifact_config.py +166 -0
  88. sie_server-0.8.0/tests/config/test_serving_artifacts.py +355 -0
  89. sie_server-0.8.0/tests/config/test_tensor_parallel_options.py +159 -0
  90. sie_server-0.8.0/tests/config/test_video_generation_profiles.py +130 -0
  91. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_loader.py +111 -0
  92. sie_server-0.8.0/tests/core/test_model_loader_cache.py +275 -0
  93. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_async.py +119 -0
  94. sie_server-0.8.0/tests/core/test_registry_device_groups.py +642 -0
  95. sie_server-0.8.0/tests/core/test_registry_generation_drain.py +302 -0
  96. sie_server-0.8.0/tests/core/test_registry_lifecycle_loop.py +180 -0
  97. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_memory.py +86 -0
  98. sie_server-0.8.0/tests/observability/__init__.py +0 -0
  99. sie_server-0.8.0/tests/processors/__init__.py +0 -0
  100. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_compile.py +64 -1
  101. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming.py +1389 -33
  102. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_tool_call_grammar.py +55 -0
  103. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_tool_call_parser.py +171 -0
  104. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_ipc_server.py +272 -7
  105. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_model_yaml_filenames.py +34 -0
  106. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_openapi_export.py +52 -0
  107. sie_server-0.8.0/tests/type_defs/__init__.py +0 -0
  108. sie_server-0.7.2/tests/api/test_generate_stream.py +0 -229
  109. sie_server-0.7.2/tests/api/test_openai_completions.py +0 -362
  110. sie_server-0.7.2/tests/core/test_model_loader_cache.py +0 -72
  111. {sie_server-0.7.2 → sie_server-0.8.0}/CONTRIBUTING.md +0 -0
  112. {sie_server-0.7.2 → sie_server-0.8.0}/LICENSE +0 -0
  113. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/candle.yaml +0 -0
  114. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/default.yaml +0 -0
  115. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/fake.yaml +0 -0
  116. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-embedding.yaml +0 -0
  117. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang-vision-extract.yaml +0 -0
  118. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/sglang.yaml +0 -0
  119. {sie_server-0.7.2 → sie_server-0.8.0}/bundles/transformers5.yaml +0 -0
  120. {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-Qwen2-1.5B-instruct.yaml +0 -0
  121. {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-Qwen2-7B-instruct.yaml +0 -0
  122. {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-modernbert-base.yaml +0 -0
  123. {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-multilingual-base.yaml +0 -0
  124. {sie_server-0.7.2 → sie_server-0.8.0}/models/Alibaba-NLP__gte-reranker-modernbert-base.yaml +0 -0
  125. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-base-en-v1.5.yaml +0 -0
  126. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-large-en-v1.5.yaml +0 -0
  127. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-m3.yaml +0 -0
  128. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-base.yaml +0 -0
  129. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-large.yaml +0 -0
  130. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-reranker-v2-m3.yaml +0 -0
  131. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-small-en-v1.5.yaml +0 -0
  132. {sie_server-0.7.2 → sie_server-0.8.0}/models/BAAI__bge-small-zh-v1.5.yaml +0 -0
  133. {sie_server-0.7.2 → sie_server-0.8.0}/models/EmergentMethods__gliner_large_news-v2.1.yaml +0 -0
  134. {sie_server-0.7.2 → sie_server-0.8.0}/models/GritLM__GritLM-7B.yaml +0 -0
  135. {sie_server-0.7.2 → sie_server-0.8.0}/models/IDEA-Research__grounding-dino-base.yaml +0 -0
  136. {sie_server-0.7.2 → sie_server-0.8.0}/models/IDEA-Research__grounding-dino-tiny.yaml +0 -0
  137. {sie_server-0.7.2 → sie_server-0.8.0}/models/Ihor__gliner-biomed-large-v1.0.yaml +0 -0
  138. {sie_server-0.7.2 → sie_server-0.8.0}/models/Linq-AI-Research__Linq-Embed-Mistral.yaml +0 -0
  139. {sie_server-0.7.2 → sie_server-0.8.0}/models/Marqo__marqo-ecommerce-embeddings-B.yaml +0 -0
  140. {sie_server-0.7.2 → sie_server-0.8.0}/models/Marqo__marqo-fashionSigLIP.yaml +0 -0
  141. {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__ModernBERT-base-zeroshot-v2.0.yaml +0 -0
  142. {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__deberta-v3-base-zeroshot-v2.0.yaml +0 -0
  143. {sie_server-0.7.2 → sie_server-0.8.0}/models/MoritzLaurer__deberta-v3-large-zeroshot-v2.0.yaml +0 -0
  144. {sie_server-0.7.2 → sie_server-0.8.0}/models/NeuML__gliner-bert-tiny.yaml +0 -0
  145. {sie_server-0.7.2 → sie_server-0.8.0}/models/NovaSearch__stella_en_1.5B_v5.yaml +0 -0
  146. {sie_server-0.7.2 → sie_server-0.8.0}/models/NovaSearch__stella_en_400M_v5.yaml +0 -0
  147. {sie_server-0.7.2 → sie_server-0.8.0}/models/PaddlePaddle__PaddleOCR-VL-1.5.yaml +0 -0
  148. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-0.6B.yaml +0 -0
  149. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-4B-Instruct-2507.yaml +0 -0
  150. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-0.6B.yaml +0 -0
  151. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-4B.yaml +0 -0
  152. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Embedding-8B.yaml +0 -0
  153. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Reranker-0.6B.yaml +0 -0
  154. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-Reranker-4B.yaml +0 -0
  155. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-VL-Embedding-2B.yaml +0 -0
  156. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3-VL-Reranker-2B.yaml +0 -0
  157. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.5-4B.yaml +0 -0
  158. {sie_server-0.7.2 → sie_server-0.8.0}/models/Qwen__Qwen3.6-35B-A3B.yaml +0 -0
  159. {sie_server-0.7.2 → sie_server-0.8.0}/models/Salesforce__SFR-Embedding-2_R.yaml +0 -0
  160. {sie_server-0.7.2 → sie_server-0.8.0}/models/Salesforce__SFR-Embedding-Mistral.yaml +0 -0
  161. {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-l-v2.0.yaml +0 -0
  162. {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-m-v2.0.yaml +0 -0
  163. {sie_server-0.7.2 → sie_server-0.8.0}/models/Snowflake__snowflake-arctic-embed-s.yaml +0 -0
  164. {sie_server-0.7.2 → sie_server-0.8.0}/models/TomoroAI__tomoro-colqwen3-embed-4b.yaml +0 -0
  165. {sie_server-0.7.2 → sie_server-0.8.0}/models/WhereIsAI__UAE-Large-V1.yaml +0 -0
  166. {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__ModernBERT-base.yaml +0 -0
  167. {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__ModernBERT-large.yaml +0 -0
  168. {sie_server-0.7.2 → sie_server-0.8.0}/models/answerdotai__answerai-colbert-small-v1.yaml +0 -0
  169. {sie_server-0.7.2 → sie_server-0.8.0}/models/colbert-ir__colbertv2.0.yaml +0 -0
  170. {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__ms-marco-MiniLM-L-12-v2.yaml +0 -0
  171. {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__ms-marco-MiniLM-L-6-v2.yaml +0 -0
  172. {sie_server-0.7.2 → sie_server-0.8.0}/models/cross-encoder__nli-deberta-v3-base.yaml +0 -0
  173. {sie_server-0.7.2 → sie_server-0.8.0}/models/defog__sqlcoder-7b-2.yaml +0 -0
  174. {sie_server-0.7.2 → sie_server-0.8.0}/models/docling.yaml +0 -0
  175. {sie_server-0.7.2 → sie_server-0.8.0}/models/facebook__bart-large-mnli.yaml +0 -0
  176. {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliguard-LLMGuardrails-300M.yaml +0 -0
  177. {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliner2-base-v1.yaml +0 -0
  178. {sie_server-0.7.2 → sie_server-0.8.0}/models/fastino__gliner2-large-v1.yaml +0 -0
  179. {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_large-v2.5.yaml +0 -0
  180. {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_medium-v2.5.yaml +0 -0
  181. {sie_server-0.7.2 → sie_server-0.8.0}/models/gliner-community__gliner_small-v2.5.yaml +0 -0
  182. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__embeddinggemma-300m.yaml +0 -0
  183. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-26B-A4B-it.yaml +0 -0
  184. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-31B-it.yaml +0 -0
  185. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-E2B-it.yaml +0 -0
  186. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__gemma-4-E4B-it.yaml +0 -0
  187. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__owlv2-base-patch16-ensemble.yaml +0 -0
  188. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__owlv2-large-patch14-ensemble.yaml +0 -0
  189. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-base-patch16-256.yaml +0 -0
  190. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-so400m-patch14-224.yaml +0 -0
  191. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip-so400m-patch14-384.yaml +0 -0
  192. {sie_server-0.7.2 → sie_server-0.8.0}/models/google__siglip2-base-patch16-224.yaml +0 -0
  193. {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-30m-sparse.yaml +0 -0
  194. {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-97m-multilingual-r2.yaml +0 -0
  195. {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-english-r2.yaml +0 -0
  196. {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-embedding-small-english-r2.yaml +0 -0
  197. {sie_server-0.7.2 → sie_server-0.8.0}/models/ibm-granite__granite-guardian-3.0-2b.yaml +0 -0
  198. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-base-v2.yaml +0 -0
  199. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-large-v2.yaml +0 -0
  200. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-mistral-7b-instruct.yaml +0 -0
  201. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__e5-small-v2.yaml +0 -0
  202. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-large-instruct.yaml +0 -0
  203. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-large.yaml +0 -0
  204. {sie_server-0.7.2 → sie_server-0.8.0}/models/intfloat__multilingual-e5-small.yaml +0 -0
  205. {sie_server-0.7.2 → sie_server-0.8.0}/models/jackboyla__glirel-large-v0.yaml +0 -0
  206. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-colbert-v2.yaml +0 -0
  207. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-code.yaml +0 -0
  208. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-de.yaml +0 -0
  209. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-en.yaml +0 -0
  210. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-es.yaml +0 -0
  211. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-base-zh.yaml +0 -0
  212. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-embeddings-v2-small-en.yaml +0 -0
  213. {sie_server-0.7.2 → sie_server-0.8.0}/models/jinaai__jina-reranker-v2-base-multilingual.yaml +0 -0
  214. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-base-v1.0.yaml +0 -0
  215. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-large-v1.0.yaml +0 -0
  216. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-large-v3.0.yaml +0 -0
  217. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliclass-small-v1.0.yaml +0 -0
  218. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__gliner-bi-base-v2.0.yaml +0 -0
  219. {sie_server-0.7.2 → sie_server-0.8.0}/models/knowledgator__modern-gliner-bi-base-v1.0.yaml +0 -0
  220. {sie_server-0.7.2 → sie_server-0.8.0}/models/laion__CLIP-ViT-B-32-laion2B-s34B-b79K.yaml +0 -0
  221. {sie_server-0.7.2 → sie_server-0.8.0}/models/laion__CLIP-ViT-H-14-laion2B-s32B-b79K.yaml +0 -0
  222. {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__GTE-ModernColBERT-v1.yaml +0 -0
  223. {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__LightOnOCR-2-1B.yaml +0 -0
  224. {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__Reason-ModernColBERT.yaml +0 -0
  225. {sie_server-0.7.2 → sie_server-0.8.0}/models/lightonai__mLateOn.yaml +0 -0
  226. {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-base-ft.yaml +0 -0
  227. {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-base.yaml +0 -0
  228. {sie_server-0.7.2 → sie_server-0.8.0}/models/microsoft__Florence-2-large.yaml +0 -0
  229. {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-colbert-large-v1.yaml +0 -0
  230. {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-edge-colbert-v0-32m.yaml +0 -0
  231. {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-embed-large-v1.yaml +0 -0
  232. {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-rerank-base-v2.yaml +0 -0
  233. {sie_server-0.7.2 → sie_server-0.8.0}/models/mixedbread-ai__mxbai-rerank-large-v2.yaml +0 -0
  234. {sie_server-0.7.2 → sie_server-0.8.0}/models/mynkchaudhry__Florence-2-FT-DocVQA.yaml +0 -0
  235. {sie_server-0.7.2 → sie_server-0.8.0}/models/naver-clova-ix__donut-base-finetuned-cord-v2.yaml +0 -0
  236. {sie_server-0.7.2 → sie_server-0.8.0}/models/naver-clova-ix__donut-base-finetuned-docvqa.yaml +0 -0
  237. {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__splade-cocondenser-selfdistil.yaml +0 -0
  238. {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__splade-v3.yaml +0 -0
  239. {sie_server-0.7.2 → sie_server-0.8.0}/models/naver__v-splade-quality.yaml +0 -0
  240. {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__modernbert-embed-base.yaml +0 -0
  241. {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__nomic-embed-text-v1.5.yaml +0 -0
  242. {sie_server-0.7.2 → sie_server-0.8.0}/models/nomic-ai__nomic-embed-text-v2-moe.yaml +0 -0
  243. {sie_server-0.7.2 → sie_server-0.8.0}/models/numind__NuNER_Zero-span.yaml +0 -0
  244. {sie_server-0.7.2 → sie_server-0.8.0}/models/numind__NuNER_Zero.yaml +0 -0
  245. {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__NV-Embed-v2.yaml +0 -0
  246. {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__llama-embed-nemotron-8b.yaml +0 -0
  247. {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__llama-nemoretriever-colembed-3b-v1.yaml +0 -0
  248. {sie_server-0.7.2 → sie_server-0.8.0}/models/nvidia__nemotron-colembed-vl-4b-v2.yaml +0 -0
  249. {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__clip-vit-base-patch32.yaml +0 -0
  250. {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__clip-vit-large-patch14.yaml +0 -0
  251. {sie_server-0.7.2 → sie_server-0.8.0}/models/openai__whisper-large-v3-turbo.yaml +0 -0
  252. {sie_server-0.7.2 → sie_server-0.8.0}/models/opendatalab__MinerU2.5-Pro-2604-1.2B.yaml +0 -0
  253. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-distill.yaml +0 -0
  254. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-mini.yaml +0 -0
  255. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-distill.yaml +0 -0
  256. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-gte.yaml +0 -0
  257. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-v1.yaml +0 -0
  258. {sie_server-0.7.2 → sie_server-0.8.0}/models/opensearch-project__opensearch-neural-sparse-encoding-v2-distill.yaml +0 -0
  259. {sie_server-0.7.2 → sie_server-0.8.0}/models/prithivida__Splade_PP_en_v2.yaml +0 -0
  260. {sie_server-0.7.2 → sie_server-0.8.0}/models/rasyosef__splade-mini.yaml +0 -0
  261. {sie_server-0.7.2 → sie_server-0.8.0}/models/sentence-transformers__all-MiniLM-L6-v2.yaml +0 -0
  262. {sie_server-0.7.2 → sie_server-0.8.0}/models/sie-fake.yaml +0 -0
  263. {sie_server-0.7.2 → sie_server-0.8.0}/models/sugiv__stablebridge-pruner-highlighter.yaml +0 -0
  264. {sie_server-0.7.2 → sie_server-0.8.0}/models/tencent__R3-embedding-0.6b.yaml +0 -0
  265. {sie_server-0.7.2 → sie_server-0.8.0}/models/tencent__R3-rerank-0.6b.yaml +0 -0
  266. {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-base.yaml +0 -0
  267. {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-large.yaml +0 -0
  268. {sie_server-0.7.2 → sie_server-0.8.0}/models/thenlper__gte-small.yaml +0 -0
  269. {sie_server-0.7.2 → sie_server-0.8.0}/models/topk-io__Iso-ModernColBERT.yaml +0 -0
  270. {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_large-v2.1.yaml +0 -0
  271. {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_medium-v2.1.yaml +0 -0
  272. {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_multi-v2.1.yaml +0 -0
  273. {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_multi_pii-v1.yaml +0 -0
  274. {sie_server-0.7.2 → sie_server-0.8.0}/models/urchade__gliner_small-v2.1.yaml +0 -0
  275. {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colSmol-256M.yaml +0 -0
  276. {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colpali-v1.3-hf.yaml +0 -0
  277. {sie_server-0.7.2 → sie_server-0.8.0}/models/vidore__colqwen2.5-v0.2.yaml +0 -0
  278. {sie_server-0.7.2 → sie_server-0.8.0}/models/zai-org__GLM-OCR.yaml +0 -0
  279. {sie_server-0.7.2 → sie_server-0.8.0}/scripts/generate_tokenize_fixture.py +0 -0
  280. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/__init__.py +0 -0
  281. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/_ipc_test_harness.py +0 -0
  282. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapter_call_loop.py +0 -0
  283. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/__init__.py +0 -0
  284. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_base_adapter.py +0 -0
  285. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_colbert_projection.py +0 -0
  286. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_colbert_utils.py +0 -0
  287. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_flash_base.py +0 -0
  288. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_flash_pack.py +0 -0
  289. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_multivector.py +0 -0
  290. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_pylate_dense.py +0 -0
  291. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_spec.py +0 -0
  292. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_types.py +0 -0
  293. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/_vision_patch_embed.py +0 -0
  294. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/base.py +0 -0
  295. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bert_flash/__init__.py +0 -0
  296. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bert_flash_cross_encoder/__init__.py +0 -0
  297. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3/__init__.py +0 -0
  298. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_flag/__init__.py +0 -0
  299. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_flash/__init__.py +0 -0
  300. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/bge_m3_score_mixin.py +0 -0
  301. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/clip/__init__.py +0 -0
  302. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert/__init__.py +0 -0
  303. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_modernbert_flash/__init__.py +0 -0
  304. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_modernbert_flash/adapter.py +0 -0
  305. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colbert_rotary_flash/__init__.py +0 -0
  306. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colpali/__init__.py +0 -0
  307. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colqwen2/__init__.py +0 -0
  308. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colqwen3/__init__.py +0 -0
  309. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/colsmol/__init__.py +0 -0
  310. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/cross_encoder/__init__.py +0 -0
  311. {sie_server-0.7.2/src/sie_server/adapters/docling → sie_server-0.8.0/src/sie_server/adapters/ctranslate2}/__init__.py +0 -0
  312. {sie_server-0.7.2/src/sie_server/adapters/fake → sie_server-0.8.0/src/sie_server/adapters/docling}/__init__.py +0 -0
  313. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/docling/adapter.py +0 -0
  314. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/donut/__init__.py +0 -0
  315. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/errors.py +0 -0
  316. {sie_server-0.7.2/src/sie_server/adapters/gliner2 → sie_server-0.8.0/src/sie_server/adapters/fake}/__init__.py +0 -0
  317. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/florence2/__init__.py +0 -0
  318. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliclass/__init__.py +0 -0
  319. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner/__init__.py +0 -0
  320. {sie_server-0.7.2/src/sie_server/adapters/grounding_dino → sie_server-0.8.0/src/sie_server/adapters/gliner2}/__init__.py +0 -0
  321. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner2/adapter.py +0 -0
  322. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner2/classification.py +0 -0
  323. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gliner_bi/__init__.py +0 -0
  324. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/glirel/__init__.py +0 -0
  325. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/glm_ocr/__init__.py +0 -0
  326. {sie_server-0.7.2/src/sie_server/adapters/lighton_ocr → sie_server-0.8.0/src/sie_server/adapters/grounding_dino}/__init__.py +0 -0
  327. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/gte_sparse_flash/__init__.py +0 -0
  328. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/jina_flash_cross_encoder/__init__.py +0 -0
  329. {sie_server-0.7.2/src/sie_server/adapters/mlx → sie_server-0.8.0/src/sie_server/adapters/lighton_ocr}/__init__.py +0 -0
  330. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/lighton_ocr/adapter.py +0 -0
  331. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/lora.py +0 -0
  332. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mineru_vl/__init__.py +0 -0
  333. {sie_server-0.7.2/src/sie_server/adapters/owlv2 → sie_server-0.8.0/src/sie_server/adapters/mlx}/__init__.py +0 -0
  334. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/mlx/_server.py +0 -0
  335. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/modernbert_flash/__init__.py +0 -0
  336. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/modernbert_flash_cross_encoder/__init__.py +0 -0
  337. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nemo_colembed/__init__.py +0 -0
  338. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nli_classification/__init__.py +0 -0
  339. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nli_classification_flash/__init__.py +0 -0
  340. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/nomic_flash/__init__.py +0 -0
  341. {sie_server-0.7.2/src/sie_server/adapters/qwen2_flash_cross_encoder → sie_server-0.8.0/src/sie_server/adapters/owlv2}/__init__.py +0 -0
  342. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/owlv2/adapter.py +0 -0
  343. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/paddleocr_vl/__init__.py +0 -0
  344. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/peft_lora_mixin.py +0 -0
  345. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/pytorch_embedding/__init__.py +0 -0
  346. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen2_flash/__init__.py +0 -0
  347. {sie_server-0.7.2/src/sie_server/adapters/qwen3_vl_reranker → sie_server-0.8.0/src/sie_server/adapters/qwen2_flash_cross_encoder}/__init__.py +0 -0
  348. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen2_flash_cross_encoder/adapter.py +0 -0
  349. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen3_vl_embedding/__init__.py +0 -0
  350. {sie_server-0.7.2/src/sie_server/adapters/sglang → sie_server-0.8.0/src/sie_server/adapters/qwen3_vl_reranker}/__init__.py +0 -0
  351. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/qwen3_vl_reranker/adapter.py +0 -0
  352. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/rope_flash/__init__.py +0 -0
  353. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sentence_transformer/__init__.py +0 -0
  354. {sie_server-0.7.2/src/sie_server/adapters/sglang/_compat → sie_server-0.8.0/src/sie_server/adapters/sglang}/__init__.py +0 -0
  355. {sie_server-0.7.2/src/sie_server/adapters/sglang_vision_extract → sie_server-0.8.0/src/sie_server/adapters/sglang/_compat}/__init__.py +0 -0
  356. {sie_server-0.7.2/src/sie_server/adapters/sglang_vision_extract/_compat → sie_server-0.8.0/src/sie_server/adapters/sglang_vision_extract}/__init__.py +0 -0
  357. {sie_server-0.7.2/src/sie_server/adapters/siglip → sie_server-0.8.0/src/sie_server/adapters/sglang_vision_extract/_compat}/__init__.py +0 -0
  358. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/sglang_vision_extract/adapter.py +0 -0
  359. {sie_server-0.7.2/src/sie_server/adapters/splade_flash → sie_server-0.8.0/src/sie_server/adapters/siglip}/__init__.py +0 -0
  360. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/siglip/adapter.py +0 -0
  361. {sie_server-0.7.2/src/sie_server/adapters/st_sparse_vision → sie_server-0.8.0/src/sie_server/adapters/splade_flash}/__init__.py +0 -0
  362. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/splade_flash/adapter.py +0 -0
  363. {sie_server-0.7.2/src/sie_server/adapters/whisper → sie_server-0.8.0/src/sie_server/adapters/st_sparse_vision}/__init__.py +0 -0
  364. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/st_sparse_vision/adapter.py +0 -0
  365. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/stablebridge_pruner/__init__.py +0 -0
  366. {sie_server-0.7.2/src/sie_server/app → sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm}/__init__.py +0 -0
  367. {sie_server-0.7.2/src/sie_server/config → sie_server-0.8.0/src/sie_server/adapters/tensorrt_llm/_compat}/__init__.py +0 -0
  368. {sie_server-0.7.2/src/sie_server/health → sie_server-0.8.0/src/sie_server/adapters/whisper}/__init__.py +0 -0
  369. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/whisper/adapter.py +0 -0
  370. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/adapters/xlm_roberta_flash/__init__.py +0 -0
  371. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/__init__.py +0 -0
  372. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/health.py +0 -0
  373. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openai_audio.py +0 -0
  374. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/openapi.py +0 -0
  375. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/options.py +0 -0
  376. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/root.py +0 -0
  377. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/serialization.py +0 -0
  378. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/validation.py +0 -0
  379. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/api/ws.py +0 -0
  380. {sie_server-0.7.2/src/sie_server/observability → sie_server-0.8.0/src/sie_server/app}/__init__.py +0 -0
  381. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/app/app_factory.py +0 -0
  382. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/app/app_state_config.py +0 -0
  383. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/bundle_requirements.py +0 -0
  384. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/cli.py +0 -0
  385. {sie_server-0.7.2/src/sie_server/processors → sie_server-0.8.0/src/sie_server/config}/__init__.py +0 -0
  386. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/engine.py +0 -0
  387. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/config/package_artifacts.py +0 -0
  388. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/__init__.py +0 -0
  389. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/adaptive_batching.py +0 -0
  390. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/batcher.py +0 -0
  391. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/deps.py +0 -0
  392. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/disk_cache.py +0 -0
  393. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/encode_pipeline.py +0 -0
  394. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/extract_cost.py +0 -0
  395. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/gpu_health.py +0 -0
  396. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/hf_env.py +0 -0
  397. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/hot_reload.py +0 -0
  398. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/inference.py +0 -0
  399. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/inference_output.py +0 -0
  400. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/logging.py +0 -0
  401. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/memory.py +0 -0
  402. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/model_suggestions.py +0 -0
  403. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/oom.py +0 -0
  404. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/pool_isolation.py +0 -0
  405. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/postprocessor.py +0 -0
  406. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/postprocessor_registry.py +0 -0
  407. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/prepared.py +0 -0
  408. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/__init__.py +0 -0
  409. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/audio.py +0 -0
  410. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/base.py +0 -0
  411. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/image.py +0 -0
  412. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/text.py +0 -0
  413. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor/vision.py +0 -0
  414. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/preprocessor_registry.py +0 -0
  415. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/readiness.py +0 -0
  416. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/residency.py +0 -0
  417. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/runtime_options.py +0 -0
  418. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/score_cost.py +0 -0
  419. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/shutdown.py +0 -0
  420. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/text_tokens.py +0 -0
  421. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/timing.py +0 -0
  422. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/tokenizer.py +0 -0
  423. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/watcher.py +0 -0
  424. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/__init__.py +0 -0
  425. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/__init__.py +0 -0
  426. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/base.py +0 -0
  427. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/encode.py +0 -0
  428. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/extract.py +0 -0
  429. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/handlers/score.py +0 -0
  430. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/model_worker.py +0 -0
  431. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/oom_recovery.py +0 -0
  432. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/core/worker/types.py +0 -0
  433. {sie_server-0.7.2/tests/adapters → sie_server-0.8.0/src/sie_server/health}/__init__.py +0 -0
  434. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/health/saturation.py +0 -0
  435. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/ipc_types.py +0 -0
  436. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/local_ingest_client.py +0 -0
  437. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/main.py +0 -0
  438. {sie_server-0.7.2/tests/api → sie_server-0.8.0/src/sie_server/observability}/__init__.py +0 -0
  439. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/generation_diagnostics.py +0 -0
  440. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/gpu.py +0 -0
  441. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/telemetry.py +0 -0
  442. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/tracing.py +0 -0
  443. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/observability/worker_telemetry.py +0 -0
  444. {sie_server-0.7.2/tests/app → sie_server-0.8.0/src/sie_server/processors}/__init__.py +0 -0
  445. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/admission.py +0 -0
  446. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/base.py +0 -0
  447. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/grammar_cache.py +0 -0
  448. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/processors/work_class_scheduler.py +0 -0
  449. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/queue_executor.py +0 -0
  450. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/__init__.py +0 -0
  451. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/inputs.py +0 -0
  452. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/outputs.py +0 -0
  453. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/overflow_policy.py +0 -0
  454. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/requests.py +0 -0
  455. {sie_server-0.7.2 → sie_server-0.8.0}/src/sie_server/types/responses.py +0 -0
  456. {sie_server-0.7.2/tests/config → sie_server-0.8.0/tests/adapters}/__init__.py +0 -0
  457. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_base.py +0 -0
  458. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_bge_m3.py +0 -0
  459. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_bge_m3_flash.py +0 -0
  460. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_clip.py +0 -0
  461. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert.py +0 -0
  462. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_modernbert_flash_projection.py +0 -0
  463. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_modernbert_flash_tokenizer.py +0 -0
  464. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_projection.py +0 -0
  465. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colbert_punctuation.py +0 -0
  466. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_colqwen2_revision.py +0 -0
  467. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_docling.py +0 -0
  468. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_donut.py +0 -0
  469. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_factory_integration.py +0 -0
  470. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake.py +0 -0
  471. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake_catalog.py +0 -0
  472. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_fake_faults.py +0 -0
  473. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_flash_base.py +0 -0
  474. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_flash_pack.py +0 -0
  475. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_florence2.py +0 -0
  476. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliclass_contracts.py +0 -0
  477. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliclass_overflow_policy.py +0 -0
  478. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner2.py +0 -0
  479. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner_merge.py +0 -0
  480. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gliner_metering.py +0 -0
  481. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_glirel.py +0 -0
  482. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_glm_ocr.py +0 -0
  483. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_gte_sparse.py +0 -0
  484. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_image_decode_errors.py +0 -0
  485. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_jina_flash_cross_encoder.py +0 -0
  486. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lighton_ocr.py +0 -0
  487. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lora.py +0 -0
  488. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_lora_integration.py +0 -0
  489. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_mineru_vl.py +0 -0
  490. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_multivector.py +0 -0
  491. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_owlv2.py +0 -0
  492. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_paddleocr_vl.py +0 -0
  493. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pylate_dense.py +0 -0
  494. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pytorch_embedding_model_encode.py +0 -0
  495. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_pytorch_embedding_revision.py +0 -0
  496. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen2_flash_cross_encoder.py +0 -0
  497. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen3_vl_embedding.py +0 -0
  498. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_qwen3_vl_reranker.py +0 -0
  499. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_runtime_options.py +0 -0
  500. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sentence_transformer.py +0 -0
  501. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_siglip.py +0 -0
  502. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_siglip_integration.py +0 -0
  503. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_sparse_aggregation.py +0 -0
  504. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_flash_parity.py +0 -0
  505. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_packed_parity.py +0 -0
  506. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_splade_roberta_position_ids.py +0 -0
  507. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_st_sparse_vision.py +0 -0
  508. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_stablebridge_integration.py +0 -0
  509. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_stablebridge_pruner.py +0 -0
  510. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_vision_patch_embed.py +0 -0
  511. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_visual_document.py +0 -0
  512. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_visual_muvera_postprocessors.py +0 -0
  513. {sie_server-0.7.2 → sie_server-0.8.0}/tests/adapters/test_whisper.py +0 -0
  514. {sie_server-0.7.2/tests/core → sie_server-0.8.0/tests/api}/__init__.py +0 -0
  515. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_canonical_profile_conformance.py +0 -0
  516. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_dtype_queue_http_parity.py +0 -0
  517. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_dtype.py +0 -0
  518. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_endpoint.py +0 -0
  519. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_json_schema.py +0 -0
  520. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_timing.py +0 -0
  521. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_encode_validation.py +0 -0
  522. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract.py +0 -0
  523. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_extract_integration.py +0 -0
  524. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_health.py +0 -0
  525. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_helpers_telemetry.py +0 -0
  526. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_openai_audio.py +0 -0
  527. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_score.py +0 -0
  528. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_usage_reporting.py +0 -0
  529. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_version_header.py +0 -0
  530. {sie_server-0.7.2 → sie_server-0.8.0}/tests/api/test_ws.py +0 -0
  531. {sie_server-0.7.2/tests/core/worker → sie_server-0.8.0/tests/app}/__init__.py +0 -0
  532. {sie_server-0.7.2 → sie_server-0.8.0}/tests/app/test_app_factory.py +0 -0
  533. {sie_server-0.7.2/tests/fake_stack → sie_server-0.8.0/tests/config}/__init__.py +0 -0
  534. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_answerai_colbert_profiles.py +0 -0
  535. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_colbertv2_profiles.py +0 -0
  536. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_config.py +0 -0
  537. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_generation_mode_profiles.py +0 -0
  538. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_gte_modern_colbert_profiles.py +0 -0
  539. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_h100_fp8_generation_profiles.py +0 -0
  540. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_jina_colbert_profiles.py +0 -0
  541. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_model_prewarm_grammars.py +0 -0
  542. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_muvera_profile_postprocessors.py +0 -0
  543. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_mxbai_colbert_profiles.py +0 -0
  544. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_mxbai_edge_colbert_profiles.py +0 -0
  545. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_nvidia_nemo_colembed_profiles.py +0 -0
  546. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_package_artifacts.py +0 -0
  547. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_profile_backend_consistency.py +0 -0
  548. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_profile_template_inheritance.py +0 -0
  549. {sie_server-0.7.2 → sie_server-0.8.0}/tests/config/test_visual_muvera_containment.py +0 -0
  550. {sie_server-0.7.2 → sie_server-0.8.0}/tests/conftest.py +0 -0
  551. {sie_server-0.7.2/tests/health → sie_server-0.8.0/tests/core}/__init__.py +0 -0
  552. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_adaptive_batching.py +0 -0
  553. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_batcher.py +0 -0
  554. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_bundle_requirements.py +0 -0
  555. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_disk_cache.py +0 -0
  556. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_encode_format_output.py +0 -0
  557. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_encode_worker_batching.py +0 -0
  558. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_gpu_health.py +0 -0
  559. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_hot_reload.py +0 -0
  560. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_idle_evict.py +0 -0
  561. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_inference.py +0 -0
  562. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_load_rgb.py +0 -0
  563. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_logging.py +0 -0
  564. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_lora_generation_exclusion.py +0 -0
  565. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_memory.py +0 -0
  566. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_memory_synthetic.py +0 -0
  567. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_model_load_timeout.py +0 -0
  568. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_model_suggestions.py +0 -0
  569. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_oom_detection.py +0 -0
  570. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_pool_isolation.py +0 -0
  571. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_postprocessor.py +0 -0
  572. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_postprocessor_registry.py +0 -0
  573. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_prepared.py +0 -0
  574. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_preprocessor.py +0 -0
  575. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_preprocessor_registry.py +0 -0
  576. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_quantization.py +0 -0
  577. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_readiness.py +0 -0
  578. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_core.py +0 -0
  579. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_deps.py +0 -0
  580. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_failed_state.py +0 -0
  581. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_registry_multi_model.py +0 -0
  582. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_residency.py +0 -0
  583. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_revision_identity.py +0 -0
  584. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_runtime_options.py +0 -0
  585. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_shutdown.py +0 -0
  586. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_timing.py +0 -0
  587. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_unload_off_event_loop.py +0 -0
  588. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_video_frames.py +0 -0
  589. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_watcher.py +0 -0
  590. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_backpressure.py +0 -0
  591. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_core.py +0 -0
  592. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_drain.py +0 -0
  593. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_extract.py +0 -0
  594. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_lora.py +0 -0
  595. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_options.py +0 -0
  596. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_preformed.py +0 -0
  597. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/test_worker_score.py +0 -0
  598. {sie_server-0.7.2/tests/integration → sie_server-0.8.0/tests/core/worker}/__init__.py +0 -0
  599. {sie_server-0.7.2 → sie_server-0.8.0}/tests/core/worker/test_oom_recovery.py +0 -0
  600. {sie_server-0.7.2/tests/observability → sie_server-0.8.0/tests/fake_stack}/__init__.py +0 -0
  601. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/conftest.py +0 -0
  602. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_lost_result.py +0 -0
  603. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_model_loading_race.py +0 -0
  604. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_oom_ladder.py +0 -0
  605. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_registry_races.py +0 -0
  606. {sie_server-0.7.2 → sie_server-0.8.0}/tests/fake_stack/test_sdk_surface.py +0 -0
  607. {sie_server-0.7.2/tests/processors → sie_server-0.8.0/tests/health}/__init__.py +0 -0
  608. {sie_server-0.7.2 → sie_server-0.8.0}/tests/health/test_saturation.py +0 -0
  609. {sie_server-0.7.2 → sie_server-0.8.0}/tests/health/test_worker_id_consistency.py +0 -0
  610. {sie_server-0.7.2/tests/type_defs → sie_server-0.8.0/tests/integration}/__init__.py +0 -0
  611. {sie_server-0.7.2 → sie_server-0.8.0}/tests/integration/test_chat_completions.py +0 -0
  612. {sie_server-0.7.2 → sie_server-0.8.0}/tests/integration/test_grammar_generate.py +0 -0
  613. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_generation_diagnostics.py +0 -0
  614. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_telemetry.py +0 -0
  615. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_trace_propagation.py +0 -0
  616. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_tracing.py +0 -0
  617. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_worker_telemetry.py +0 -0
  618. {sie_server-0.7.2 → sie_server-0.8.0}/tests/observability/test_worker_telemetry_benchmark.py +0 -0
  619. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_cache.py +0 -0
  620. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_grammar_prewarm.py +0 -0
  621. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming_admission.py +0 -0
  622. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_streaming_integration.py +0 -0
  623. {sie_server-0.7.2 → sie_server-0.8.0}/tests/processors/test_work_class_scheduler.py +0 -0
  624. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_adapter_call_loop.py +0 -0
  625. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_all_models.py +0 -0
  626. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_devices.py +0 -0
  627. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_log_level.py +0 -0
  628. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_cli_pool.py +0 -0
  629. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_decode_item.py +0 -0
  630. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_docker_integration.py +0 -0
  631. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_documented_model_ids.py +0 -0
  632. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_ipc_types_raw_output.py +0 -0
  633. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_local_ingest_client.py +0 -0
  634. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_metering_units.py +0 -0
  635. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_parity_run_batch.py +0 -0
  636. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_queue_executor.py +0 -0
  637. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_queue_executor_stage1d.py +0 -0
  638. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_readiness.py +0 -0
  639. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_sdk_integration.py +0 -0
  640. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_server_process_fixture.py +0 -0
  641. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_server_smoke.py +0 -0
  642. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_sparse_integration.py +0 -0
  643. {sie_server-0.7.2 → sie_server-0.8.0}/tests/test_stage1d_byte_identity.py +0 -0
  644. {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_decode_image.py +0 -0
  645. {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_inputs.py +0 -0
  646. {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_inputs_json_decode.py +0 -0
  647. {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_media_bytes.py +0 -0
  648. {sie_server-0.7.2 → sie_server-0.8.0}/tests/type_defs/test_types.py +0 -0
@@ -1,4 +1,6 @@
1
1
  # Byte-compiled / optimized / DLL files
2
+ .codex/artifacts/worktree-task/
3
+
2
4
  __pycache__/
3
5
  *.py[codz]
4
6
  *$py.class
@@ -101,8 +101,10 @@ RUN --mount=type=cache,target=/root/.cache/pip \
101
101
  # shared-deps resolver.
102
102
  RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
103
103
 
104
- # Register bundle-libs on sys.path. Content is identical across bundles.
105
- RUN echo "import sys; sys.path.insert(0, '/app/bundle-libs')" \
104
+ # Register bundle-libs as a site directory so dependency-owned .pth files are
105
+ # processed, then move every discovered bundle path ahead of the shared venv so
106
+ # bundle versions shadow it. Content is identical across bundles.
107
+ RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
106
108
  > /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
107
109
 
108
110
  # .venv cleanup + stdlib trim — runs here so /app/.venv reaches its final
@@ -110,12 +110,12 @@ RUN --mount=type=cache,target=/root/.cache/pip \
110
110
  # intentionally not imported here.
111
111
  RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
112
112
 
113
- # Register bundle-libs on sys.path via a .pth file executed by site.py at
114
- # interpreter startup. `sys.path.insert(0, ...)` puts bundle-libs at
115
- # position 0 so bundle-specific versions SHADOW shared venv versions
116
- # (required for the transformers5 bundle). Content is identical for every
117
- # bundle, so writing it here keeps the shared venv layer byte-identical.
118
- RUN echo "import sys; sys.path.insert(0, '/app/bundle-libs')" \
113
+ # Register bundle-libs as a site directory so dependency-owned .pth files are
114
+ # processed at interpreter startup. Then move every discovered bundle path
115
+ # ahead of the shared venv so bundle-specific versions SHADOW it (required for
116
+ # the transformers5 bundle). Content is identical for every bundle, so writing
117
+ # it here keeps the shared venv layer byte-identical.
118
+ RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
119
119
  > /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
120
120
 
121
121
  # Conservative venv cleanup — only things known to be runtime-safe. Keep
@@ -210,10 +210,24 @@ RUN set -eux; \
210
210
  # smaller CUDA base runtime; SGLang-family bundles need the devel toolkit
211
211
  # because flashinfer/tvm_ffi perform runtime JIT through nvcc on first decode.
212
212
  FROM nvidia/cuda:12.4.1-base-ubuntu22.04 AS runtime-default
213
+ # The CTranslate2 bundle uses the CUDA runtime image, not the devel toolchain.
214
+ FROM nvidia/cuda:12.4.1-runtime-ubuntu22.04 AS runtime-ctranslate2
213
215
  FROM nvidia/cuda:12.4.1-base-ubuntu22.04 AS runtime-transformers5
214
216
  FROM nvidia/cuda:12.9.1-cudnn-devel-ubuntu22.04 AS runtime-sglang
215
217
  ENV CUDA_HOME=/usr/local/cuda \
216
218
  LD_LIBRARY_PATH="/usr/local/cuda/lib64:$LD_LIBRARY_PATH"
219
+ # FFmpeg shared libraries: SGLang decodes video inputs with torchcodec, which
220
+ # dlopens them at first use and has no bundled FFmpeg.
221
+ RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
222
+ --mount=type=cache,target=/var/lib/apt/lists,sharing=locked \
223
+ apt-get update && apt-get install -y --no-install-recommends \
224
+ libavcodec58 \
225
+ libavdevice58 \
226
+ libavfilter7 \
227
+ libavformat58 \
228
+ libavutil56 \
229
+ libswresample3 \
230
+ libswscale5
217
231
  FROM runtime-sglang AS runtime-sglang-embedding
218
232
  FROM runtime-sglang AS runtime-sglang-vision-extract
219
233
  # NOTE: the sglang-cu130 bundle (CUDA 13 / sglang 0.5.13 / torch 2.11 cu130) is built by
@@ -1,14 +1,12 @@
1
1
  # syntax=docker/dockerfile:1
2
- # SIE Server - CUDA 13 Image (SGLang cu130 bundles)
2
+ # SIE Server - CUDA 13 Image (engine-isolated cu130 bundles)
3
3
  # Build from repo root:
4
4
  # docker build -f packages/sie_server/Dockerfile.cuda13 --build-arg BUNDLE=sglang-cu130 -t sie-server:cuda13-sglang-cu130 .
5
5
  #
6
- # WHY A SEPARATE PLATFORM: the sglang-cu130 bundle needs sglang 0.5.13, which pins
7
- # torch==2.11.0 (cu130) + transformers 5.8.x and JIT-compiles cu130 kernels
8
- # (flashinfer / tvm_ffi) through nvcc on first decode — so it requires a CUDA 13
9
- # devel runtime. Keeping it here (platform ``cuda13``) instead of inside
10
- # Dockerfile.cuda12 means a ``cuda13-sglang-cu130`` image is honestly labelled CUDA 13,
11
- # not a CUDA-13 image hiding under a ``cuda12-*`` tag (see #1415).
6
+ # WHY A SEPARATE PLATFORM: CUDA 13 engines carry independent exact Torch,
7
+ # Transformers, FlashInfer, and native-library closures. Keeping them here
8
+ # (platform ``cuda13``) instead of Dockerfile.cuda12 makes image tags honest
9
+ # while still sharing the expensive CUDA 13 base layers.
12
10
  #
13
11
  # STRUCTURE: mirrors Dockerfile.cuda12's deps→base→builder→runtime stages so the
14
12
  # shared logic (standalone Python, editable installs, bundle-libs .pth shadow,
@@ -18,7 +16,7 @@
18
16
  # cu130 bundle), so there is no per-bundle runtime indirection.
19
17
  #
20
18
  # DUAL-TORCH CARRY: the shared base venv still installs torch 2.9 (cu129) from
21
- # pyproject, and the sglang-cu130 bundle overlays torch 2.11 (cu130) into bundle-libs
19
+ # pyproject, and CUDA 13 bundles overlay torch 2.11 (cu130) into bundle-libs
22
20
  # (~+3 GB). Slimming torch out of sie-server core to drop the carry is a tracked
23
21
  # follow-up (#1415).
24
22
 
@@ -50,13 +48,16 @@ ENV DEBIAN_FRONTEND=noninteractive \
50
48
  UV_PYTHON_INSTALL_DIR=/opt/python \
51
49
  PIP_DISABLE_PIP_VERSION_CHECK=1
52
50
 
53
- # Minimal apt footprint: just enough for curl + git; no deadsnakes PPA.
51
+ # Minimal apt footprint: curl/git plus the MPI runtime required by
52
+ # TensorRT-LLM's Python import; no OpenMPI development headers are needed.
54
53
  RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
55
54
  --mount=type=cache,target=/var/lib/apt/lists,sharing=locked \
56
55
  apt-get update && apt-get install -y --no-install-recommends \
57
56
  ca-certificates \
58
57
  curl \
59
- git
58
+ git \
59
+ libopenmpi3 \
60
+ openmpi-bin
60
61
 
61
62
  ARG UV_VERSION
62
63
  RUN curl -LsSf https://astral.sh/uv/${UV_VERSION}/install.sh | sh \
@@ -117,12 +118,12 @@ RUN --mount=type=cache,target=/root/.cache/pip \
117
118
  # Sanity-check shared venv imports.
118
119
  RUN .venv/bin/python -c "import sie_audio_prep, torch; print(torch.__version__)"
119
120
 
120
- # Register bundle-libs on sys.path via a .pth executed by site.py at startup.
121
- # sys.path.insert(0, ...) puts bundle-libs at position 0 so bundle-specific
122
- # versions SHADOW the shared venv (the cu130 torch/transformers/sglang
123
- # overlay). Content is identical for every bundle, so writing it here keeps the
124
- # shared venv layer byte-identical.
125
- RUN echo "import sys; sys.path.insert(0, '/app/bundle-libs')" \
121
+ # Register bundle-libs as a site directory so dependency-owned .pth files are
122
+ # processed at interpreter startup. Then move every discovered bundle path
123
+ # ahead of the shared venv so bundle-specific versions SHADOW it (the cu130
124
+ # torch/transformers/engine overlay). Content is identical for every bundle, so
125
+ # writing it here keeps the shared venv layer byte-identical.
126
+ RUN echo "import site, sys; _sie_bundle_start = len(sys.path); site.addsitedir('/app/bundle-libs'); sys.path[:] = sys.path[_sie_bundle_start:] + sys.path[:_sie_bundle_start]" \
126
127
  > /app/.venv/lib/python3.12/site-packages/_sie_bundle.pth
127
128
 
128
129
  # Conservative venv cleanup — only runtime-safe removals. Keep torch/include
@@ -155,7 +156,7 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
155
156
  && cat /tmp/bundle-requirements.txt
156
157
 
157
158
  # cu130 bundle deps go into a separate site-packages tree (``bundle-libs``,
158
- # prepended to sys.path via the .pth above). The sglang-cu130 bundle needs torch 2.11
159
+ # prepended to sys.path via the .pth above). CUDA 13 engines need torch 2.11
159
160
  # from the cu130 PyTorch index, where the only ``2.11.0`` is the ``+cu130``
160
161
  # local-version wheel; pip's multi-index resolution does not reliably prefer it
161
162
  # over PyPI's default-CUDA build, so cuda13 bundles resolve with ``uv`` and
@@ -164,7 +165,7 @@ RUN .venv/bin/python -m sie_server.cli resolve-deps \
164
165
  # cu130-index resolution was validated with sglang 0.5.13, torch 2.11, and a
165
166
  # cu130 runtime in a fresh GPU environment.
166
167
  #
167
- # COVERAGE NOTE: the cuda13 image CI smoke (.github/workflows/sglang-cu130-image.yml)
168
+ # COVERAGE NOTE: the CUDA 13 image CI callers
168
169
  # builds this image and asserts on CPU that the bundle-libs cu130 overlay
169
170
  # SHADOWS the base venv (import torch -> 2.11+cu130, transformers 5.x). It does
170
171
  # NOT exercise GPU init: the cu12 base venv + cu130 bundle-libs both expose the
@@ -220,6 +221,8 @@ ENV DEBIAN_FRONTEND=noninteractive
220
221
  # libnuma1: required by sgl_kernel; import fails with a misleading SM-arch error
221
222
  # without it.
222
223
  # libgomp1: torch OpenMP runtime.
224
+ # libopenmpi3/openmpi-bin: TensorRT-LLM imports MPI at runtime; headers are not
225
+ # required by the qualified wheel closure.
223
226
  # libspatialindex-c6 / libgl1 / libglib2.0-0 / libice6 / libsm6 / libx11-6 /
224
227
  # libxcb1 / libxext6: docling/opencv dlopen chain (kept symmetric with the
225
228
  # cuda12 runtime so the same model bundle deps import cleanly).
@@ -235,9 +238,11 @@ RUN --mount=type=cache,target=/var/cache/apt,sharing=locked \
235
238
  libgomp1 \
236
239
  libice6 \
237
240
  libnuma1 \
241
+ libopenmpi3 \
238
242
  libsm6 \
239
243
  libspatialindex-c6 \
240
244
  ninja-build \
245
+ openmpi-bin \
241
246
  libx11-6 \
242
247
  libxcb1 \
243
248
  libxext6
@@ -278,7 +283,8 @@ LABEL org.opencontainers.image.title="SIE Server" \
278
283
  org.opencontainers.image.description="Search Inference Engine - ${BUNDLE} bundle (CUDA 13)" \
279
284
  sie.bundle="${BUNDLE}"
280
285
 
281
- ENV PATH="/app/.venv/bin:$PATH" \
286
+ # ``uv --target`` writes engine entrypoints beside the package overlay.
287
+ ENV PATH="/app/bundle-libs/bin:/app/.venv/bin:$PATH" \
282
288
  PYTHONUNBUFFERED=1 \
283
289
  PYTHONDONTWRITEBYTECODE=1 \
284
290
  HF_HOME=/app/.cache/huggingface \
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.5
2
2
  Name: sie-server
3
- Version: 0.7.2
3
+ Version: 0.8.0
4
4
  Summary: Search Inference Engine - GPU inference server for search workloads
5
5
  License: Apache-2.0
6
6
  License-File: LICENSE
@@ -39,6 +39,15 @@ pip install sie-server
39
39
  sie-server serve --port 8080 --device cuda:0
40
40
  ```
41
41
 
42
+ ### TensorRT-LLM generation
43
+
44
+ TensorRT-LLM buffers completion token IDs and emits the final text together only
45
+ after generation finishes and the terminal stream is verified, even with
46
+ `stream=True`. This preserves context-sensitive spacing and punctuation and
47
+ removes matched stop sequences consistently from returned text, completion-token
48
+ usage, and logprobs. Long completions delay the first visible text; existing
49
+ request timeouts still apply. Other adapters are unaffected.
50
+
42
51
  ## Configuration
43
52
 
44
53
  `sie-server` reads its config from `SIE_*` environment variables (Pydantic
@@ -0,0 +1,6 @@
1
+ name: ctranslate2
2
+ priority: 19
3
+ adapters:
4
+ - sie_server.adapters.ctranslate2.generation
5
+ deps:
6
+ ctranslate2: '==4.8.1'
@@ -2,8 +2,8 @@ name: sglang-cu130
2
2
  priority: 20
3
3
  default: false
4
4
  # GPU platform this bundle targets — selects packages/sie_server/Dockerfile.cuda13
5
- # and tags images ``cuda13-sglang-cu130`` (not ``cuda12-*``). Gemma 4 needs sglang
6
- # 0.5.13 / torch 2.11 cu130 on a CUDA 13 devel runtime (see below). Read by the
5
+ # and tags images ``cuda13-sglang-cu130`` (not ``cuda12-*``). The pinned engine
6
+ # needs torch cu130 on a CUDA 13 devel runtime (see below). Read by the
7
7
  # image build. Bundles without this field default to ``cuda12``.
8
8
  platform: cuda13
9
9
  # General CUDA 13 / cu130 SGLang worker image, introduced for Google Gemma 4
@@ -26,13 +26,31 @@ platform: cuda13
26
26
  # JIT kernel (jit_kernel/csrc/elementwise/activation.cuh) fails to compile
27
27
  # under strict nvcc — "select_kernel ... expected a type, got
28
28
  # ActivationKind::kSiLU" — confirmed broken on BOTH CUDA 12.9 and 13.0. 0.5.13
29
- # fixes it. Both 0.5.11 and 0.5.13 require torch 2.11 (the torch 2.9->2.11 bump
30
- # landed at 0.5.11, not 0.5.12), so there is no torch-2.9 path to Gemma 4 —
31
- # this bundle's image carries torch 2.11 (cu130) on a CUDA 13 base — built by
29
+ # fixed it, and this bundle pinned 0.5.13 until the move to 0.5.20 below.
30
+ #
31
+ # Now pinned to 0.5.20, which is the first release carrying the ``glm5_next``
32
+ # model (python/sglang/srt/models/glm5_next.py, EntryClass
33
+ # ``Glm5NextForConditionalGeneration``). 0.5.13 has no such module, so the
34
+ # architecture cannot load on it at any width. 0.5.20 moves its own exact pins
35
+ # with it: torch 2.11 -> 2.13 (cu130 wheels exist for both), transformers
36
+ # 5.8.1 -> 5.12.1, flashinfer-python 0.6.12 -> 0.6.18, sgl-deep-gemm
37
+ # 0.1.2 -> 0.2.0, sglang-kernel 0.4.3 -> 0.4.7, apache-tvm-ffi 0.1.9 -> 0.1.11,
38
+ # and it adds humming-kernels and quack-kernels. xgrammar stays at 0.2.1.
39
+ # Those versions are sglang's own ``==`` pins, not choices made here.
40
+ #
41
+ # 0.5.20 also renames launch flags SIE uses. ``--mamba-scheduler-strategy`` is
42
+ # now ``--mamba-radix-cache-strategy``; ``--cuda-graph-max-bs`` is split into
43
+ # ``--cuda-graph-max-bs-decode`` and ``--cuda-graph-max-bs-prefill``; and
44
+ # ``--disable-piecewise-cuda-graph`` is gone, the prefill-phase graph it turned
45
+ # off now controlled by ``--disable-prefill-cuda-graph``. The adapters routed
46
+ # here and the profiles that use them carry the new names. The ``sglang``
47
+ # bundle's engine keeps the old ones.
48
+ #
49
+ # The bundle's image carries torch (cu130) on a CUDA 13 base — built by
32
50
  # the dedicated ``cuda13`` platform (packages/sie_server/Dockerfile.cuda13),
33
51
  # selected via the ``platform: cuda13`` field above. The shared base venv still
34
- # ships torch 2.9.1, so the cu130 image carries two torches (~+3 GB); slimming
35
- # torch out of sie-server core would remove that (tracked follow-up in #1415).
52
+ # ships its own torch, so the cu130 image carries two torches (~+3 GB); slimming
53
+ # torch out of sie-server core would remove that.
36
54
  #
37
55
  # Distinct thin adapter modules scope routing here because bundle compatibility
38
56
  # keys on module paths. Gemma models use `...sglang.gemma`; Qwen profiles that
@@ -43,28 +61,27 @@ adapters:
43
61
  - sie_server.adapters.sglang.gemma
44
62
  - sie_server.adapters.sglang.cuda13
45
63
  deps:
46
- # sglang 0.5.13 = the validated Gemma 4 engine (0.5.11 has the activation.cuh
47
- # JIT bug above). Verified transitive resolution on the Modal L4 cu130 image:
48
- # torch==2.11.0 (cu130), transformers==5.8.1, kernels==0.14.1,
49
- # sgl-deep-gemm==0.1.2, sglang-kernel==0.4.3, and
50
- # flashinfer-python==0.6.12 (the exact SGLang 0.5.13 closure).
64
+ # sglang 0.5.20 (see the VERSION NOTE above). Verified transitive resolution
65
+ # on the Modal cu130 image:
66
+ # torch==2.13.0 (cu130), transformers==5.12.1, kernels==0.14.1,
67
+ # sgl-deep-gemm==0.2.0, sglang-kernel==0.4.7, and
68
+ # flashinfer-python==0.6.18 (the exact SGLang 0.5.20 closure).
51
69
  # These resolve from the cu130 wheel indexes at build/serve time
52
70
  # (download.pytorch.org/whl/cu130 + https://docs.sglang.ai/whl/cu130/),
53
71
  # supplied by the build (Dockerfile.cuda13 / Modal image). torch,
54
- # transformers, and kernels are intentionally NOT re-pinned here — sglang
55
- # 0.5.13's own exact pins drive them. (Pinning kernels<0.13 makes the resolve
56
- # unsatisfiable: 0.5.13 requires kernels>=0.14.1,<0.15. sglang declares a
57
- # bare unpinned `kernels`, so without 0.5.13's transitive pin uv would grab
58
- # the latest, which breaks sglang's import — let sglang constrain it.)
59
- sglang: '==0.5.13'
72
+ # transformers, and kernels are intentionally NOT re-pinned here — sglang's
73
+ # own exact pins drive them. (sglang declares a bare unpinned `kernels`, so
74
+ # without its transitive pin uv would grab the latest, which breaks sglang's
75
+ # import — let sglang constrain it.)
76
+ sglang: '==0.5.20'
60
77
  # Structured-output backend the Gemma model configs select
61
78
  # (tasks.generate ... grammar_backend: xgrammar). Pinned to the version
62
- # sglang 0.5.13 resolves, to prevent silent drift (mirrors the sglang
63
- # bundle's rationale). NOTE: 0.5.13 uses xgrammar 0.2.x, not the 0.1.32 the
64
- # sglang bundle pins for the older engine.
79
+ # sglang 0.5.20 resolves, to prevent silent drift (mirrors the sglang
80
+ # bundle's rationale). NOTE: this engine uses xgrammar 0.2.x, not the 0.1.32
81
+ # the sglang bundle pins for the older engine.
65
82
  xgrammar: '==0.2.1'
66
83
  # XGrammar 0.2.1 imports ``tvm_ffi`` while its package metadata leaves the
67
- # dependency open at >=0.1.9. SGLang 0.5.13 pins apache-tvm-ffi==0.1.9
84
+ # dependency open at >=0.1.9. SGLang 0.5.20 pins apache-tvm-ffi==0.1.11
68
85
  # exactly, so declare the same version explicitly: this keeps the import in
69
86
  # the image and lets the bundle resolve as one compatible dependency set.
70
- apache-tvm-ffi: '==0.1.9'
87
+ apache-tvm-ffi: '==0.1.11'
@@ -0,0 +1,39 @@
1
+ name: tensorrt-llm
2
+ priority: 20
3
+ default: false
4
+ # Reusable direct-HF encoder-decoder runtime. This is a CUDA 13 engine lane,
5
+ # not a checkpoint-specific bundle; compatible T5/BART/mBART-family profiles
6
+ # opt in through the generic adapter module below.
7
+ platform: cuda13
8
+ adapters:
9
+ - sie_server.adapters.tensorrt_llm.generation
10
+ deps:
11
+ # Exact prerelease qualified from tag commit
12
+ # 1cef02e901be43081b1ba6d4981e94ed3bd9c1e8. Compatibility overlays verify
13
+ # the complete rc24 source files they patch and refuse any other build.
14
+ tensorrt-llm: '==1.3.0rc24'
15
+ # rc24's direct-HF T5 closure. Torch resolves to the +cu130 wheel through
16
+ # Dockerfile.cuda13's explicit PyTorch index.
17
+ torch: '==2.11.0'
18
+ transformers: '==5.5.4'
19
+ flashinfer-python: '==0.6.16'
20
+ # Keep the qualified build stable when the image resolver permits prereleases.
21
+ cuda-tile: '==1.6.0rc8'
22
+ triton: '==3.6.0'
23
+ nvidia-cutlass-dsl: '==4.5.0'
24
+ nvidia-cuda-tileiras: '==13.1.80'
25
+ nvidia-matmul-heuristics: '==0.1.0.27'
26
+ # cuda-python 13.3.1 permits cuda-pathfinder~=1.1, while cuda-core and
27
+ # cuda-bindings only require >=1.4.2. Pin the import-proven rc24 closure so
28
+ # a newer transitive release cannot silently change the engine image.
29
+ cuda-pathfinder: '==1.7.0'
30
+ # rc24 permits an NCCL range; lock the import-proven cu13 build so PyPI and
31
+ # the cu130 indexes cannot choose a different ABI-compatible-looking wheel.
32
+ nvidia-nccl-cu13: '==2.28.9'
33
+ flash-attn-4: '==4.0.0b11'
34
+ torch-c-dlpack-ext: '==0.1.3'
35
+ xgrammar: '==0.1.32'
36
+ apache-tvm-ffi: '==0.1.6'
37
+ # The published rc24 closure leaves mpmath open; a newer resolution breaks
38
+ # native import. 1.3.0 is the exact import-proven value.
39
+ mpmath: '==1.3.0'
@@ -0,0 +1,132 @@
1
+ sie_id: "Qwen/Qwen3-VL-8B-Instruct"
2
+ hf_id: "Qwen/Qwen3-VL-8B-Instruct"
3
+ hf_revision: 0c351dd01ed87e9c1b53cbc748cba10e6187ff3b
4
+ inputs:
5
+ # Video is served on the direct /v1/chat/completions route as one inline
6
+ # base64 ``video_url`` per request; the runtime samples frames per the
7
+ # ``video`` block of ``--mm-process-config`` below.
8
+ text: true
9
+ image: true
10
+ audio: false
11
+ video: true
12
+ tasks:
13
+ encode: null
14
+ score: null
15
+ extract: null
16
+ generate:
17
+ # Native context is 262,144 tokens; the served window is 32K so one
18
+ # admission fits a 16K-token video plus the model-card VL output length.
19
+ context_length: 32768
20
+ # Model card VL recommendation: out_seq_length=16384.
21
+ max_output_tokens: 16384
22
+ # Every profile is non-speculative (no MTP/NEXTN head in the checkpoint),
23
+ # so the grammar-safe fallback is the same launch shape.
24
+ grammar_profile: no-spec
25
+ capabilities:
26
+ grammar: ["json_schema", "regex"]
27
+ streaming: true
28
+ # The chat template renders Hermes-style <tool_call>{json}</tool_call>.
29
+ tools: true
30
+ max_sequence_length: 32768
31
+ # KV-cache math (text_config, bf16): 36 layers x 8 KV heads x head_dim 128
32
+ # kv_bytes_per_token = 2 (k+v) x 36 x 8 x 128 x 2 B = 147,456 B = 144 KiB
33
+ # RTX PRO 6000 (96 GB) at mem_fraction_static=0.85 with ~17.5 GB weights:
34
+ # (96 x 0.85 - 17.5) GB / 144 KiB ~= 430,000 tokens theoretical.
35
+ # kv_budget_tokens admits two full 32K-context requests, leaving headroom for
36
+ # vision-encoder activations on image/video prefill.
37
+ profiles:
38
+ default:
39
+ max_batch_tokens: 32768
40
+ compute_precision: bfloat16
41
+ adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
42
+ kv_budget_tokens: 65536
43
+ adapter_options:
44
+ loadtime:
45
+ mem_fraction_static: 0.85
46
+ served_model_name: Qwen/Qwen3-VL-8B-Instruct
47
+ grammar_backend: xgrammar
48
+ tool_call_parser: qwen25
49
+ speculative:
50
+ enabled: false
51
+ extra_launch_args:
52
+ - "--mm-process-config"
53
+ - '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
54
+ runtime:
55
+ first_chunk_timeout_s: 90
56
+ inter_chunk_timeout_s: 15
57
+ overall_timeout_s: 600
58
+ # Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
59
+ # presence_penalty 1.5. min_new_tokens=1: on an untemplated native
60
+ # generate prompt the model emits EOS as its first token (empty text).
61
+ default_sampling:
62
+ temperature: 0.7
63
+ top_p: 0.8
64
+ top_k: 20
65
+ presence_penalty: 1.5
66
+ min_new_tokens: 1
67
+ stop_tokens:
68
+ - "<|im_end|>"
69
+ # RTX PRO 6000 (96 GB, sm_120) shape; identical launch to ``default``.
70
+ rtx-pro-6000:
71
+ max_batch_tokens: 32768
72
+ compute_precision: bfloat16
73
+ adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
74
+ kv_budget_tokens: 65536
75
+ adapter_options:
76
+ loadtime:
77
+ mem_fraction_static: 0.85
78
+ served_model_name: Qwen/Qwen3-VL-8B-Instruct
79
+ grammar_backend: xgrammar
80
+ tool_call_parser: qwen25
81
+ speculative:
82
+ enabled: false
83
+ extra_launch_args:
84
+ - "--mm-process-config"
85
+ - '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
86
+ runtime:
87
+ first_chunk_timeout_s: 90
88
+ inter_chunk_timeout_s: 15
89
+ overall_timeout_s: 600
90
+ # Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
91
+ # presence_penalty 1.5. min_new_tokens=1: on an untemplated native
92
+ # generate prompt the model emits EOS as its first token (empty text).
93
+ default_sampling:
94
+ temperature: 0.7
95
+ top_p: 0.8
96
+ top_k: 20
97
+ presence_penalty: 1.5
98
+ min_new_tokens: 1
99
+ stop_tokens:
100
+ - "<|im_end|>"
101
+ # Grammar-safe fallback; identical launch to ``default``.
102
+ no-spec:
103
+ max_batch_tokens: 32768
104
+ compute_precision: bfloat16
105
+ adapter_path: sie_server.adapters.sglang.generation:SGLangGenerationAdapter
106
+ kv_budget_tokens: 65536
107
+ adapter_options:
108
+ loadtime:
109
+ mem_fraction_static: 0.85
110
+ served_model_name: Qwen/Qwen3-VL-8B-Instruct
111
+ grammar_backend: xgrammar
112
+ tool_call_parser: qwen25
113
+ speculative:
114
+ enabled: false
115
+ extra_launch_args:
116
+ - "--mm-process-config"
117
+ - '{"image":{"min_pixels":65536,"max_pixels":1003520},"video":{"fps":2,"max_frames":64,"total_pixels":8388608}}'
118
+ runtime:
119
+ first_chunk_timeout_s: 90
120
+ inter_chunk_timeout_s: 15
121
+ overall_timeout_s: 600
122
+ # Model card VL sampling: temperature 0.7, top_p 0.8, top_k 20,
123
+ # presence_penalty 1.5. min_new_tokens=1: on an untemplated native
124
+ # generate prompt the model emits EOS as its first token (empty text).
125
+ default_sampling:
126
+ temperature: 0.7
127
+ top_p: 0.8
128
+ top_k: 20
129
+ presence_penalty: 1.5
130
+ min_new_tokens: 1
131
+ stop_tokens:
132
+ - "<|im_end|>"
@@ -337,7 +337,7 @@ profiles:
337
337
  - '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
338
338
  - "--quantization"
339
339
  - "fp8"
340
- - "--mamba-scheduler-strategy"
340
+ - "--mamba-radix-cache-strategy"
341
341
  - "extra_buffer"
342
342
  - "--page-size"
343
343
  - "64"
@@ -373,7 +373,7 @@ profiles:
373
373
  - '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
374
374
  - "--quantization"
375
375
  - "fp8"
376
- - "--mamba-scheduler-strategy"
376
+ - "--mamba-radix-cache-strategy"
377
377
  - "extra_buffer"
378
378
  - "--page-size"
379
379
  - "64"
@@ -410,7 +410,7 @@ profiles:
410
410
  - '{"image":{"min_pixels":65536,"max_pixels":1003520}}'
411
411
  - "--quantization"
412
412
  - "fp8"
413
- - "--mamba-scheduler-strategy"
413
+ - "--mamba-radix-cache-strategy"
414
414
  - "extra_buffer"
415
415
  - "--page-size"
416
416
  - "64"
@@ -20,6 +20,7 @@ tasks:
20
20
  # exact-hardware profiles whose admission and launch shapes are smoke-tested.
21
21
  context_length: 8192
22
22
  max_output_tokens: 4096
23
+ grammar_profile: no-spec
23
24
  capabilities:
24
25
  grammar: ["json_schema", "regex"]
25
26
  streaming: true
@@ -80,6 +81,9 @@ profiles:
80
81
  stop_tokens:
81
82
  - "<|im_end|>"
82
83
 
84
+ no-spec:
85
+ extends: default
86
+
83
87
  # H100-80GB: one native-window admission with in-checkpoint MTP. FA3 plus
84
88
  # BF16 GDN state is the measured SM90 batch-one winner. Profile-scoped
85
89
  # DeepGEMM fast warmup covers every decode M through 1024 and samples the
@@ -118,7 +122,7 @@ profiles:
118
122
  - "bfloat16"
119
123
  - "--mamba-ssm-dtype"
120
124
  - "bfloat16"
121
- - "--mamba-scheduler-strategy"
125
+ - "--mamba-radix-cache-strategy"
122
126
  - "extra_buffer"
123
127
  - "--disable-overlap-schedule"
124
128
  - "--page-size"
@@ -129,7 +133,7 @@ profiles:
129
133
  - "32768"
130
134
  - "--max-running-requests"
131
135
  - "1"
132
- - "--cuda-graph-max-bs"
136
+ - "--cuda-graph-max-bs-decode"
133
137
  - "1"
134
138
  runtime:
135
139
  first_chunk_timeout_s: 900
@@ -163,7 +167,7 @@ profiles:
163
167
  - "bfloat16"
164
168
  - "--mamba-ssm-dtype"
165
169
  - "bfloat16"
166
- - "--mamba-scheduler-strategy"
170
+ - "--mamba-radix-cache-strategy"
167
171
  - "extra_buffer"
168
172
  - "--disable-overlap-schedule"
169
173
  - "--page-size"
@@ -174,7 +178,7 @@ profiles:
174
178
  - "32768"
175
179
  - "--max-running-requests"
176
180
  - "1"
177
- - "--cuda-graph-max-bs"
181
+ - "--cuda-graph-max-bs-decode"
178
182
  - "1"
179
183
 
180
184
  # H200-141GB: deliberately retain the measured H100 SM90 recipe and
@@ -210,7 +214,7 @@ profiles:
210
214
  - "bfloat16"
211
215
  - "--mamba-ssm-dtype"
212
216
  - "bfloat16"
213
- - "--mamba-scheduler-strategy"
217
+ - "--mamba-radix-cache-strategy"
214
218
  - "extra_buffer"
215
219
  - "--disable-overlap-schedule"
216
220
  - "--page-size"
@@ -221,7 +225,7 @@ profiles:
221
225
  - "32768"
222
226
  - "--max-running-requests"
223
227
  - "1"
224
- - "--cuda-graph-max-bs"
228
+ - "--cuda-graph-max-bs-decode"
225
229
  - "1"
226
230
  runtime:
227
231
  first_chunk_timeout_s: 900
@@ -255,7 +259,7 @@ profiles:
255
259
  - "bfloat16"
256
260
  - "--mamba-ssm-dtype"
257
261
  - "bfloat16"
258
- - "--mamba-scheduler-strategy"
262
+ - "--mamba-radix-cache-strategy"
259
263
  - "extra_buffer"
260
264
  - "--disable-overlap-schedule"
261
265
  - "--page-size"
@@ -266,7 +270,7 @@ profiles:
266
270
  - "32768"
267
271
  - "--max-running-requests"
268
272
  - "1"
269
- - "--cuda-graph-max-bs"
273
+ - "--cuda-graph-max-bs-decode"
270
274
  - "1"
271
275
 
272
276
  # RTX PRO 6000 96GB (SM120): retain FlashInfer and 2K prefill chunks from the
@@ -304,7 +308,7 @@ profiles:
304
308
  - "bfloat16"
305
309
  - "--mamba-ssm-dtype"
306
310
  - "bfloat16"
307
- - "--mamba-scheduler-strategy"
311
+ - "--mamba-radix-cache-strategy"
308
312
  - "extra_buffer"
309
313
  - "--disable-overlap-schedule"
310
314
  - "--page-size"
@@ -313,7 +317,7 @@ profiles:
313
317
  - "2048"
314
318
  - "--max-running-requests"
315
319
  - "1"
316
- - "--cuda-graph-max-bs"
320
+ - "--cuda-graph-max-bs-decode"
317
321
  - "1"
318
322
  runtime:
319
323
  first_chunk_timeout_s: 900
@@ -347,7 +351,7 @@ profiles:
347
351
  - "bfloat16"
348
352
  - "--mamba-ssm-dtype"
349
353
  - "bfloat16"
350
- - "--mamba-scheduler-strategy"
354
+ - "--mamba-radix-cache-strategy"
351
355
  - "extra_buffer"
352
356
  - "--disable-overlap-schedule"
353
357
  - "--page-size"
@@ -356,5 +360,5 @@ profiles:
356
360
  - "2048"
357
361
  - "--max-running-requests"
358
362
  - "1"
359
- - "--cuda-graph-max-bs"
363
+ - "--cuda-graph-max-bs-decode"
360
364
  - "1"