sie-server 0.8.2__tar.gz → 0.8.3__tar.gz
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- {sie_server-0.8.2 → sie_server-0.8.3}/PKG-INFO +4 -3
- sie_server-0.8.3/README.md +273 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/default.yaml +13 -5
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/transformers5.yaml +8 -2
- sie_server-0.8.3/models/convaiinnovations__laya-multilingual.yaml +24 -0
- sie_server-0.8.3/models/convaiinnovations__laya-typed-decisions.yaml +21 -0
- sie_server-0.8.3/models/convaiinnovations__laya.yaml +21 -0
- sie_server-0.8.3/models/fastino__GLiNER2.5-Decide-1B.yaml +38 -0
- sie_server-0.8.3/models/fastino__GLiNER2.5-Decide.yaml +28 -0
- sie_server-0.8.3/models/fastino__GLiNER2.5-multi-Decide.yaml +27 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__gliclass-base-v1.0.yaml +3 -0
- sie_server-0.8.3/models/knowledgator__gliclass-base-v3.0.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliclass-edge-v3.0.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliclass-instruct-base-v1.0.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliclass-instruct-edge-v1.0.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliclass-instruct-large-v1.0.yaml +29 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__gliclass-large-v1.0.yaml +3 -0
- sie_server-0.8.3/models/knowledgator__gliclass-multilang-edge.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliclass-multilang-mini.yaml +29 -0
- sie_server-0.8.3/models/knowledgator__gliformer-base-v1.yaml +23 -0
- sie_server-0.8.3/models/knowledgator__gliformer-large-v1.yaml +23 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__gliner-bi-base-v2.0.yaml +2 -0
- sie_server-0.8.3/models/knowledgator__gliner-bi-edge-v2.0.yaml +25 -0
- sie_server-0.8.3/models/knowledgator__gliner-bi-large-v2.0.yaml +25 -0
- sie_server-0.8.3/models/knowledgator__gliner-bi-small-v2.0.yaml +25 -0
- sie_server-0.8.3/models/knowledgator__gliner-pii-base-v1.0.yaml +22 -0
- sie_server-0.8.3/models/knowledgator__gliner-pii-edge-v1.0.yaml +22 -0
- sie_server-0.8.3/models/knowledgator__gliner-pii-large-v1.0.yaml +22 -0
- sie_server-0.8.3/models/knowledgator__gliner-pii-small-v1.0.yaml +22 -0
- sie_server-0.8.3/models/knowledgator__gliner-relex-large-v1.0.yaml +23 -0
- sie_server-0.8.3/models/knowledgator__opir-edge-multilang-v1.0.yaml +23 -0
- sie_server-0.8.3/models/knowledgator__opir-edge-v1.0.yaml +23 -0
- sie_server-0.8.3/models/knowledgator__opir-multitask-large-v1.0.yaml +32 -0
- sie_server-0.8.3/models/knowledgator__opir-multitask-multilang-v1.0.yaml +29 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/openapi.json +3 -3
- {sie_server-0.8.2 → sie_server-0.8.3}/pyproject.toml +12 -3
- sie_server-0.8.3/scripts/generate_gliformer_goldens.py +244 -0
- sie_server-0.8.3/scripts/generate_gliner2_decide_goldens.py +262 -0
- sie_server-0.8.3/scripts/generate_laya_fixtures.py +343 -0
- sie_server-0.8.3/src/sie_server/adapters/_modernbert_flash.py +196 -0
- sie_server-0.8.3/src/sie_server/adapters/_prompt_limit.py +131 -0
- sie_server-0.8.3/src/sie_server/adapters/_word_window.py +315 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/base.py +20 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colbert_modernbert_flash/adapter.py +27 -119
- sie_server-0.8.3/src/sie_server/adapters/gliclass/__init__.py +1912 -0
- sie_server-0.8.3/src/sie_server/adapters/gliclass/cuda_graphs.py +463 -0
- sie_server-0.8.3/src/sie_server/adapters/gliformer/adapter.py +1696 -0
- sie_server-0.8.3/src/sie_server/adapters/gliformer/output_schema.py +420 -0
- sie_server-0.8.3/src/sie_server/adapters/gliformer/relation_decoding.py +252 -0
- sie_server-0.8.3/src/sie_server/adapters/gliformer/span_decoding.py +542 -0
- sie_server-0.8.3/src/sie_server/adapters/gliformer/structuring_decoding.py +311 -0
- sie_server-0.8.3/src/sie_server/adapters/gliner/__init__.py +658 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/gliner2/adapter.py +384 -51
- sie_server-0.8.3/src/sie_server/adapters/gliner2/decide.py +739 -0
- sie_server-0.8.3/src/sie_server/adapters/gliner2/decisions.py +601 -0
- sie_server-0.8.3/src/sie_server/adapters/gliner2/words.py +136 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/gliner_bi/__init__.py +101 -20
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/glirel/__init__.py +172 -27
- sie_server-0.8.3/src/sie_server/adapters/laya/adapter.py +650 -0
- sie_server-0.8.3/src/sie_server/adapters/laya/model.py +259 -0
- sie_server-0.8.3/src/sie_server/adapters/laya/questions.py +630 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/modernbert_flash/__init__.py +26 -83
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/extract.py +21 -2
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openai_compat.py +16 -3
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openai_local.py +8 -3
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/options.py +4 -16
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/extract_cost.py +82 -8
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/runtime_options.py +28 -2
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/handlers/extract.py +25 -4
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/model_worker.py +29 -7
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/queue_executor.py +38 -8
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/inputs.py +99 -6
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/openapi.py +13 -2
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/requests.py +26 -2
- sie_server-0.8.3/tests/adapters/fixtures/laya/laya-multilingual.json +9623 -0
- sie_server-0.8.3/tests/adapters/fixtures/laya/laya-typed-decisions.json +9263 -0
- sie_server-0.8.3/tests/adapters/fixtures/laya/laya.json +9263 -0
- sie_server-0.8.3/tests/adapters/goldens/gliformer/knowledgator__gliformer-base-v1.json +2093 -0
- sie_server-0.8.3/tests/adapters/goldens/gliformer/knowledgator__gliformer-large-v1.json +1903 -0
- sie_server-0.8.3/tests/adapters/goldens/gliner2_decide/fastino__GLiNER2.5-Decide-1B.json +978 -0
- sie_server-0.8.3/tests/adapters/goldens/gliner2_decide/fastino__GLiNER2.5-Decide.json +978 -0
- sie_server-0.8.3/tests/adapters/goldens/gliner2_decide/fastino__GLiNER2.5-multi-Decide.json +978 -0
- sie_server-0.8.3/tests/adapters/test_gliclass_contracts.py +215 -0
- sie_server-0.8.3/tests/adapters/test_gliclass_cuda_graphs.py +571 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_gliclass_overflow_policy.py +13 -14
- sie_server-0.8.3/tests/adapters/test_gliclass_parity.py +590 -0
- sie_server-0.8.3/tests/adapters/test_gliclass_request_options.py +1222 -0
- sie_server-0.8.3/tests/adapters/test_gliformer.py +1750 -0
- sie_server-0.8.3/tests/adapters/test_gliformer_parity.py +193 -0
- sie_server-0.8.3/tests/adapters/test_gliformer_span_decoding.py +883 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_gliner2.py +27 -2
- sie_server-0.8.3/tests/adapters/test_gliner2_decide.py +895 -0
- sie_server-0.8.3/tests/adapters/test_gliner2_decide_parity.py +213 -0
- sie_server-0.8.3/tests/adapters/test_gliner2_long_text.py +484 -0
- sie_server-0.8.3/tests/adapters/test_gliner2_words.py +175 -0
- sie_server-0.8.3/tests/adapters/test_gliner_bi_label_cache.py +39 -0
- sie_server-0.8.3/tests/adapters/test_gliner_bi_metering.py +73 -0
- sie_server-0.8.3/tests/adapters/test_gliner_long_words.py +371 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_gliner_metering.py +2 -2
- sie_server-0.8.3/tests/adapters/test_gliner_relations.py +420 -0
- sie_server-0.8.3/tests/adapters/test_laya.py +498 -0
- sie_server-0.8.3/tests/adapters/test_laya_bounds.py +399 -0
- sie_server-0.8.3/tests/adapters/test_laya_model.py +166 -0
- sie_server-0.8.3/tests/adapters/test_laya_parity.py +138 -0
- sie_server-0.8.3/tests/adapters/test_prompt_limit.py +323 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_runtime_options.py +84 -135
- sie_server-0.8.3/tests/adapters/test_word_window.py +218 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_encode_validation.py +32 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_extract.py +326 -2
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_generate.py +12 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_openai_compat.py +17 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_openai_local.py +15 -0
- sie_server-0.8.3/tests/api/test_option.py +36 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_score.py +38 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_runtime_options.py +15 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_extract.py +29 -0
- sie_server-0.8.3/tests/processors/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_all_models.py +376 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_decode_item.py +6 -0
- sie_server-0.8.3/tests/test_item_text_size.py +142 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_queue_executor.py +348 -0
- sie_server-0.8.3/tests/type_defs/__init__.py +0 -0
- sie_server-0.8.2/README.md +0 -114
- sie_server-0.8.2/src/sie_server/adapters/gliclass/__init__.py +0 -414
- sie_server-0.8.2/src/sie_server/adapters/gliner/__init__.py +0 -362
- sie_server-0.8.2/tests/adapters/test_gliclass_contracts.py +0 -97
- {sie_server-0.8.2 → sie_server-0.8.3}/.gitignore +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/CONTRIBUTING.md +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/Dockerfile.cpu +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/Dockerfile.cuda12 +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/Dockerfile.cuda13 +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/LICENSE +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/candle.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/ctranslate2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/fake.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/sglang-cu130.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/sglang-embedding.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/sglang-vision-extract.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/sglang.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/bundles/tensorrt-llm.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Alibaba-NLP__gte-Qwen2-1.5B-instruct.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Alibaba-NLP__gte-Qwen2-7B-instruct.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Alibaba-NLP__gte-modernbert-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Alibaba-NLP__gte-multilingual-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Alibaba-NLP__gte-reranker-modernbert-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-base-en-v1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-large-en-v1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-m3.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-reranker-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-reranker-large.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-reranker-v2-m3.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-small-en-v1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/BAAI__bge-small-zh-v1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/EmergentMethods__gliner_large_news-v2.1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/GritLM__GritLM-7B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/IDEA-Research__grounding-dino-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/IDEA-Research__grounding-dino-tiny.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Ihor__gliner-biomed-large-v1.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Linq-AI-Research__Linq-Embed-Mistral.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Marqo__marqo-ecommerce-embeddings-B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Marqo__marqo-fashionSigLIP.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/MoritzLaurer__ModernBERT-base-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/MoritzLaurer__deberta-v3-base-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/MoritzLaurer__deberta-v3-large-zeroshot-v2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/NeuML__gliner-bert-tiny.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/NovaSearch__stella_en_1.5B_v5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/NovaSearch__stella_en_400M_v5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/PaddlePaddle__PaddleOCR-VL-1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-0.6B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-4B-Instruct-2507.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-Embedding-0.6B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-Embedding-4B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-Embedding-8B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-Reranker-0.6B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-Reranker-4B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-VL-8B-Instruct.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-VL-Embedding-2B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3-VL-Reranker-2B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3.5-4B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3.6-27B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3.6-35B-A3B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Qwen__Qwen3.8-27B-FP8.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Salesforce__SFR-Embedding-2_R.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Salesforce__SFR-Embedding-Mistral.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Snowflake__snowflake-arctic-embed-l-v2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Snowflake__snowflake-arctic-embed-m-v2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/Snowflake__snowflake-arctic-embed-s.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/TomoroAI__tomoro-colqwen3-embed-4b.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/WhereIsAI__UAE-Large-V1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/answerdotai__ModernBERT-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/answerdotai__ModernBERT-large.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/answerdotai__answerai-colbert-small-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/colbert-ir__colbertv2.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/cross-encoder__ms-marco-MiniLM-L-12-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/cross-encoder__ms-marco-MiniLM-L-6-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/cross-encoder__nli-deberta-v3-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/defog__sqlcoder-7b-2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/docling.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/facebook__bart-large-mnli.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/fastino__gliguard-LLMGuardrails-300M.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/fastino__gliner2-base-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/fastino__gliner2-large-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/gliner-community__gliner_large-v2.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/gliner-community__gliner_medium-v2.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/gliner-community__gliner_small-v2.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__embeddinggemma-300m.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__gemma-4-26B-A4B-it.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__gemma-4-31B-it.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__gemma-4-E2B-it.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__gemma-4-E4B-it.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__madlad400-3b-mt.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__owlv2-base-patch16-ensemble.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__owlv2-large-patch14-ensemble.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__siglip-base-patch16-256.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__siglip-so400m-patch14-224.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__siglip-so400m-patch14-384.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__siglip2-base-patch16-224.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/google__translategemma-4b-it.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/ibm-granite__granite-embedding-30m-sparse.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/ibm-granite__granite-embedding-97m-multilingual-r2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/ibm-granite__granite-embedding-english-r2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/ibm-granite__granite-embedding-small-english-r2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/ibm-granite__granite-guardian-3.0-2b.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__e5-base-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__e5-large-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__e5-mistral-7b-instruct.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__e5-small-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__multilingual-e5-large-instruct.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__multilingual-e5-large.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/intfloat__multilingual-e5-small.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jackboyla__glirel-large-v0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-colbert-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-base-code.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-base-de.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-base-en.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-base-es.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-base-zh.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-embeddings-v2-small-en.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/jinaai__jina-reranker-v2-base-multilingual.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__gliclass-large-v3.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__gliclass-small-v1.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/knowledgator__modern-gliner-bi-base-v1.0.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/laion__CLIP-ViT-B-32-laion2B-s34B-b79K.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/laion__CLIP-ViT-H-14-laion2B-s32B-b79K.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/lightonai__GTE-ModernColBERT-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/lightonai__LightOnOCR-2-1B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/lightonai__Reason-ModernColBERT.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/lightonai__mLateOn.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/microsoft__Florence-2-base-ft.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/microsoft__Florence-2-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/microsoft__Florence-2-large.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mixedbread-ai__mxbai-colbert-large-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mixedbread-ai__mxbai-edge-colbert-v0-32m.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mixedbread-ai__mxbai-embed-large-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mixedbread-ai__mxbai-rerank-base-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mixedbread-ai__mxbai-rerank-large-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/mynkchaudhry__Florence-2-FT-DocVQA.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/naver-clova-ix__donut-base-finetuned-cord-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/naver-clova-ix__donut-base-finetuned-docvqa.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/naver__splade-cocondenser-selfdistil.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/naver__splade-v3.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/naver__v-splade-quality.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nomic-ai__modernbert-embed-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nomic-ai__nomic-embed-text-v1.5.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nomic-ai__nomic-embed-text-v2-moe.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/numind__NuNER_Zero-span.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/numind__NuNER_Zero.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nvidia__NV-Embed-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nvidia__llama-embed-nemotron-8b.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nvidia__llama-nemoretriever-colembed-3b-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/nvidia__nemotron-colembed-vl-4b-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/openai__clip-vit-base-patch32.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/openai__clip-vit-large-patch14.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/openai__whisper-large-v3-turbo.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opendatalab__MinerU2.5-Pro-2604-1.2B.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-distill.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v2-mini.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-distill.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-doc-v3-gte.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/opensearch-project__opensearch-neural-sparse-encoding-v2-distill.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/prithivida__Splade_PP_en_v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/rasyosef__splade-mini.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/sentence-transformers__all-MiniLM-L6-v2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/sie-fake.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/sugiv__stablebridge-pruner-highlighter.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/tencent__R3-embedding-0.6b.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/tencent__R3-rerank-0.6b.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/thenlper__gte-base.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/thenlper__gte-large.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/thenlper__gte-small.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/topk-io__Iso-ModernColBERT.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/urchade__gliner_large-v2.1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/urchade__gliner_medium-v2.1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/urchade__gliner_multi-v2.1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/urchade__gliner_multi_pii-v1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/urchade__gliner_small-v2.1.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/vidore__colSmol-256M.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/vidore__colpali-v1.3-hf.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/vidore__colqwen2.5-v0.2.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/zai-org__GLM-5.3-Flash.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/models/zai-org__GLM-OCR.yaml +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/scripts/generate_tokenize_fixture.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/_ipc_test_harness.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapter_call_loop.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_base_adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_colbert_projection.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_colbert_utils.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_flash_base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_flash_pack.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_generation_base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_multivector.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_pylate_dense.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_spec.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_types.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_utils.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/_vision_patch_embed.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bert_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bge_m3/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bge_m3_flag/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bge_m3_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/bge_m3_score_mixin.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/clip/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colbert/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colbert_modernbert_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colbert_rotary_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colpali/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colqwen2/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colqwen3/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/colsmol/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/cross_encoder/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/ctranslate2/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/ctranslate2/generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/docling/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/docling/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/donut/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/errors.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/fake/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/fake/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/florence2/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/gliner2 → sie_server-0.8.3/src/sie_server/adapters/gliformer}/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/grounding_dino → sie_server-0.8.3/src/sie_server/adapters/gliner2}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/gliner2/classification.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/glm_ocr/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/lighton_ocr → sie_server-0.8.3/src/sie_server/adapters/grounding_dino}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/grounding_dino/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/gte_sparse_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/jina_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/mlx → sie_server-0.8.3/src/sie_server/adapters/laya}/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/owlv2 → sie_server-0.8.3/src/sie_server/adapters/lighton_ocr}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/lighton_ocr/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/lora.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/mineru_vl/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/qwen2_flash_cross_encoder → sie_server-0.8.3/src/sie_server/adapters/mlx}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/mlx/_server.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/mlx/generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/modernbert_flash_cross_encoder/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/nemo_colembed/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/nli_classification/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/nli_classification_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/nomic_flash/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/qwen3_vl_reranker → sie_server-0.8.3/src/sie_server/adapters/owlv2}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/owlv2/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/paddleocr_vl/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/peft_lora_mixin.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/pytorch_embedding/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/qwen2_flash/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/sglang → sie_server-0.8.3/src/sie_server/adapters/qwen2_flash_cross_encoder}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/qwen2_flash_cross_encoder/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/qwen3_vl_embedding/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/sglang/_compat → sie_server-0.8.3/src/sie_server/adapters/qwen3_vl_reranker}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/qwen3_vl_reranker/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/rope_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sentence_transformer/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/sglang_vision_extract → sie_server-0.8.3/src/sie_server/adapters/sglang}/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/sglang_vision_extract → sie_server-0.8.3/src/sie_server/adapters/sglang}/_compat/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/_compat/sitecustomize.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/_server.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/cuda13.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/embedding.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/gemma.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang/generation.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/siglip → sie_server-0.8.3/src/sie_server/adapters/sglang_vision_extract}/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/splade_flash → sie_server-0.8.3/src/sie_server/adapters/sglang_vision_extract/_compat}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang_vision_extract/_compat/sitecustomize.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/sglang_vision_extract/adapter.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/st_sparse_vision → sie_server-0.8.3/src/sie_server/adapters/siglip}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/siglip/adapter.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/tensorrt_llm → sie_server-0.8.3/src/sie_server/adapters/splade_flash}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/splade_flash/adapter.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/tensorrt_llm/_compat → sie_server-0.8.3/src/sie_server/adapters/st_sparse_vision}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/st_sparse_vision/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/stablebridge_pruner/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/adapters/whisper → sie_server-0.8.3/src/sie_server/adapters/tensorrt_llm}/__init__.py +0 -0
- {sie_server-0.8.2/src/sie_server/app → sie_server-0.8.3/src/sie_server/adapters/tensorrt_llm/_compat}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/tensorrt_llm/_compat/sitecustomize.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/tensorrt_llm/_server.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/tensorrt_llm/compat.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/tensorrt_llm/generation.py +0 -0
- {sie_server-0.8.2/src/sie_server/config → sie_server-0.8.3/src/sie_server/adapters/whisper}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/whisper/adapter.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/adapters/xlm_roberta_flash/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/encode.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/generate.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/health.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/helpers.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/models.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openai_audio.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openai_completions.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openai_responses.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/openapi.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/root.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/score.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/serialization.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/validation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/api/ws.py +0 -0
- {sie_server-0.8.2/src/sie_server/health → sie_server-0.8.3/src/sie_server/app}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/app/app_factory.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/app/app_state_config.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/bundle_requirements.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/cli.py +0 -0
- {sie_server-0.8.2/src/sie_server/observability → sie_server-0.8.3/src/sie_server/config}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/config/device_groups.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/config/engine.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/config/model.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/config/package_artifacts.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/config/serving_artifacts.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/adaptive_batching.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/batcher.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/deps.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/disk_cache.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/encode_pipeline.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/gpu_health.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/hf_env.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/hot_reload.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/inference.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/inference_output.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/load_errors.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/loader.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/logging.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/memory.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/model_loader.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/model_suggestions.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/oom.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/pool_isolation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/postprocessor.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/postprocessor_registry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/prepared.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/audio.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/image.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/text.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor/vision.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/preprocessor_registry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/readiness.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/registry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/residency.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/score_cost.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/shutdown.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/text_tokens.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/timing.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/tokenizer.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/video_frames.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/watcher.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/handlers/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/handlers/base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/handlers/encode.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/handlers/score.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/oom_recovery.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/core/worker/types.py +0 -0
- {sie_server-0.8.2/src/sie_server/processors → sie_server-0.8.3/src/sie_server/health}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/health/saturation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/ipc_server.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/ipc_types.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/local_ingest_client.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/main.py +0 -0
- {sie_server-0.8.2/tests/adapters → sie_server-0.8.3/src/sie_server/observability}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/observability/generation_diagnostics.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/observability/gpu.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/observability/telemetry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/observability/tracing.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/observability/worker_telemetry.py +0 -0
- {sie_server-0.8.2/tests/api → sie_server-0.8.3/src/sie_server/processors}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/admission.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/grammar_cache.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/grammar_compile.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/streaming.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/tool_call_grammar.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/tool_call_parser.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/processors/work_class_scheduler.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/grammar.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/outputs.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/overflow_policy.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/src/sie_server/types/responses.py +0 -0
- {sie_server-0.8.2/tests/app → sie_server-0.8.3/tests/adapters}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_adapter_revision_contract.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_bge_m3.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_bge_m3_flash.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_clip.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colbert.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colbert_modernbert_flash_projection.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colbert_modernbert_flash_tokenizer.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colbert_projection.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colbert_punctuation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_colqwen2_revision.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_ctranslate2_generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_docling.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_docling_smoke.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_donut.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_factory_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_fake.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_fake_catalog.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_fake_faults.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_flash_base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_flash_pack.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_florence2.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_generation_base.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_gliner_merge.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_glirel.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_glm_ocr.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_grounding_dino.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_gte_sparse.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_image_decode_errors.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_jina_flash_cross_encoder.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_lighton_ocr.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_lora.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_lora_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_mineru_vl.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_mlx_generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_multivector.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_owlv2.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_paddleocr_vl.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_pylate_dense.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_pytorch_embedding_model_encode.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_pytorch_embedding_revision.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_qwen2_flash_cross_encoder.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_qwen3_vl_embedding.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_qwen3_vl_reranker.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sentence_transformer.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sglang.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sglang_generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sglang_launch_flags.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sglang_vision_extract.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_siglip.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_siglip_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_sparse_aggregation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_splade_flash_parity.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_splade_packed_parity.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_splade_roberta_position_ids.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_st_sparse_vision.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_stablebridge_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_stablebridge_pruner.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_tensorrt_llm_compat.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_tensorrt_llm_generation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_vision_patch_embed.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_visual_document.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_visual_muvera_postprocessors.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/adapters/test_whisper.py +0 -0
- {sie_server-0.8.2/tests/config → sie_server-0.8.3/tests/api}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_canonical_profile_conformance.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_dtype_queue_http_parity.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_encode_dtype.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_encode_endpoint.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_encode_json_schema.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_encode_timing.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_error_code_hygiene.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_extract_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_extract_oom.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_generate_stream.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_generation_cleanup_precedence.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_health.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_helpers_telemetry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_models.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_openai_audio.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_openai_completions.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_openai_responses.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_request_body_limit.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_usage_reporting.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_version_header.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/api/test_ws.py +0 -0
- {sie_server-0.8.2/tests/core → sie_server-0.8.3/tests/app}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/app/test_app_factory.py +0 -0
- {sie_server-0.8.2/tests/core/worker → sie_server-0.8.3/tests/config}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_answerai_colbert_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_bundle_coverage.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_catalog_loadtime_options.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_colbertv2_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_config.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_generation_mode_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_gte_modern_colbert_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_h100_fp8_generation_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_jina_colbert_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_model_prewarm_grammars.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_muvera_profile_postprocessors.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_mxbai_colbert_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_mxbai_edge_colbert_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_nvidia_nemo_colembed_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_package_artifacts.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_profile_backend_consistency.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_profile_template_inheritance.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_qwen38_generation_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_qwen_generation_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_serving_artifact_config.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_serving_artifacts.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_tensor_parallel_options.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_video_generation_profiles.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/config/test_visual_muvera_containment.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/conftest.py +0 -0
- {sie_server-0.8.2/tests/fake_stack → sie_server-0.8.3/tests/core}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_adaptive_batching.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_batcher.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_bundle_requirements.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_disk_cache.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_encode_format_output.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_encode_worker_batching.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_gpu_health.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_hot_reload.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_idle_evict.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_inference.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_load_rgb.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_loader.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_logging.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_lora_generation_exclusion.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_memory.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_memory_synthetic.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_model_load_timeout.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_model_loader_cache.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_model_suggestions.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_oom_detection.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_pool_isolation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_postprocessor.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_postprocessor_registry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_prepared.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_preprocessor.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_preprocessor_registry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_quantization.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_readiness.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_async.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_core.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_deps.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_device_groups.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_failed_state.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_generation_drain.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_lifecycle_loop.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_memory.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_registry_multi_model.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_residency.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_revision_identity.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_shutdown.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_timing.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_unload_off_event_loop.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_video_frames.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_watcher.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_backpressure.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_core.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_drain.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_lora.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_options.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_preformed.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/test_worker_score.py +0 -0
- {sie_server-0.8.2/tests/health → sie_server-0.8.3/tests/core/worker}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/core/worker/test_oom_recovery.py +0 -0
- {sie_server-0.8.2/tests/integration → sie_server-0.8.3/tests/fake_stack}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/conftest.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/test_lost_result.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/test_model_loading_race.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/test_oom_ladder.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/test_registry_races.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/fake_stack/test_sdk_surface.py +0 -0
- {sie_server-0.8.2/tests/observability → sie_server-0.8.3/tests/health}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/health/test_saturation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/health/test_worker_id_consistency.py +0 -0
- {sie_server-0.8.2/tests/processors → sie_server-0.8.3/tests/integration}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/integration/test_chat_completions.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/integration/test_grammar_generate.py +0 -0
- {sie_server-0.8.2/tests/type_defs → sie_server-0.8.3/tests/observability}/__init__.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_generation_diagnostics.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_telemetry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_trace_propagation.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_tracing.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_worker_telemetry.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/observability/test_worker_telemetry_benchmark.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_grammar_cache.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_grammar_compile.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_grammar_prewarm.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_streaming.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_streaming_admission.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_streaming_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_tool_call_grammar.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_tool_call_parser.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/processors/test_work_class_scheduler.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_adapter_call_loop.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_cli_devices.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_cli_log_level.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_cli_pool.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_docker_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_documented_model_ids.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_ipc_server.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_ipc_types_raw_output.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_local_ingest_client.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_metering_units.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_model_yaml_filenames.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_openapi_export.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_parity_run_batch.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_queue_executor_stage1d.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_readiness.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_sdk_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_server_process_fixture.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_server_smoke.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_sparse_integration.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/test_stage1d_byte_identity.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/type_defs/test_decode_image.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/type_defs/test_inputs.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/type_defs/test_inputs_json_decode.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/type_defs/test_media_bytes.py +0 -0
- {sie_server-0.8.2 → sie_server-0.8.3}/tests/type_defs/test_types.py +0 -0
|
@@ -1,6 +1,6 @@
|
|
|
1
1
|
Metadata-Version: 2.5
|
|
2
2
|
Name: sie-server
|
|
3
|
-
Version: 0.8.
|
|
3
|
+
Version: 0.8.3
|
|
4
4
|
Summary: Search Inference Engine - GPU inference server for search workloads
|
|
5
5
|
License: Apache-2.0
|
|
6
6
|
License-File: LICENSE
|
|
@@ -10,9 +10,10 @@ Requires-Dist: docling<2.100,>=2.99
|
|
|
10
10
|
Requires-Dist: einops<1,>=0.8
|
|
11
11
|
Requires-Dist: fastapi<1,>=0.115
|
|
12
12
|
Requires-Dist: flagembedding<2,>=1.3
|
|
13
|
-
Requires-Dist: gliclass<1,>=0.1
|
|
13
|
+
Requires-Dist: gliclass<1,>=0.1.17
|
|
14
|
+
Requires-Dist: gliformer==0.1.2
|
|
14
15
|
Requires-Dist: gliner2<2,>=1.3.1
|
|
15
|
-
Requires-Dist: gliner<1,>=0.2
|
|
16
|
+
Requires-Dist: gliner<1,>=0.2.26
|
|
16
17
|
Requires-Dist: glirel<2,>=1.0
|
|
17
18
|
Requires-Dist: httpx>=0.28.1
|
|
18
19
|
Requires-Dist: huggingface-hub<2,>=0.26
|
|
@@ -0,0 +1,273 @@
|
|
|
1
|
+
# SIE Server
|
|
2
|
+
|
|
3
|
+
GPU inference server for embeddings, reranking, and entity extraction.
|
|
4
|
+
|
|
5
|
+
## Features
|
|
6
|
+
|
|
7
|
+
- Multi-model serving with LRU eviction
|
|
8
|
+
- Token-based dynamic batching
|
|
9
|
+
- Hot reload model configs without restart
|
|
10
|
+
- Unified API: `encode()`, `score()`, `extract()`
|
|
11
|
+
- Prometheus metrics and OpenTelemetry tracing
|
|
12
|
+
- Reactive GPU OOM recovery + proactive idle eviction
|
|
13
|
+
|
|
14
|
+
## Installation
|
|
15
|
+
|
|
16
|
+
```bash
|
|
17
|
+
pip install sie-server
|
|
18
|
+
```
|
|
19
|
+
|
|
20
|
+
`sie-server` ships several model bundles, and a single environment can only hold one
|
|
21
|
+
`transformers` version — install the one your bundle needs:
|
|
22
|
+
|
|
23
|
+
- **Default bundle** (embeddings, reranking, extraction) — verified on `transformers` 4.x:
|
|
24
|
+
|
|
25
|
+
```bash
|
|
26
|
+
pip install sie-server "transformers<5"
|
|
27
|
+
```
|
|
28
|
+
|
|
29
|
+
- **Transformers 5 bundle** (LightOnOCR, GLM-OCR, GLiGuard, and the GLiNER2.5-Decide models) — requires
|
|
30
|
+
`transformers` 5.x, and is served with `-b transformers5`. The GLiNER2.5-Decide models also need `gliner2`
|
|
31
|
+
2.x. `sie-server` itself asks for `gliner2<2`, which the default bundle's GLiNER2 models need, so pip
|
|
32
|
+
reports that conflict when the second command below installs 2.x; the transformers5 bundle's GLiNER2
|
|
33
|
+
models are verified on 2.0.0:
|
|
34
|
+
|
|
35
|
+
```bash
|
|
36
|
+
pip install sie-server "transformers>=5,<6"
|
|
37
|
+
pip install "gliner2==2.0.0" # only for the GLiNER2.5-Decide models
|
|
38
|
+
sie-server serve -b transformers5
|
|
39
|
+
```
|
|
40
|
+
|
|
41
|
+
## Quick Start
|
|
42
|
+
|
|
43
|
+
```bash
|
|
44
|
+
sie-server serve --port 8080 --device cuda:0
|
|
45
|
+
```
|
|
46
|
+
|
|
47
|
+
### TensorRT-LLM generation
|
|
48
|
+
|
|
49
|
+
TensorRT-LLM buffers completion token IDs and emits the final text together only
|
|
50
|
+
after generation finishes and the terminal stream is verified, even with
|
|
51
|
+
`stream=True`. This preserves context-sensitive spacing and punctuation and
|
|
52
|
+
removes matched stop sequences consistently from returned text, completion-token
|
|
53
|
+
usage, and logprobs. Long completions delay the first visible text; existing
|
|
54
|
+
request timeouts still apply. Other adapters are unaffected.
|
|
55
|
+
|
|
56
|
+
### GLiClass usage
|
|
57
|
+
|
|
58
|
+
For GLiClass classification, `usage.input_tokens` counts each item's document
|
|
59
|
+
tokens plus the instruction and few-shot example texts sent with the request,
|
|
60
|
+
because the model encodes that text again for every item. Label names,
|
|
61
|
+
including the labels attached to examples, are not counted. With an
|
|
62
|
+
instruction or examples, an item's count is capped at the model's
|
|
63
|
+
`max_sequence_length` minus the label prompt, unless the document count alone
|
|
64
|
+
is already higher. An item refused because its document pushes the labels out
|
|
65
|
+
of the window returns a per-item `INPUT_TOO_LONG` error and counts nothing. A
|
|
66
|
+
request that sends no instruction or examples is counted exactly as before.
|
|
67
|
+
|
|
68
|
+
The instruction and each example text may be at most 2,048 characters, and
|
|
69
|
+
together with the example labels at most 8,192 characters. Up to 32 examples
|
|
70
|
+
are accepted, and they must leave room for the document in the model window.
|
|
71
|
+
Label names are refused when their total length exceeds 16 characters per
|
|
72
|
+
token of the window (8,192 characters for a 512-token model), more than any
|
|
73
|
+
label prompt can fit.
|
|
74
|
+
|
|
75
|
+
### GLiClass CUDA graphs
|
|
76
|
+
|
|
77
|
+
A GLiClass forward on a DeBERTa encoder launches about a thousand small GPU
|
|
78
|
+
kernels, so at small batch sizes the CPU that launches them is the bottleneck.
|
|
79
|
+
A CUDA graph records the kernel launches of one input shape once; a replay
|
|
80
|
+
launches them all in one call. Graphs are an operator setting, fixed when the
|
|
81
|
+
model loads, in the model profile:
|
|
82
|
+
|
|
83
|
+
```yaml
|
|
84
|
+
profiles:
|
|
85
|
+
default:
|
|
86
|
+
adapter_options:
|
|
87
|
+
loadtime:
|
|
88
|
+
cuda_graphs: bucketed
|
|
89
|
+
```
|
|
90
|
+
|
|
91
|
+
| Value | Shapes recorded | Scores |
|
|
92
|
+
|--|--|--|
|
|
93
|
+
| `off` (default) | none | eager |
|
|
94
|
+
| `exact` | each (batch, sequence length, label slots) seen twice | bit-identical to eager |
|
|
95
|
+
| `bucketed` | sequence lengths padded up to a multiple of 32 tokens (64 on 1,024-token models) | padding moves fp16 probabilities (see below) |
|
|
96
|
+
|
|
97
|
+
A request can send `options={"cuda_graphs": "off"}` to run eagerly on a model
|
|
98
|
+
loaded with graphs. It cannot turn graphs on: any other value is refused.
|
|
99
|
+
|
|
100
|
+
Padding is masked, but a longer sequence rounds fp16 sums differently, the same
|
|
101
|
+
kind of change batching requests together makes. We compared `bucketed` with
|
|
102
|
+
eager execution on the 384 CVE descriptions from `examples/typed-decisions`,
|
|
103
|
+
three questions each, asked one at a time, as separate groups and as joint
|
|
104
|
+
groups, plus 65 long documents. Each input was sent three times (long
|
|
105
|
+
documents twice), so that graphs were recorded and then replayed: 11,538
|
|
106
|
+
answers per model. A small change can still flip a near tie between the top
|
|
107
|
+
two labels:
|
|
108
|
+
|
|
109
|
+
| Model | Largest probability change | Top label changed | Shipped profile |
|
|
110
|
+
|--|--|--|--|
|
|
111
|
+
| `gliclass-small-v1.0` | 0.0039 | 3 answers | `off` |
|
|
112
|
+
| `gliclass-base-v1.0` | 0.0049 | none | `bucketed` |
|
|
113
|
+
| `gliclass-large-v1.0` | 0.0056 | none | `bucketed` |
|
|
114
|
+
| `gliclass-base-v3.0` | 0.0054 | 3 | `off` |
|
|
115
|
+
| `gliclass-large-v3.0` | 0.0093 | 3 | `off` |
|
|
116
|
+
| `gliclass-instruct-base-v1.0` | 0.0076 | 12 | `off` |
|
|
117
|
+
| `gliclass-instruct-large-v1.0` | 0.0098 | 18 | `off` |
|
|
118
|
+
| `opir-multitask-large-v1.0` | 0.0144 | none | `bucketed` |
|
|
119
|
+
| `gliclass-multilang-mini` (100 descriptions, no joint groups: 2,016 answers) | 0.0227 | 3 | `off` |
|
|
120
|
+
|
|
121
|
+
`exact` changed nothing.
|
|
122
|
+
|
|
123
|
+
The shipped profiles load with `bucketed` graphs only where no top label
|
|
124
|
+
changed: `gliclass-base-v1.0`, `gliclass-large-v1.0` and
|
|
125
|
+
`opir-multitask-large-v1.0`. Their probabilities can differ from eager
|
|
126
|
+
execution by up to the amounts above. To run one of them eagerly, set
|
|
127
|
+
`cuda_graphs: off` in its profile, or send `options={"cuda_graphs": "off"}` with
|
|
128
|
+
a request. The other models load with `off`.
|
|
129
|
+
|
|
130
|
+
Graphs apply on CUDA to the DeBERTa-based GLiClass models: the v1.0 models,
|
|
131
|
+
`gliclass-base-v3.0` and `gliclass-large-v3.0`, the base and large instruct
|
|
132
|
+
models, the Opir multitask models and `gliclass-multilang-mini`. The
|
|
133
|
+
ModernBERT-based models (the edge models, `gliclass-multilang-edge` and the
|
|
134
|
+
Opir edge models), CPU and MPS run eagerly with any value, and the load logs a
|
|
135
|
+
warning.
|
|
136
|
+
|
|
137
|
+
Nothing is recorded at load. A shape is recorded the first time a request
|
|
138
|
+
needs it (the second time in `exact` mode), and that request takes a little
|
|
139
|
+
over two eager forwards (76 ms against 33 ms on `gliclass-large-v1.0` on an
|
|
140
|
+
L4). A model keeps at most 64 graphs, least recently used first
|
|
141
|
+
out. A graph holds at most 2,048 tokens (batch times padded length); larger
|
|
142
|
+
forwards are bound by the GPU rather than by kernel launches and run eagerly.
|
|
143
|
+
|
|
144
|
+
**Memory, and other models on the same GPU.** Graph memory counts as device
|
|
145
|
+
memory in use, but it is not attributed to the model: under memory pressure
|
|
146
|
+
the server evicts whole models, least recently used first, which may be
|
|
147
|
+
another model. A model's graphs share one memory pool, and the driver keeps a
|
|
148
|
+
copy of each graph: about 8 MB for a `gliclass-large-v1.0` forward. On
|
|
149
|
+
`gliclass-large-v1.0` in `bucketed` mode, the 31 graphs recorded for the CVE
|
|
150
|
+
descriptions above took 555 MB of device memory: 490 MB for the pool and
|
|
151
|
+
the graphs, 60 MB cached on the recording stream (its cuBLAS workspace and one
|
|
152
|
+
warm-up row) and 5 MB of relative-position tables. The pool keeps what evicted
|
|
153
|
+
graphs used, so traffic with many shapes keeps growing it. The runner therefore
|
|
154
|
+
adds up the device memory its graphs hold (what each recording took, plus the
|
|
155
|
+
tables and buffers they read), and past 4% of the device's memory (900 MB on
|
|
156
|
+
an L4) it drops every graph, returns their memory to the device and records
|
|
157
|
+
again. Graphs are also released when the model unloads, and
|
|
158
|
+
when one of its forwards runs out of memory.
|
|
159
|
+
|
|
160
|
+
While a graph records, PyTorch's caching allocator does not free cached blocks
|
|
161
|
+
to satisfy other allocations, so another model on the same GPU that needs
|
|
162
|
+
memory in that window (about one forward) can run out of memory where it
|
|
163
|
+
otherwise would not. Recording is kept rare to limit this: one recording at a
|
|
164
|
+
time in the process, none while less than a tenth of the device's memory is
|
|
165
|
+
free, and per model at most 16 recordings at once, then one per 2 seconds. If a
|
|
166
|
+
recording itself runs out of memory, the request still gets its eager answer;
|
|
167
|
+
the model drops its graphs and records nothing for a minute.
|
|
168
|
+
|
|
169
|
+
Both limits are approximate. The free-memory check reads the device once,
|
|
170
|
+
before recording, so a model loading at the same moment can still meet one
|
|
171
|
+
recording. The memory budget is checked after each recording, so a model's
|
|
172
|
+
graphs can exceed it by one recording: up to about 330 MB, one graph of the
|
|
173
|
+
largest shape on `gliclass-large-v1.0`. On a GPU shared with other models,
|
|
174
|
+
leave memory headroom, or enable graphs only where the model has the GPU to
|
|
175
|
+
itself. Usage and billing do not change.
|
|
176
|
+
|
|
177
|
+
### GLiNER2.5-Decide usage and limits
|
|
178
|
+
|
|
179
|
+
The GLiNER2.5-Decide models (`fastino/GLiNER2.5-Decide`, `GLiNER2.5-multi-Decide`,
|
|
180
|
+
`GLiNER2.5-Decide-1B`) run on `gliner2` 2.x, which the transformers5 bundle
|
|
181
|
+
pins (the `transformers5` image, or a native install as described above). Each
|
|
182
|
+
item is one encoder row: every question's (or label group's) name,
|
|
183
|
+
instruction, and labels, then the document. One forward pass answers them all,
|
|
184
|
+
so the questions of a request are not independent: adding or changing one can
|
|
185
|
+
change another's probabilities and score. `usage.input_tokens` counts the
|
|
186
|
+
document tokens the model reads plus the tokens of the instructions and label
|
|
187
|
+
descriptions (criteria) sent with the item, as Laya and GLiClass count
|
|
188
|
+
instructions and criteria. Question ids, group names, and label names are not
|
|
189
|
+
counted, and an item that returns an error counts nothing.
|
|
190
|
+
|
|
191
|
+
A request takes at most 64 questions or label groups, 64 options per question,
|
|
192
|
+
and 1,024 options in total. Question ids and group names may have 128
|
|
193
|
+
characters, labels 256, and each instruction or description 2,048, with 65,536
|
|
194
|
+
characters in all. Strings that contain one of the model's prompt markers
|
|
195
|
+
(`[L]`, `[P]`, `[DESCRIPTION]`, ...) are refused. The questions may take at most
|
|
196
|
+
512 tokens, or half the model's window when that is less: 256 of
|
|
197
|
+
`GLiNER2.5-Decide`'s 512 tokens, 512 of the others' 2,048. This bounds the
|
|
198
|
+
uncounted question and label tokens read with each item; a request needing more
|
|
199
|
+
fails with `INPUT_TOO_LONG`. The
|
|
200
|
+
document is read up to the whole words that fit in the rest of the window; a
|
|
201
|
+
word longer than 4,096 characters, text past 64 characters per token of the
|
|
202
|
+
window, or 4 words per token of the window also ends what is read. Words are
|
|
203
|
+
split as gliner2 splits them, in linear time. A conversation (a list state) is
|
|
204
|
+
read from its newest turn back; a run of more than 4,096 characters without a
|
|
205
|
+
space is read only in its last 4,096 characters, and reading stops there. An item none of whose words fits, or that does
|
|
206
|
+
not fit whole with `options={"overflow_policy": "error"}`, returns a per-item
|
|
207
|
+
`INPUT_TOO_LONG` error while the other items succeed.
|
|
208
|
+
|
|
209
|
+
## Configuration
|
|
210
|
+
|
|
211
|
+
`sie-server` reads its config from `SIE_*` environment variables (Pydantic
|
|
212
|
+
`BaseSettings`). Common knobs:
|
|
213
|
+
|
|
214
|
+
### Memory & OOM resilience
|
|
215
|
+
|
|
216
|
+
| Env var | Default | Effect |
|
|
217
|
+
|--|--|--|
|
|
218
|
+
| `SIE_MEMORY_PRESSURE_THRESHOLD_PERCENT` | `95` | VRAM utilisation that triggers reactive LRU eviction by the pressure monitor. |
|
|
219
|
+
| `SIE_OOM_RECOVERY__ENABLED` | `true` | Master switch for reactive OOM recovery in the worker dispatch path (`cache_clear → evict_lru → split_batch`). |
|
|
220
|
+
| `SIE_OOM_RECOVERY__STRATEGY` | `cache_clear,evict_lru,split_batch` | Ordered recovery actions. Earlier actions tried first. |
|
|
221
|
+
| `SIE_OOM_RECOVERY__MAX_SPLIT_DEPTH` | `4` | Cap on recursive batch halving (≤16 sub-batches). |
|
|
222
|
+
| `SIE_OOM_RECOVERY__EVICTION_LOCK_TIMEOUT_S` | `5.0` | Soft timeout when waiting for the registry's load-lock during recovery eviction. |
|
|
223
|
+
| `SIE_OOM_RECOVERY__RETRY_AFTER_S` | `5` | `Retry-After` header value on `RESOURCE_EXHAUSTED` responses. |
|
|
224
|
+
| `SIE_DISABLE_OOM_RECOVERY` | unset | Convenience kill switch (`1`/`true`/`yes`) for incident triage. Wins over `SIE_OOM_RECOVERY__ENABLED=true`. |
|
|
225
|
+
| `SIE_IDLE_EVICT_S` | unset (disabled) | Unload models that have been idle longer than this (seconds). Additive to the pressure monitor; helps free cold weights before pressure builds. |
|
|
226
|
+
| `SIE_OOM_NAK_DELAY_S` | `10.0` | Queue-mode only. NAK delay (seconds) for `RESOURCE_EXHAUSTED` work items so JetStream redelivers them after memory pressure has had a chance to clear. |
|
|
227
|
+
|
|
228
|
+
When OOM recovery is exhausted on a request, the server returns
|
|
229
|
+
`HTTP 503 RESOURCE_EXHAUSTED` with `Retry-After`. The Python SDK
|
|
230
|
+
auto-retries; see `packages/sie_sdk/README.md` for client-side controls.
|
|
231
|
+
|
|
232
|
+
### Batching & request handling
|
|
233
|
+
|
|
234
|
+
| Env var | Default | Effect |
|
|
235
|
+
|--|--|--|
|
|
236
|
+
| `SIE_MAX_BATCH_REQUESTS` | `64` | Maximum number of items per batched inference call. |
|
|
237
|
+
| `SIE_MAX_BATCH_WAIT_MS` | `15.0` | Initial value for the adaptive first-request batch timeout. At runtime the PI batching controller steers it between `SIE_ADAPTIVE_BATCHING__MIN_WAIT_MS` and `SIE_ADAPTIVE_BATCHING__MAX_WAIT_MS`, so it is a starting point rather than a fixed wait. |
|
|
238
|
+
| `SIE_MAX_CONCURRENT_REQUESTS` | `512` | Per-worker queue size; admission control returns `QUEUE_FULL` above this. |
|
|
239
|
+
| `SIE_MAX_LORAS_PER_MODEL` | `10` | Maximum concurrent LoRA adapters per base model. |
|
|
240
|
+
| `SIE_MAX_ITEM_TEXT_BYTES` | `2097152` (2 MiB) | Most bytes of UTF-8 one encode, score, or extract item may carry in its `text` and `metadata` together. A larger item is rejected with `INVALID_INPUT` (HTTP 400) before it is tokenized. Generation prompts are not items and are not affected. |
|
|
241
|
+
|
|
242
|
+
### Compute & precision
|
|
243
|
+
|
|
244
|
+
| Env var | Default | Effect |
|
|
245
|
+
|--|--|--|
|
|
246
|
+
| `SIE_DEFAULT_COMPUTE_PRECISION` | `float16` | One of `float16`, `bfloat16`, `float32`. |
|
|
247
|
+
| `SIE_ATTENTION_BACKEND` | `auto` | One of `auto`, `flash_attention_2`, `sdpa`, `eager`. |
|
|
248
|
+
|
|
249
|
+
### Diagnostics
|
|
250
|
+
|
|
251
|
+
| Env var | Default | Effect |
|
|
252
|
+
|--|--|--|
|
|
253
|
+
| `SIE_GRAMMAR_PREFLIGHT_DEBUG` | unset (off) | Enables the legacy worker-side Outlines preflight compile before each structured-output request. Off by default because SGLang is the production grammar authority. Use for diagnosing schema-rejection problems or slow compiles in a controlled environment; not recommended for production traffic. |
|
|
254
|
+
|
|
255
|
+
For nested settings (any field with `__`), the env-var format is
|
|
256
|
+
`SIE_<TOP>__<NESTED>=value`. The complete schema is in
|
|
257
|
+
`packages/sie_server/src/sie_server/config/engine.py`.
|
|
258
|
+
|
|
259
|
+
## Observability
|
|
260
|
+
|
|
261
|
+
The server emits the checked-in worker telemetry contract once through
|
|
262
|
+
OpenTelemetry/OTLP. The regional collector owns Prometheus exposition and
|
|
263
|
+
optional remote OTLP routing; the application does not expose `/metrics` or
|
|
264
|
+
maintain a second Prometheus registry. See `telemetry/contract.yaml` for exact
|
|
265
|
+
instrument names, dimensions, ownership, and histogram bounds.
|
|
266
|
+
|
|
267
|
+
## API
|
|
268
|
+
|
|
269
|
+
See the [API documentation](https://sie.dev/docs) for details.
|
|
270
|
+
|
|
271
|
+
## License
|
|
272
|
+
|
|
273
|
+
Apache 2.0
|
|
@@ -41,6 +41,8 @@ adapters:
|
|
|
41
41
|
- sie_server.adapters.gliner_bi
|
|
42
42
|
- sie_server.adapters.glirel
|
|
43
43
|
- sie_server.adapters.gliclass
|
|
44
|
+
- sie_server.adapters.laya.adapter
|
|
45
|
+
- sie_server.adapters.gliformer.adapter
|
|
44
46
|
- sie_server.adapters.donut
|
|
45
47
|
- sie_server.adapters.florence2
|
|
46
48
|
- sie_server.adapters.docling.adapter
|
|
@@ -72,14 +74,20 @@ deps:
|
|
|
72
74
|
pillow: '==12.3.0'
|
|
73
75
|
# grounding_dino
|
|
74
76
|
requests: ''
|
|
75
|
-
# gliner, gliner_bi
|
|
76
|
-
gliner: '>=0.2,<1'
|
|
77
|
-
# gliner2
|
|
77
|
+
# gliner, gliner_bi (0.2.26: first release that loads the relex checkpoints)
|
|
78
|
+
gliner: '>=0.2.26,<1'
|
|
79
|
+
# gliner2. Held at 1.x: gliner2 2.0 changes gliner2-base/large-v1 outputs
|
|
80
|
+
# (every repeated NER mention is returned, and structured extraction is
|
|
81
|
+
# rescored). The GLiNER2.5-Decide models, which need 2.x, are served from
|
|
82
|
+
# the transformers5 bundle.
|
|
78
83
|
gliner2: '>=1.3.1,<2'
|
|
79
84
|
# glirel
|
|
80
85
|
glirel: '>=1.0,<2'
|
|
81
|
-
# gliclass
|
|
82
|
-
|
|
86
|
+
# gliclass (0.1.17: cross-attention scorer for the multilingual checkpoints;
|
|
87
|
+
# 0.1.18+ needs transformers 5)
|
|
88
|
+
gliclass: '>=0.1.17,<1'
|
|
89
|
+
# gliformer: exact, the adapter uses package internals (see pyproject.toml)
|
|
90
|
+
gliformer: '==0.1.2'
|
|
83
91
|
# gliner/glirel/gliclass shared dep
|
|
84
92
|
loguru: '>=0.7,<1'
|
|
85
93
|
# donut, florence2
|
|
@@ -7,6 +7,7 @@ adapters:
|
|
|
7
7
|
- sie_server.adapters.lighton_ocr.adapter
|
|
8
8
|
- sie_server.adapters.glm_ocr
|
|
9
9
|
- sie_server.adapters.gliner2.classification
|
|
10
|
+
- sie_server.adapters.gliner2.decide
|
|
10
11
|
- sie_server.adapters.st_sparse_vision.adapter
|
|
11
12
|
deps:
|
|
12
13
|
# Transformers 5.x for models requiring newer architecture support
|
|
@@ -30,5 +31,10 @@ deps:
|
|
|
30
31
|
# unsatisfiable against that pin and broke `uv run` resolution.
|
|
31
32
|
# Let transformers drive the version.
|
|
32
33
|
pillow: ''
|
|
33
|
-
# gliguard-LLMGuardrails-300M uses GLiNER2 classification APIs
|
|
34
|
-
gliner2
|
|
34
|
+
# gliguard-LLMGuardrails-300M uses GLiNER2 classification APIs, and the
|
|
35
|
+
# GLiNER2.5-Decide models need gliner2 2.x (AutoExtractor, boundary
|
|
36
|
+
# architecture). Exact: the Decide adapter builds the task prompt with the
|
|
37
|
+
# package's processor. GLiGuard's outputs are unchanged from 1.3.2. gliner2
|
|
38
|
+
# 2.0 declares transformers<5 only for its `local` extra, which is not used;
|
|
39
|
+
# the multilingual and 1B Decide checkpoints were saved with transformers 5.
|
|
40
|
+
gliner2: '==2.0.0'
|
|
@@ -0,0 +1,24 @@
|
|
|
1
|
+
sie_id: convaiinnovations/laya-multilingual
|
|
2
|
+
hf_id: convaiinnovations/laya-multilingual
|
|
3
|
+
hf_revision: 82d57fc4f2d1be3d2caac494045f2ec51d0842f3
|
|
4
|
+
# This checkpoint ships no calibration temperatures (rl_agent_config.json has
|
|
5
|
+
# temperature [1, 1, 1] and no per-option buckets), so its probabilities and
|
|
6
|
+
# confidences are the raw softmax of the decision head: uncalibrated.
|
|
7
|
+
inputs:
|
|
8
|
+
text: true
|
|
9
|
+
image: false
|
|
10
|
+
audio: false
|
|
11
|
+
video: false
|
|
12
|
+
tasks:
|
|
13
|
+
encode: null
|
|
14
|
+
score: null
|
|
15
|
+
extract: {}
|
|
16
|
+
max_sequence_length: 1024
|
|
17
|
+
profiles:
|
|
18
|
+
default:
|
|
19
|
+
max_batch_tokens: 16384
|
|
20
|
+
compute_precision: bfloat16
|
|
21
|
+
adapter_path: sie_server.adapters.laya.adapter:LayaAdapter
|
|
22
|
+
adapter_options:
|
|
23
|
+
loadtime: {}
|
|
24
|
+
runtime: {}
|
|
@@ -0,0 +1,21 @@
|
|
|
1
|
+
sie_id: convaiinnovations/laya-typed-decisions
|
|
2
|
+
hf_id: convaiinnovations/laya-typed-decisions
|
|
3
|
+
hf_revision: bc76315b568af04bc19f133c8bca9a2b3a2d9905
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 1024
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: bfloat16
|
|
18
|
+
adapter_path: sie_server.adapters.laya.adapter:LayaAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime: {}
|
|
21
|
+
runtime: {}
|
|
@@ -0,0 +1,21 @@
|
|
|
1
|
+
sie_id: convaiinnovations/laya
|
|
2
|
+
hf_id: convaiinnovations/laya
|
|
3
|
+
hf_revision: aa8c91ca088ec597df95a0d1c76b3063cb2ae5e8
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: bfloat16
|
|
18
|
+
adapter_path: sie_server.adapters.laya.adapter:LayaAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime: {}
|
|
21
|
+
runtime: {}
|
|
@@ -0,0 +1,38 @@
|
|
|
1
|
+
# GLiNER2.5-Decide-1B: typed-decision classifier on the Ettin 1B encoder
|
|
2
|
+
# (jhu-clsp/ettin-enc-from-dec-1b, ModernBERT; span architecture), loaded through
|
|
3
|
+
# gliner2 2.x AutoExtractor. Served from the transformers5 bundle, which pins gliner2 2.x.
|
|
4
|
+
#
|
|
5
|
+
# Checkpoint caveat: the weights at this revision are the step-285000 checkpoint
|
|
6
|
+
# (upload commit eac5ac1e). The 59.6% fast-decisions score on the model card was
|
|
7
|
+
# measured on an earlier step-195000 checkpoint (stated in that revision's card);
|
|
8
|
+
# the uploaded weights had not been re-evaluated.
|
|
9
|
+
#
|
|
10
|
+
# The encoder config stores its RoPE bases only in the transformers-5
|
|
11
|
+
# rope_parameters form (160000 for full and sliding-window layers). The adapter
|
|
12
|
+
# checks the bases the loaded encoder actually uses, and under transformers 4
|
|
13
|
+
# writes them where that version reads them (it would otherwise run the
|
|
14
|
+
# sliding-window layers at 10000).
|
|
15
|
+
sie_id: fastino/GLiNER2.5-Decide-1B
|
|
16
|
+
hf_id: fastino/GLiNER2.5-Decide-1B
|
|
17
|
+
hf_revision: 52c94d3b698bf6d2619df9d898bdc1523ea3f1ca
|
|
18
|
+
inputs:
|
|
19
|
+
text: true
|
|
20
|
+
image: false
|
|
21
|
+
audio: false
|
|
22
|
+
video: false
|
|
23
|
+
tasks:
|
|
24
|
+
encode: null
|
|
25
|
+
score: null
|
|
26
|
+
extract: {}
|
|
27
|
+
# Tokens per item: every question's prompt and labels, then the document. The
|
|
28
|
+
# Ettin encoder config sets max_position_embeddings 7999 and the tokenizer
|
|
29
|
+
# model_max_length 8192; 2048 tokens stays within both.
|
|
30
|
+
max_sequence_length: 2048
|
|
31
|
+
profiles:
|
|
32
|
+
default:
|
|
33
|
+
max_batch_tokens: 16384
|
|
34
|
+
compute_precision: float16
|
|
35
|
+
adapter_path: sie_server.adapters.gliner2.decide:GLiNER2DecideAdapter
|
|
36
|
+
adapter_options:
|
|
37
|
+
loadtime: {}
|
|
38
|
+
runtime: {}
|
|
@@ -0,0 +1,28 @@
|
|
|
1
|
+
# GLiNER2.5-Decide: English typed-decision classifier (DeBERTa-v3-large encoder,
|
|
2
|
+
# span architecture), loaded through gliner2 2.x AutoExtractor. Served from the
|
|
3
|
+
# transformers5 bundle, which pins gliner2 2.x.
|
|
4
|
+
sie_id: fastino/GLiNER2.5-Decide
|
|
5
|
+
hf_id: fastino/GLiNER2.5-Decide
|
|
6
|
+
hf_revision: 7ee5da4c2415e32259bcdc0b1a7367c32ce8d6f6
|
|
7
|
+
inputs:
|
|
8
|
+
text: true
|
|
9
|
+
image: false
|
|
10
|
+
audio: false
|
|
11
|
+
video: false
|
|
12
|
+
tasks:
|
|
13
|
+
encode: null
|
|
14
|
+
score: null
|
|
15
|
+
extract: {}
|
|
16
|
+
# Tokens per item: every question's prompt and labels, then the document. 512,
|
|
17
|
+
# as for fastino/gliner2-large-v1, this model's base: its DeBERTa-v3-large encoder
|
|
18
|
+
# was pretrained on 512 positions (max_position_embeddings), and neither the model
|
|
19
|
+
# card nor the checkpoint config (max_len null) gives a longer length.
|
|
20
|
+
max_sequence_length: 512
|
|
21
|
+
profiles:
|
|
22
|
+
default:
|
|
23
|
+
max_batch_tokens: 16384
|
|
24
|
+
compute_precision: float16
|
|
25
|
+
adapter_path: sie_server.adapters.gliner2.decide:GLiNER2DecideAdapter
|
|
26
|
+
adapter_options:
|
|
27
|
+
loadtime: {}
|
|
28
|
+
runtime: {}
|
|
@@ -0,0 +1,27 @@
|
|
|
1
|
+
# GLiNER2.5-multi-Decide: multilingual typed-decision classifier (mDeBERTa-v3-base
|
|
2
|
+
# encoder, boundary architecture; trained with max_len 4096 words), loaded through
|
|
3
|
+
# gliner2 2.x AutoExtractor. Served from the transformers5 bundle, which pins gliner2 2.x.
|
|
4
|
+
sie_id: fastino/GLiNER2.5-multi-Decide
|
|
5
|
+
hf_id: fastino/GLiNER2.5-multi-Decide
|
|
6
|
+
hf_revision: 6bc1d43d201b0691e733626389af8c57eea3ea68
|
|
7
|
+
inputs:
|
|
8
|
+
text: true
|
|
9
|
+
image: false
|
|
10
|
+
audio: false
|
|
11
|
+
video: false
|
|
12
|
+
tasks:
|
|
13
|
+
encode: null
|
|
14
|
+
score: null
|
|
15
|
+
extract: {}
|
|
16
|
+
# Tokens per item: every question's prompt and labels, then the document. The
|
|
17
|
+
# checkpoint config sets max_len 4096 (gliner2 counts it in words), and the
|
|
18
|
+
# tokenizer sets no length limit; 2048 tokens stays within both.
|
|
19
|
+
max_sequence_length: 2048
|
|
20
|
+
profiles:
|
|
21
|
+
default:
|
|
22
|
+
max_batch_tokens: 16384
|
|
23
|
+
compute_precision: float16
|
|
24
|
+
adapter_path: sie_server.adapters.gliner2.decide:GLiNER2DecideAdapter
|
|
25
|
+
adapter_options:
|
|
26
|
+
loadtime: {}
|
|
27
|
+
runtime: {}
|
|
@@ -19,5 +19,8 @@ profiles:
|
|
|
19
19
|
adapter_options:
|
|
20
20
|
loadtime:
|
|
21
21
|
classification_type: single-label
|
|
22
|
+
# Replay forwards as CUDA graphs over bucketed lengths; "off" runs them eagerly.
|
|
23
|
+
# See "GLiClass CUDA graphs" in packages/sie_server/README.md.
|
|
24
|
+
cuda_graphs: bucketed
|
|
22
25
|
runtime:
|
|
23
26
|
threshold: 0.0
|
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
sie_id: knowledgator/gliclass-base-v3.0
|
|
2
|
+
hf_id: knowledgator/gliclass-base-v3.0
|
|
3
|
+
hf_revision: 77a70e6cd52e602ed18184ef37d18bdd3741e3d5
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: null
|
|
18
|
+
adapter_path: sie_server.adapters.gliclass:GLiClassAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime:
|
|
21
|
+
classification_type: single-label
|
|
22
|
+
runtime:
|
|
23
|
+
threshold: 0.0
|
|
24
|
+
multi-label:
|
|
25
|
+
extends: default
|
|
26
|
+
adapter_options:
|
|
27
|
+
runtime:
|
|
28
|
+
classification_type: multi-label
|
|
29
|
+
threshold: 0.0
|
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
sie_id: knowledgator/gliclass-edge-v3.0
|
|
2
|
+
hf_id: knowledgator/gliclass-edge-v3.0
|
|
3
|
+
hf_revision: df03993a2ed98e5e4a0d2dd7efbbd105abe874cf
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: null
|
|
18
|
+
adapter_path: sie_server.adapters.gliclass:GLiClassAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime:
|
|
21
|
+
classification_type: single-label
|
|
22
|
+
runtime:
|
|
23
|
+
threshold: 0.0
|
|
24
|
+
multi-label:
|
|
25
|
+
extends: default
|
|
26
|
+
adapter_options:
|
|
27
|
+
runtime:
|
|
28
|
+
classification_type: multi-label
|
|
29
|
+
threshold: 0.0
|
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
sie_id: knowledgator/gliclass-instruct-base-v1.0
|
|
2
|
+
hf_id: knowledgator/gliclass-instruct-base-v1.0
|
|
3
|
+
hf_revision: 4f6a108b08a5537f395521d19b5073e197923dd3
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: null
|
|
18
|
+
adapter_path: sie_server.adapters.gliclass:GLiClassAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime:
|
|
21
|
+
classification_type: single-label
|
|
22
|
+
runtime:
|
|
23
|
+
threshold: 0.0
|
|
24
|
+
multi-label:
|
|
25
|
+
extends: default
|
|
26
|
+
adapter_options:
|
|
27
|
+
runtime:
|
|
28
|
+
classification_type: multi-label
|
|
29
|
+
threshold: 0.0
|
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
sie_id: knowledgator/gliclass-instruct-edge-v1.0
|
|
2
|
+
hf_id: knowledgator/gliclass-instruct-edge-v1.0
|
|
3
|
+
hf_revision: 727be8a417f6a7718e591b025e07054c146d8139
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: null
|
|
18
|
+
adapter_path: sie_server.adapters.gliclass:GLiClassAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime:
|
|
21
|
+
classification_type: single-label
|
|
22
|
+
runtime:
|
|
23
|
+
threshold: 0.0
|
|
24
|
+
multi-label:
|
|
25
|
+
extends: default
|
|
26
|
+
adapter_options:
|
|
27
|
+
runtime:
|
|
28
|
+
classification_type: multi-label
|
|
29
|
+
threshold: 0.0
|
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
sie_id: knowledgator/gliclass-instruct-large-v1.0
|
|
2
|
+
hf_id: knowledgator/gliclass-instruct-large-v1.0
|
|
3
|
+
hf_revision: 825e5478c1bf4bffbf297690517097ccbdb2e006
|
|
4
|
+
inputs:
|
|
5
|
+
text: true
|
|
6
|
+
image: false
|
|
7
|
+
audio: false
|
|
8
|
+
video: false
|
|
9
|
+
tasks:
|
|
10
|
+
encode: null
|
|
11
|
+
score: null
|
|
12
|
+
extract: {}
|
|
13
|
+
max_sequence_length: 512
|
|
14
|
+
profiles:
|
|
15
|
+
default:
|
|
16
|
+
max_batch_tokens: 16384
|
|
17
|
+
compute_precision: null
|
|
18
|
+
adapter_path: sie_server.adapters.gliclass:GLiClassAdapter
|
|
19
|
+
adapter_options:
|
|
20
|
+
loadtime:
|
|
21
|
+
classification_type: single-label
|
|
22
|
+
runtime:
|
|
23
|
+
threshold: 0.0
|
|
24
|
+
multi-label:
|
|
25
|
+
extends: default
|
|
26
|
+
adapter_options:
|
|
27
|
+
runtime:
|
|
28
|
+
classification_type: multi-label
|
|
29
|
+
threshold: 0.0
|