sendnn-inference 2.2.2__tar.gz → 2.2.4__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (206) hide show
  1. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/ci_model_cache.yaml +0 -2
  2. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/PKG-INFO +1 -1
  3. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_model_tables.py +2 -0
  4. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/_version.py +3 -3
  5. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/model_configs.yaml +0 -24
  6. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/envs.py +2 -2
  7. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/model_executor/model_loader/spyre.py +1 -1
  8. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/platform.py +29 -6
  9. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/worker/spyre_model_runner.py +3 -1
  10. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/PKG-INFO +1 -1
  11. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/spyre_util.py +0 -6
  12. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.bob/skills/update-vllm/SKILL.md +0 -0
  13. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.claude/skills/update-vllm/SKILL.md +0 -0
  14. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/CODEOWNERS +0 -0
  15. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/ISSUE_TEMPLATE/bug-report.yml +0 -0
  16. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/ISSUE_TEMPLATE/config.yml +0 -0
  17. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/ISSUE_TEMPLATE/feature-request.yml +0 -0
  18. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/ISSUE_TEMPLATE/rfc.yml +0 -0
  19. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/actions/free-up-disk-space/action.yml +0 -0
  20. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/pull_request_template.md +0 -0
  21. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/add_label_automerge.yml +0 -0
  22. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/build_and_publish.yaml +0 -0
  23. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/build_docker.yml +0 -0
  24. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/check_uv_lock.yml +0 -0
  25. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/lint_scripts.yml +0 -0
  26. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/matchers/ruff.json +0 -0
  27. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/model_smoke.yml +0 -0
  28. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/pre-commit.yml +0 -0
  29. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/publish_to_test_pypi.yaml +0 -0
  30. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/reminder_comment.yml +0 -0
  31. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/stale.yml +0 -0
  32. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.github/workflows/test.yml +0 -0
  33. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.gitignore +0 -0
  34. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.pre-commit-config.yaml +0 -0
  35. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.readthedocs.yaml +0 -0
  36. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.shellcheckrc +0 -0
  37. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/.yapfignore +0 -0
  38. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/CLAUDE.md +0 -0
  39. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/CODE_OF_CONDUCT.md +0 -0
  40. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/CONTRIBUTING.md +0 -0
  41. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/DCO +0 -0
  42. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/LICENSE +0 -0
  43. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/README.md +0 -0
  44. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/RELEASING.md +0 -0
  45. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/_local_envs_for_test.sh +0 -0
  46. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docker/.senlib.json +0 -0
  47. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docker/Dockerfile.amd64 +0 -0
  48. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docker/simple_vllm_serve.sh +0 -0
  49. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/.nav.yml +0 -0
  50. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/README.md +0 -0
  51. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/README.md +0 -0
  52. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/architecture.md +0 -0
  53. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/images/vllm_v1.svg +0 -0
  54. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/images/vllm_v1_spyre.svg +0 -0
  55. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/maintaining.md +0 -0
  56. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/multimodal/adding_new_models.md +0 -0
  57. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/scheduler.md +0 -0
  58. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/contributing/vllm-update-procedure.md +0 -0
  59. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/deploying/docker.md +0 -0
  60. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/deploying/k8s.md +0 -0
  61. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/deploying/rhoai.md +0 -0
  62. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/getting_started/installation.md +0 -0
  63. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/generate_example.py +0 -0
  64. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/prefill_single_chunks.json +0 -0
  65. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/prefill_three_chunks.json +0 -0
  66. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/prefix_caching_1.json +0 -0
  67. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/prefix_caching_2.json +0 -0
  68. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/prefix_caching_3.json +0 -0
  69. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/scheduling_admission_constraints.json +0 -0
  70. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/scheduling_padding_tkv_jump.json +0 -0
  71. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/data/timeline_admission_constraints.json +0 -0
  72. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_examples.py +0 -0
  73. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_prefill_only_plots.py +0 -0
  74. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_prefix_caching_plots.py +0 -0
  75. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_scheduling_plots.py +0 -0
  76. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/generate_timeline.py +0 -0
  77. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/hooks/url_schemes.py +0 -0
  78. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/mkdocs/overrides/main.html +0 -0
  79. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/requirements-docs.txt +0 -0
  80. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/roadmaps/q3-2025.md +0 -0
  81. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/user_guide/configuration.md +0 -0
  82. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/user_guide/env_vars.md +0 -0
  83. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/user_guide/performance.md +0 -0
  84. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/user_guide/supported_features.md +0 -0
  85. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/docs/user_guide/supported_models.md +0 -0
  86. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/offline_inference/long_context.py +0 -0
  87. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/offline_inference/text_inference.py +0 -0
  88. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/offline_inference/vision_inference.py +0 -0
  89. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/online_inference/openai_spyre_text.py +0 -0
  90. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/online_inference/openai_spyre_vision.py +0 -0
  91. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/online_inference/spyre_vllm_benchmark.py +0 -0
  92. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/examples/online_inference/spyre_vllm_setup_container.sh +0 -0
  93. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/format.sh +0 -0
  94. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/mkdocs.yaml +0 -0
  95. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/pyproject.toml +0 -0
  96. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/__init__.py +0 -0
  97. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/argparse_utils.py +0 -0
  98. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/compat_utils.py +0 -0
  99. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/compilation_utils.py +0 -0
  100. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/README.md +0 -0
  101. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/__init__.py +0 -0
  102. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/configurators/__init__.py +0 -0
  103. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/configurators/model_configurator.py +0 -0
  104. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/model_config.py +0 -0
  105. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/model_matcher.py +0 -0
  106. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/config/model_registry.py +0 -0
  107. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/model_executor/__init__.py +0 -0
  108. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/model_executor/model_loader/__init__.py +0 -0
  109. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/model_executor/model_loader/spyre_setup.py +0 -0
  110. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/multimodal/__init__.py +0 -0
  111. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/multimodal/mm_mappings/__init__.py +0 -0
  112. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/multimodal/mm_mappings/base.py +0 -0
  113. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/multimodal/mm_mappings/llava_next.py +0 -0
  114. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/multimodal/mm_mappings/mistral3.py +0 -0
  115. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/perf_metrics.py +0 -0
  116. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/utils.py +0 -0
  117. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/__init__.py +0 -0
  118. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/core/__init__.py +0 -0
  119. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/core/scheduler.py +0 -0
  120. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/metrics/__init__.py +0 -0
  121. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/metrics/stats_logger.py +0 -0
  122. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/sample/golden_token_injector.py +0 -0
  123. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/sample/spyre_logits_processor.py +0 -0
  124. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/worker/__init__.py +0 -0
  125. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/worker/mm_shared_memory.py +0 -0
  126. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/worker/spyre_input_batch.py +0 -0
  127. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference/v1/worker/spyre_worker.py +0 -0
  128. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/SOURCES.txt +0 -0
  129. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/dependency_links.txt +0 -0
  130. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/entry_points.txt +0 -0
  131. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/requires.txt +0 -0
  132. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/sendnn_inference.egg-info/top_level.txt +0 -0
  133. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/setup.cfg +0 -0
  134. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/aftu/graph_compare_utils.py +0 -0
  135. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/aftu/test_compare_graphs.py +0 -0
  136. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/__init__.py +0 -0
  137. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/conftest.py +0 -0
  138. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/fixtures/test_error_handling_models.yaml +0 -0
  139. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_env_config_path.py +0 -0
  140. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_error_handling.py +0 -0
  141. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_integration.py +0 -0
  142. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_model_config.py +0 -0
  143. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_model_configurator.py +0 -0
  144. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_model_matcher.py +0 -0
  145. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/config/test_model_registry.py +0 -0
  146. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/conftest.py +0 -0
  147. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/download_model_configs.py +0 -0
  148. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_chunked_prefill.py +0 -0
  149. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_chunked_prefill_tkv_steps.py +0 -0
  150. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_load_format_dummy.py +0 -0
  151. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_logits_processors.py +0 -0
  152. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_model_smoke.py +0 -0
  153. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_profiler.py +0 -0
  154. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_sampling_params.py +0 -0
  155. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_async_llm.py +0 -0
  156. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_basic.py +0 -0
  157. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_cp_scheduler_steps.py +0 -0
  158. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_embeddings.py +0 -0
  159. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_mm.py +0 -0
  160. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_online.py +0 -0
  161. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_pc_scheduler_steps.py +0 -0
  162. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_scoring.py +0 -0
  163. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_seed.py +0 -0
  164. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_spyre_stagger_basic.py +0 -0
  165. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_stats_logger.py +0 -0
  166. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/e2e/test_structured_outputs.py +0 -0
  167. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/BAAI/bge-reranker-large/config.json +0 -0
  168. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/BAAI/bge-reranker-v2-m3/config.json +0 -0
  169. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-ai-platform/micro-g3.3-8b-instruct-1b/config.json +0 -0
  170. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-3.3-8b-instruct/config.json +0 -0
  171. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-3.3-8b-instruct-FP8/config.json +0 -0
  172. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-4-8b-dense/config.json +0 -0
  173. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-4-8b-dense-hybrid/config.json +0 -0
  174. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-embedding-125m-english/config.json +0 -0
  175. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/ibm-granite/granite-embedding-278m-multilingual/config.json +0 -0
  176. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/intfloat/multilingual-e5-large/config.json +0 -0
  177. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/fixtures/model_configs/sentence-transformers/all-roberta-large-v1/config.json +0 -0
  178. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/hf_cache.json +0 -0
  179. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/hf_result_cache.py +0 -0
  180. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/llm_cache.py +0 -0
  181. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/llm_cache_util.py +0 -0
  182. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/model_loader/test_spyre.py +0 -0
  183. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/multimodal/test_llava_next.py +0 -0
  184. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/multimodal/test_mistral3.py +0 -0
  185. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/output_util.py +0 -0
  186. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/precompilation/test_disable_compilation.py +0 -0
  187. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/scheduling_utils.py +0 -0
  188. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/bge_copy/config.json +0 -0
  189. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_cli_args.py +0 -0
  190. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_envs.py +0 -0
  191. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_golden_token_injector.py +0 -0
  192. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_platform_validation.py +0 -0
  193. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_spyre_model_list.py +0 -0
  194. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/utils/test_upstream_compatibility.py +0 -0
  195. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/core/test_scheduler_structured_outputs.py +0 -0
  196. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/mock_model.py +0 -0
  197. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/test_mm_shared_memory.py +0 -0
  198. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/test_prefix_caching_worker.py +0 -0
  199. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/test_scheduler_tkv_limits.py +0 -0
  200. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/test_spyre_input_batch.py +0 -0
  201. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tests/v1/worker/test_spyre_worker_profile.py +0 -0
  202. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tools/check_aiu.sh +0 -0
  203. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tools/check_repo.sh +0 -0
  204. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tools/download_model.py +0 -0
  205. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/tools/lint_scripts.sh +0 -0
  206. {sendnn_inference-2.2.2 → sendnn_inference-2.2.4}/uv.lock +0 -0
@@ -13,5 +13,3 @@ models:
13
13
  revision: cf74d8acd4f198de950bf004b262e6accfed5d2c
14
14
  - repo: cross-encoder/stsb-roberta-large
15
15
  revision: 2b12c2c0088918e76151fd5937b7bba986ef1f98
16
- - repo: Qwen/Qwen3-Embedding-0.6B
17
- revision: 97b0c614be4d77ee51c0cef4e5f07c00f9eb65b3
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: sendnn-inference
3
- Version: 2.2.2
3
+ Version: 2.2.4
4
4
  Summary: vLLM plugin for Spyre hardware support
5
5
  License: Apache 2
6
6
  Requires-Python: >=3.11
@@ -21,6 +21,8 @@ EXCLUDED_MODELS = {
21
21
  "ibm-granite/granite-4-8b-dense-hybrid",
22
22
  "ibm-granite/granite-4-8b-dense",
23
23
  "ibm-granite/granite-4-8b-dense-FP8",
24
+ "Qwen/Qwen3-Embedding-0.6B",
25
+ "Qwen/Qwen3-Embedding-4B",
24
26
  }
25
27
 
26
28
 
@@ -28,7 +28,7 @@ version_tuple: VERSION_TUPLE
28
28
  commit_id: COMMIT_ID
29
29
  __commit_id__: COMMIT_ID
30
30
 
31
- __version__ = version = '2.2.2'
32
- __version_tuple__ = version_tuple = (2, 2, 2)
31
+ __version__ = version = '2.2.4'
32
+ __version_tuple__ = version_tuple = (2, 2, 4)
33
33
 
34
- __commit_id__ = commit_id = 'gd054d78'
34
+ __commit_id__ = commit_id = 'gc694b58'
@@ -338,30 +338,6 @@ models:
338
338
  - prompt_len: 512
339
339
  batch_size: 64
340
340
 
341
- Qwen/Qwen3-Embedding-0.6B:
342
- architecture:
343
- model_type: qwen3
344
- num_hidden_layers: 28
345
- vocab_size: 151669
346
-
347
- static_batching_configs:
348
- - tp_size: 1
349
- warmup_shapes:
350
- - prompt_len: 512
351
- batch_size: 64
352
-
353
- Qwen/Qwen3-Embedding-4B:
354
- architecture:
355
- model_type: qwen3
356
- num_hidden_layers: 36
357
- vocab_size: 151665
358
-
359
- static_batching_configs:
360
- - tp_size: 1
361
- warmup_shapes:
362
- - prompt_len: 512
363
- batch_size: 64
364
-
365
341
  # Other supported models (static batching only)
366
342
  intfloat/multilingual-e5-large:
367
343
  architecture:
@@ -52,12 +52,12 @@ environment_variables: dict[str, Callable[[], Any]] = {
52
52
  # for, formatted as comma separated list. Only applicable in pooling.
53
53
  "SENDNN_INFERENCE_WARMUP_PROMPT_LENS": lambda: [
54
54
  int(p)
55
- for p in os.getenv(key="SENDNN_INFERENCE_WARMUP_PROMPT_LENS", default="64").split(",")
55
+ for p in os.getenv(key="SENDNN_INFERENCE_WARMUP_PROMPT_LENS", default="512").split(",")
56
56
  ],
57
57
  # Defines the batch sizes the Spyre accelerator should be prepared
58
58
  # for, formatted as comma separated list. Only applicable in pooling.
59
59
  "SENDNN_INFERENCE_WARMUP_BATCH_SIZES": lambda: [
60
- int(b) for b in os.getenv(key="SENDNN_INFERENCE_WARMUP_BATCH_SIZES", default="1").split(",")
60
+ int(b) for b in os.getenv(key="SENDNN_INFERENCE_WARMUP_BATCH_SIZES", default="8").split(",")
61
61
  ],
62
62
  # Defines the backend that torch.compile will use when using Spyre
63
63
  # Available options:
@@ -117,7 +117,7 @@ class SpyreCausalLM(nn.Module):
117
117
  self.parallel_config
118
118
  )
119
119
 
120
- if self.config.model_type in {"llama", "granite", "granitemoehybrid"}:
120
+ if self.config.model_type in {"llama", "granite", "granitemoehybrid", "qwen3"}:
121
121
  self.kv_cache_specs["num_layers"] = self.config.num_hidden_layers
122
122
  self.kv_cache_specs["head_dim"] = getattr(
123
123
  self.fms_model.config,
@@ -1,4 +1,5 @@
1
1
  import sys
2
+ import platform
2
3
  from string import Template
3
4
  import multiprocessing
4
5
  import importlib.metadata
@@ -56,6 +57,10 @@ THREADING_ENVS = [
56
57
  "MKL_NUM_THREADS",
57
58
  ]
58
59
 
60
+ DEFAULT_MAX_MODEL_LEN = 32 * 1024
61
+ DEFAULT_MAX_NUM_SEQS = 32
62
+ DEFAULT_TKV_LIMIT = 131072 # 128k
63
+
59
64
 
60
65
  # Needed by vllm/model_executor/layers/pooler.py:562
61
66
  # Copied from vllm/utils/__init__.py
@@ -327,7 +332,21 @@ class SpyrePlatform(Platform):
327
332
  f"{error_msg}. SENDNN_INFERENCE_REQUIRE_KNOWN_CONFIG is set, "
328
333
  "which requires a known configuration to be found."
329
334
  )
330
- logger.debug(error_msg)
335
+ logger.info(
336
+ "%s. Capping max-num-seqs at %d and max-model-len at %d",
337
+ error_msg,
338
+ DEFAULT_MAX_NUM_SEQS,
339
+ DEFAULT_MAX_MODEL_LEN,
340
+ )
341
+ if is_decoder:
342
+ vllm_config.scheduler_config.max_num_seqs = min(
343
+ vllm_config.scheduler_config.max_num_seqs, DEFAULT_MAX_NUM_SEQS
344
+ )
345
+ vllm_config.model_config.max_model_len = min(
346
+ vllm_config.model_config.max_model_len, DEFAULT_MAX_MODEL_LEN
347
+ )
348
+ tkv_env = int(os.getenv("VLLM_DT_MAX_BATCH_TKV_LIMIT", f"{DEFAULT_TKV_LIMIT}"))
349
+ os.environ["VLLM_DT_MAX_BATCH_TKV_LIMIT"] = str(min(DEFAULT_TKV_LIMIT, tkv_env))
331
350
 
332
351
  else:
333
352
  logger.debug(
@@ -643,12 +662,16 @@ class SpyrePlatform(Platform):
643
662
 
644
663
  # NOTE: math.ceil can output a number for each worker that sums
645
664
  # to a total greater than cpu_count.
646
- thread_factor = worker_count
647
665
  if cls._config.model_config.is_multimodal_model:
648
- # thread_factor value/formula subject to further tuning
649
- thread_factor = 1
650
-
651
- cpus_per_worker = math.ceil(cpu_count / thread_factor) if cpu_count is not None else None
666
+ if platform.machine() == "ppc64le":
667
+ cpus_per_worker = (
668
+ min(psutil.cpu_count(logical=True), 36) if cpu_count is not None else None
669
+ )
670
+ else:
671
+ # Formula for cpus_per_worker can be adjusted per architecture
672
+ cpus_per_worker = math.ceil(cpu_count) if cpu_count is not None else None
673
+ else:
674
+ cpus_per_worker = math.ceil(cpu_count / worker_count) if cpu_count is not None else None
652
675
 
653
676
  thread_warning = (
654
677
  "Excessive threads may result in CPU contention. "
@@ -324,7 +324,9 @@ class SpyrePoolingModelRunner(
324
324
  )
325
325
  self._model = self._model.base_model
326
326
  else:
327
- self._model = AutoModel.from_pretrained(self.model_config.model)
327
+ self._model = AutoModel.from_pretrained(
328
+ self.model_config.model, dtype=torch.float16
329
+ )
328
330
  elif task == "classify":
329
331
  class_model = AutoModelForSequenceClassification.from_pretrained(
330
332
  self.model_config.model
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: sendnn-inference
3
- Version: 2.2.2
3
+ Version: 2.2.4
4
4
  Summary: vLLM plugin for Spyre hardware support
5
5
  License: Apache 2
6
6
  Requires-Python: >=3.11
@@ -275,10 +275,6 @@ register_model_info(
275
275
  name="sentence-transformers/all-roberta-large-v1",
276
276
  revision="cf74d8acd4f198de950bf004b262e6accfed5d2c",
277
277
  )
278
- register_model_info(
279
- name="Qwen/Qwen3-Embedding-0.6B",
280
- revision="97b0c614be4d77ee51c0cef4e5f07c00f9eb65b3",
281
- )
282
278
  register_model_info(
283
279
  name="cross-encoder/stsb-roberta-large",
284
280
  revision="2b12c2c0088918e76151fd5937b7bba986ef1f98",
@@ -324,10 +320,8 @@ def _default_test_models(
324
320
  """Return the default set of test models as pytest parameterizations"""
325
321
  if isEmbeddings:
326
322
  roberta = REFERENCE_MODELS["sentence-transformers/all-roberta-large-v1"]
327
- qwen3 = REFERENCE_MODELS["Qwen/Qwen3-Embedding-0.6B"]
328
323
  params = [
329
324
  pytest.param(roberta, marks=[pytest.mark.embedding], id=roberta.name),
330
- pytest.param(qwen3, marks=[pytest.mark.embedding], id=qwen3.name),
331
325
  ]
332
326
  return params
333
327
 
File without changes