mostlyai-engine 2.3.0__tar.gz → 2.3.1__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (54) hide show
  1. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/PKG-INFO +4 -1
  2. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/README.md +3 -0
  3. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/__init__.py +1 -1
  4. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/interface.py +3 -3
  5. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/probability.py +4 -4
  6. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/pyproject.toml +1 -1
  7. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/.gitignore +0 -0
  8. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/LICENSE +0 -0
  9. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_common.py +0 -0
  10. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_dtypes.py +0 -0
  11. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/__init__.py +0 -0
  12. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/language/__init__.py +0 -0
  13. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/language/categorical.py +0 -0
  14. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/language/datetime.py +0 -0
  15. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/language/numeric.py +0 -0
  16. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/language/text.py +0 -0
  17. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/__init__.py +0 -0
  18. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/categorical.py +0 -0
  19. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/character.py +0 -0
  20. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/datetime.py +0 -0
  21. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/itt.py +0 -0
  22. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/lat_long.py +0 -0
  23. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_encoding_types/tabular/numeric.py +0 -0
  24. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/__init__.py +0 -0
  25. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/common.py +0 -0
  26. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/encoding.py +0 -0
  27. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/engine/__init__.py +0 -0
  28. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/engine/base.py +0 -0
  29. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/engine/hf_engine.py +0 -0
  30. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/engine/vllm_engine.py +0 -0
  31. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/generation.py +0 -0
  32. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/interface.py +0 -0
  33. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/lstm.py +0 -0
  34. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/tokenizer_utils.py +0 -0
  35. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/training.py +0 -0
  36. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_language/xgrammar_utils.py +0 -0
  37. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_memory.py +0 -0
  38. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/__init__.py +0 -0
  39. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/argn.py +0 -0
  40. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/common.py +0 -0
  41. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/encoding.py +0 -0
  42. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/fairness.py +0 -0
  43. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/generation.py +0 -0
  44. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_tabular/training.py +0 -0
  45. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_training_utils.py +0 -0
  46. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/_workspace.py +0 -0
  47. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/analysis.py +0 -0
  48. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/domain.py +0 -0
  49. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/encoding.py +0 -0
  50. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/generation.py +0 -0
  51. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/logging.py +0 -0
  52. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/random_state.py +0 -0
  53. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/splitting.py +0 -0
  54. {mostlyai_engine-2.3.0 → mostlyai_engine-2.3.1}/mostlyai/engine/training.py +0 -0
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: mostlyai-engine
3
- Version: 2.3.0
3
+ Version: 2.3.1
4
4
  Summary: Synthetic Data Engine
5
5
  Project-URL: homepage, https://github.com/mostly-ai/mostlyai-engine
6
6
  Project-URL: repository, https://github.com/mostly-ai/mostlyai-engine
@@ -251,6 +251,9 @@ Compute log likelihood of observations:
251
251
  ```python
252
252
  # compute log probability for each observation
253
253
  log_probs = argn.log_prob(data_test)
254
+
255
+ # list top 10 outliers
256
+ data_test.iloc[log_probs.argsort()[:10]]
254
257
  ```
255
258
 
256
259
  ## TabularARGN for Sequential Data
@@ -200,6 +200,9 @@ Compute log likelihood of observations:
200
200
  ```python
201
201
  # compute log probability for each observation
202
202
  log_probs = argn.log_prob(data_test)
203
+
204
+ # list top 10 outliers
205
+ data_test.iloc[log_probs.argsort()[:10]]
203
206
  ```
204
207
 
205
208
  ## TabularARGN for Sequential Data
@@ -34,7 +34,7 @@ __all__ = [
34
34
  "TabularARGN",
35
35
  "LanguageModel",
36
36
  ]
37
- __version__ = "2.3.0"
37
+ __version__ = "2.3.1"
38
38
 
39
39
  # suppress specific warning related to os.fork() in multi-threaded processes
40
40
  warnings.filterwarnings("ignore", category=DeprecationWarning, message=".*multi-threaded.*fork.*")
@@ -737,7 +737,7 @@ class TabularARGN(BaseEstimator):
737
737
  X: pd.DataFrame,
738
738
  ctx_data: pd.DataFrame | None = None,
739
739
  **kwargs,
740
- ) -> pd.DataFrame:
740
+ ) -> np.ndarray:
741
741
  """
742
742
  Compute log probability of observations.
743
743
 
@@ -754,8 +754,8 @@ class TabularARGN(BaseEstimator):
754
754
  **kwargs: Additional generation parameters (device, etc.).
755
755
 
756
756
  Returns:
757
- pd.DataFrame of shape (n_samples, 1) with log probability per row.
758
- Column name is "log_prob". Values are <= 0 (log probabilities).
757
+ np.ndarray of shape (n_samples,) with log probability per row.
758
+ Values are <= 0 (log probabilities).
759
759
  More negative values indicate less likely samples.
760
760
 
761
761
  Raises:
@@ -535,7 +535,7 @@ def log_prob(
535
535
  data: pd.DataFrame,
536
536
  ctx_data: pd.DataFrame | None = None,
537
537
  device: torch.device | str | None = None,
538
- ) -> pd.DataFrame:
538
+ ) -> np.ndarray:
539
539
  """
540
540
  Compute log probability of full observations.
541
541
 
@@ -556,8 +556,8 @@ def log_prob(
556
556
  device: Device to run inference on ('cuda' or 'cpu'). Defaults to 'cuda' if available.
557
557
 
558
558
  Returns:
559
- pd.DataFrame of shape (n_samples, 1) with log probability per row.
560
- Column name is "log_prob". Values are <= 0 (log probabilities).
559
+ np.ndarray of shape (n_samples,) with log probability per row.
560
+ Values are <= 0 (log probabilities).
561
561
  """
562
562
  _LOG.info("LOG_PROB started")
563
563
 
@@ -594,4 +594,4 @@ def log_prob(
594
594
  log_probs = -losses.cpu().numpy()
595
595
 
596
596
  _LOG.info(f"LOG_PROB finished: computed log probs for {n_samples} samples")
597
- return pd.DataFrame({"log_prob": log_probs})
597
+ return log_probs
@@ -1,6 +1,6 @@
1
1
  [project]
2
2
  name = "mostlyai-engine"
3
- version = "2.3.0"
3
+ version = "2.3.1"
4
4
  description = "Synthetic Data Engine"
5
5
  authors = [{ name = "MOSTLY AI", email = "dev@mostly.ai" }]
6
6
  requires-python = ">=3.10"
File without changes