datapruning 2.1.1__tar.gz → 2.1.2__tar.gz

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (61) hide show
  1. {datapruning-2.1.1/datapruning.egg-info → datapruning-2.1.2}/PKG-INFO +1 -1
  2. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/base.py +10 -6
  3. {datapruning-2.1.1 → datapruning-2.1.2/datapruning.egg-info}/PKG-INFO +1 -1
  4. {datapruning-2.1.1 → datapruning-2.1.2}/pyproject.toml +1 -1
  5. {datapruning-2.1.1 → datapruning-2.1.2}/LICENSE +0 -0
  6. {datapruning-2.1.1 → datapruning-2.1.2}/MANIFEST.in +0 -0
  7. {datapruning-2.1.1 → datapruning-2.1.2}/README.md +0 -0
  8. {datapruning-2.1.1 → datapruning-2.1.2}/build_src/_core.c +0 -0
  9. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/__init__.py +0 -0
  10. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/__init__.py +0 -0
  11. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/el2n_scorer.py +0 -0
  12. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/fusion_pipeline.py +0 -0
  13. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/kcenter_select.py +0 -0
  14. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/margin_scorer.py +0 -0
  15. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/registry.py +0 -0
  16. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/algorithms/sliding_window.py +0 -0
  17. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/__init__.py +0 -0
  18. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/benchmark.py +0 -0
  19. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/explainability.py +0 -0
  20. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/intelligence.py +0 -0
  21. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/optimizer.py +0 -0
  22. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/scanner.py +0 -0
  23. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/strategy_display.py +0 -0
  24. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/engine/strategy_selector.py +0 -0
  25. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/multimodal/__init__.py +0 -0
  26. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/multimodal/clip_encoder.py +0 -0
  27. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/pipeline.py +0 -0
  28. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/reports/__init__.py +0 -0
  29. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/reports/exporter.py +0 -0
  30. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/__init__.py +0 -0
  31. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/benchmark/__init__.py +0 -0
  32. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/benchmark/compare.py +0 -0
  33. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/benchmark/evaluation.py +0 -0
  34. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/benchmark/synthetic.py +0 -0
  35. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/difficulty.py +0 -0
  36. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/embeddings/__init__.py +0 -0
  37. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/embeddings/torch_utils.py +0 -0
  38. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/fusion.py +0 -0
  39. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/noise.py +0 -0
  40. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/normalize.py +0 -0
  41. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/pipeline.py +0 -0
  42. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/redundancy.py +0 -0
  43. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/__init__.py +0 -0
  44. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/aum.py +0 -0
  45. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/el2n.py +0 -0
  46. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/forgetting.py +0 -0
  47. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/grand.py +0 -0
  48. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/scores/margin.py +0 -0
  49. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/selection.py +0 -0
  50. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/selectors/__init__.py +0 -0
  51. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/selectors/facility_location.py +0 -0
  52. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/selectors/kcenter.py +0 -0
  53. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/selectors/out_of_fold.py +0 -0
  54. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/research_pruning/strategy.py +0 -0
  55. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning/sdk.py +0 -0
  56. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning.egg-info/SOURCES.txt +0 -0
  57. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning.egg-info/dependency_links.txt +0 -0
  58. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning.egg-info/requires.txt +0 -0
  59. {datapruning-2.1.1 → datapruning-2.1.2}/datapruning.egg-info/top_level.txt +0 -0
  60. {datapruning-2.1.1 → datapruning-2.1.2}/setup.cfg +0 -0
  61. {datapruning-2.1.1 → datapruning-2.1.2}/setup.py +0 -0
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: datapruning
3
- Version: 2.1.1
3
+ Version: 2.1.2
4
4
  Summary: Intelligent dataset optimization for cleaner, smaller training data
5
5
  License: Proprietary
6
6
  Project-URL: Homepage, https://www.datapruning.com
@@ -48,14 +48,18 @@ class BaseOptimizer(ABC):
48
48
  def optimize(self, df: pd.DataFrame, target_col: str, keep_ratio: float = 0.5) -> OptimizationResult:
49
49
  import time
50
50
  import numpy as np
51
- X, y = df.drop(columns=[target_col]), df[target_col]
51
+ from sklearn.preprocessing import LabelEncoder
52
+
53
+ X, y = df.drop(columns=[target_col]), df[target_col].copy()
54
+
52
55
  for col in X.columns:
53
- if X[col].dtype == object or X[col].dtype.name == "category":
54
- from sklearn.preprocessing import LabelEncoder
56
+ if not np.issubdtype(X[col].dtype, np.number):
55
57
  X[col] = LabelEncoder().fit_transform(X[col].astype(str))
56
- elif not np.issubdtype(X[col].dtype, np.number):
57
- X[col] = pd.to_numeric(X[col], errors="coerce").fillna(0)
58
- X = X.fillna(0)
58
+
59
+ if not np.issubdtype(y.dtype, np.number):
60
+ y = pd.Series(LabelEncoder().fit_transform(y.astype(str)), index=y.index)
61
+
62
+ X = X.fillna(0).astype(np.float64)
59
63
  minority_before = int(y.value_counts().min()) if y.nunique() > 1 else None
60
64
  t0 = time.time()
61
65
  self.fit(X, y)
@@ -1,6 +1,6 @@
1
1
  Metadata-Version: 2.4
2
2
  Name: datapruning
3
- Version: 2.1.1
3
+ Version: 2.1.2
4
4
  Summary: Intelligent dataset optimization for cleaner, smaller training data
5
5
  License: Proprietary
6
6
  Project-URL: Homepage, https://www.datapruning.com
@@ -4,7 +4,7 @@ build-backend = "setuptools.build_meta"
4
4
 
5
5
  [project]
6
6
  name = "datapruning"
7
- version = "2.1.1"
7
+ version = "2.1.2"
8
8
  description = "Intelligent dataset optimization for cleaner, smaller training data"
9
9
  readme = "README.md"
10
10
  requires-python = ">=3.10"
File without changes
File without changes
File without changes
File without changes
File without changes