RubyGems - easy_ml - Versions diffs - 0.1.4 → 0.2.0.pre.rc1 - Mend

easy_ml 0.1.4 → 0.2.0.pre.rc1

Files changed (239) hide show

checksums.yaml +4 -4
data/README.md +234 -26
data/Rakefile +45 -0
data/app/controllers/easy_ml/application_controller.rb +67 -0
data/app/controllers/easy_ml/columns_controller.rb +38 -0
data/app/controllers/easy_ml/datasets_controller.rb +156 -0
data/app/controllers/easy_ml/datasources_controller.rb +88 -0
data/app/controllers/easy_ml/deploys_controller.rb +20 -0
data/app/controllers/easy_ml/models_controller.rb +151 -0
data/app/controllers/easy_ml/retraining_runs_controller.rb +19 -0
data/app/controllers/easy_ml/settings_controller.rb +59 -0
data/app/frontend/components/AlertProvider.tsx +108 -0
data/app/frontend/components/DatasetPreview.tsx +161 -0
data/app/frontend/components/EmptyState.tsx +28 -0
data/app/frontend/components/ModelCard.tsx +255 -0
data/app/frontend/components/ModelDetails.tsx +334 -0
data/app/frontend/components/ModelForm.tsx +384 -0
data/app/frontend/components/Navigation.tsx +300 -0
data/app/frontend/components/Pagination.tsx +72 -0
data/app/frontend/components/Popover.tsx +55 -0
data/app/frontend/components/PredictionStream.tsx +105 -0
data/app/frontend/components/ScheduleModal.tsx +726 -0
data/app/frontend/components/SearchInput.tsx +23 -0
data/app/frontend/components/SearchableSelect.tsx +132 -0
data/app/frontend/components/dataset/AutosaveIndicator.tsx +39 -0
data/app/frontend/components/dataset/ColumnConfigModal.tsx +431 -0
data/app/frontend/components/dataset/ColumnFilters.tsx +256 -0
data/app/frontend/components/dataset/ColumnList.tsx +101 -0
data/app/frontend/components/dataset/FeatureConfigPopover.tsx +57 -0
data/app/frontend/components/dataset/FeaturePicker.tsx +205 -0
data/app/frontend/components/dataset/PreprocessingConfig.tsx +704 -0
data/app/frontend/components/dataset/SplitConfigurator.tsx +120 -0
data/app/frontend/components/dataset/splitters/DateSplitter.tsx +58 -0
data/app/frontend/components/dataset/splitters/KFoldSplitter.tsx +68 -0
data/app/frontend/components/dataset/splitters/LeavePOutSplitter.tsx +29 -0
data/app/frontend/components/dataset/splitters/PredefinedSplitter.tsx +146 -0
data/app/frontend/components/dataset/splitters/RandomSplitter.tsx +85 -0
data/app/frontend/components/dataset/splitters/StratifiedSplitter.tsx +79 -0
data/app/frontend/components/dataset/splitters/constants.ts +77 -0
data/app/frontend/components/dataset/splitters/types.ts +168 -0
data/app/frontend/components/dataset/splitters/utils.ts +53 -0
data/app/frontend/components/features/CodeEditor.tsx +46 -0
data/app/frontend/components/features/DataPreview.tsx +150 -0
data/app/frontend/components/features/FeatureCard.tsx +88 -0
data/app/frontend/components/features/FeatureForm.tsx +235 -0
data/app/frontend/components/features/FeatureGroupCard.tsx +54 -0
data/app/frontend/components/settings/PluginSettings.tsx +81 -0
data/app/frontend/components/ui/badge.tsx +44 -0
data/app/frontend/components/ui/collapsible.tsx +9 -0
data/app/frontend/components/ui/scroll-area.tsx +46 -0
data/app/frontend/components/ui/separator.tsx +29 -0
data/app/frontend/entrypoints/App.tsx +40 -0
data/app/frontend/entrypoints/Application.tsx +24 -0
data/app/frontend/hooks/useAutosave.ts +61 -0
data/app/frontend/layouts/Layout.tsx +38 -0
data/app/frontend/lib/utils.ts +6 -0
data/app/frontend/mockData.ts +272 -0
data/app/frontend/pages/DatasetDetailsPage.tsx +103 -0
data/app/frontend/pages/DatasetsPage.tsx +261 -0
data/app/frontend/pages/DatasourceFormPage.tsx +147 -0
data/app/frontend/pages/DatasourcesPage.tsx +261 -0
data/app/frontend/pages/EditModelPage.tsx +45 -0
data/app/frontend/pages/EditTransformationPage.tsx +56 -0
data/app/frontend/pages/ModelsPage.tsx +115 -0
data/app/frontend/pages/NewDatasetPage.tsx +366 -0
data/app/frontend/pages/NewModelPage.tsx +45 -0
data/app/frontend/pages/NewTransformationPage.tsx +43 -0
data/app/frontend/pages/SettingsPage.tsx +272 -0
data/app/frontend/pages/ShowModelPage.tsx +30 -0
data/app/frontend/pages/TransformationsPage.tsx +95 -0
data/app/frontend/styles/application.css +100 -0
data/app/frontend/types/dataset.ts +146 -0
data/app/frontend/types/datasource.ts +33 -0
data/app/frontend/types/preprocessing.ts +1 -0
data/app/frontend/types.ts +113 -0
data/app/helpers/easy_ml/application_helper.rb +10 -0
data/app/jobs/easy_ml/application_job.rb +21 -0
data/app/jobs/easy_ml/batch_job.rb +46 -0
data/app/jobs/easy_ml/compute_feature_job.rb +19 -0
data/app/jobs/easy_ml/deploy_job.rb +13 -0
data/app/jobs/easy_ml/finalize_feature_job.rb +15 -0
data/app/jobs/easy_ml/refresh_dataset_job.rb +32 -0
data/app/jobs/easy_ml/schedule_retraining_job.rb +11 -0
data/app/jobs/easy_ml/sync_datasource_job.rb +17 -0
data/app/jobs/easy_ml/training_job.rb +62 -0
data/app/models/easy_ml/adapters/base_adapter.rb +45 -0
data/app/models/easy_ml/adapters/polars_adapter.rb +77 -0
data/app/models/easy_ml/cleaner.rb +82 -0
data/app/models/easy_ml/column.rb +124 -0
data/app/models/easy_ml/column_history.rb +30 -0
data/app/models/easy_ml/column_list.rb +122 -0
data/app/models/easy_ml/concerns/configurable.rb +61 -0
data/app/models/easy_ml/concerns/versionable.rb +19 -0
data/app/models/easy_ml/dataset.rb +767 -0
data/app/models/easy_ml/dataset_history.rb +56 -0
data/app/models/easy_ml/datasource.rb +182 -0
data/app/models/easy_ml/datasource_history.rb +24 -0
data/app/models/easy_ml/datasources/base_datasource.rb +54 -0
data/app/models/easy_ml/datasources/file_datasource.rb +58 -0
data/app/models/easy_ml/datasources/polars_datasource.rb +89 -0
data/app/models/easy_ml/datasources/s3_datasource.rb +97 -0
data/app/models/easy_ml/deploy.rb +114 -0
data/app/models/easy_ml/event.rb +79 -0
data/app/models/easy_ml/feature.rb +437 -0
data/app/models/easy_ml/feature_history.rb +38 -0
data/app/models/easy_ml/model.rb +575 -41
data/app/models/easy_ml/model_file.rb +133 -0
data/app/models/easy_ml/model_file_history.rb +24 -0
data/app/models/easy_ml/model_history.rb +51 -0
data/app/models/easy_ml/models/base_model.rb +58 -0
data/app/models/easy_ml/models/hyperparameters/base.rb +99 -0
data/app/models/easy_ml/models/hyperparameters/xgboost/dart.rb +82 -0
data/app/models/easy_ml/models/hyperparameters/xgboost/gblinear.rb +82 -0
data/app/models/easy_ml/models/hyperparameters/xgboost/gbtree.rb +97 -0
data/app/models/easy_ml/models/hyperparameters/xgboost.rb +71 -0
data/app/models/easy_ml/models/xgboost/evals_callback.rb +138 -0
data/app/models/easy_ml/models/xgboost/progress_callback.rb +39 -0
data/app/models/easy_ml/models/xgboost.rb +544 -5
data/app/models/easy_ml/prediction.rb +44 -0
data/app/models/easy_ml/retraining_job.rb +278 -0
data/app/models/easy_ml/retraining_run.rb +184 -0
data/app/models/easy_ml/settings.rb +37 -0
data/app/models/easy_ml/splitter.rb +90 -0
data/app/models/easy_ml/splitters/base_splitter.rb +28 -0
data/app/models/easy_ml/splitters/date_splitter.rb +91 -0
data/app/models/easy_ml/splitters/predefined_splitter.rb +74 -0
data/app/models/easy_ml/splitters/random_splitter.rb +82 -0
data/app/models/easy_ml/tuner_job.rb +56 -0
data/app/models/easy_ml/tuner_run.rb +31 -0
data/app/models/splitter_history.rb +6 -0
data/app/serializers/easy_ml/column_serializer.rb +27 -0
data/app/serializers/easy_ml/dataset_serializer.rb +73 -0
data/app/serializers/easy_ml/datasource_serializer.rb +64 -0
data/app/serializers/easy_ml/feature_serializer.rb +27 -0
data/app/serializers/easy_ml/model_serializer.rb +90 -0
data/app/serializers/easy_ml/retraining_job_serializer.rb +22 -0
data/app/serializers/easy_ml/retraining_run_serializer.rb +39 -0
data/app/serializers/easy_ml/settings_serializer.rb +9 -0
data/app/views/layouts/easy_ml/application.html.erb +15 -0
data/config/initializers/resque.rb +3 -0
data/config/resque-pool.yml +6 -0
data/config/routes.rb +39 -0
data/config/spring.rb +1 -0
data/config/vite.json +15 -0
data/lib/easy_ml/configuration.rb +64 -0
data/lib/easy_ml/core/evaluators/base_evaluator.rb +53 -0
data/lib/easy_ml/core/evaluators/classification_evaluators.rb +126 -0
data/lib/easy_ml/core/evaluators/regression_evaluators.rb +66 -0
data/lib/easy_ml/core/model_evaluator.rb +161 -89
data/lib/easy_ml/core/tuner/adapters/base_adapter.rb +28 -18
data/lib/easy_ml/core/tuner/adapters/xgboost_adapter.rb +4 -25
data/lib/easy_ml/core/tuner.rb +123 -62
data/lib/easy_ml/core.rb +0 -3
data/lib/easy_ml/core_ext/hash.rb +24 -0
data/lib/easy_ml/core_ext/pathname.rb +11 -5
data/lib/easy_ml/data/date_converter.rb +90 -0
data/lib/easy_ml/data/filter_extensions.rb +31 -0
data/lib/easy_ml/data/polars_column.rb +126 -0
data/lib/easy_ml/data/polars_reader.rb +297 -0
data/lib/easy_ml/data/preprocessor.rb +280 -142
data/lib/easy_ml/data/simple_imputer.rb +255 -0
data/lib/easy_ml/data/splits/file_split.rb +252 -0
data/lib/easy_ml/data/splits/in_memory_split.rb +54 -0
data/lib/easy_ml/data/splits/split.rb +95 -0
data/lib/easy_ml/data/splits.rb +9 -0
data/lib/easy_ml/data/statistics_learner.rb +93 -0
data/lib/easy_ml/data/synced_directory.rb +341 -0
data/lib/easy_ml/data.rb +6 -2
data/lib/easy_ml/engine.rb +105 -6
data/lib/easy_ml/feature_store.rb +227 -0
data/lib/easy_ml/features.rb +61 -0
data/lib/easy_ml/initializers/inflections.rb +17 -3
data/lib/easy_ml/logging.rb +2 -2
data/lib/easy_ml/predict.rb +74 -0
data/lib/easy_ml/railtie/generators/migration/migration_generator.rb +192 -36
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_column_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_columns.rb.tt +25 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_dataset_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_datasets.rb.tt +31 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_datasource_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_datasources.rb.tt +16 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_deploys.rb.tt +24 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_events.rb.tt +20 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_feature_histories.rb.tt +14 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_features.rb.tt +32 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_model_file_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_model_files.rb.tt +17 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_model_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_models.rb.tt +20 -9
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_predictions.rb.tt +17 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_retraining_jobs.rb.tt +77 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_settings.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_splitter_histories.rb.tt +9 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_splitters.rb.tt +15 -0
data/lib/easy_ml/railtie/templates/migration/create_easy_ml_tuner_jobs.rb.tt +40 -0
data/lib/easy_ml/support/est.rb +5 -1
data/lib/easy_ml/support/file_rotate.rb +79 -15
data/lib/easy_ml/support/file_support.rb +9 -0
data/lib/easy_ml/support/local_file.rb +24 -0
data/lib/easy_ml/support/lockable.rb +62 -0
data/lib/easy_ml/support/synced_file.rb +103 -0
data/lib/easy_ml/support/utc.rb +5 -1
data/lib/easy_ml/support.rb +6 -3
data/lib/easy_ml/version.rb +4 -1
data/lib/easy_ml.rb +7 -2
metadata +355 -72
data/app/models/easy_ml/models.rb +0 -5
data/lib/easy_ml/core/model.rb +0 -30
data/lib/easy_ml/core/model_core.rb +0 -181
data/lib/easy_ml/core/models/hyperparameters/base.rb +0 -34
data/lib/easy_ml/core/models/hyperparameters/xgboost.rb +0 -19
data/lib/easy_ml/core/models/xgboost.rb +0 -10
data/lib/easy_ml/core/models/xgboost_core.rb +0 -220
data/lib/easy_ml/core/models.rb +0 -10
data/lib/easy_ml/core/uploaders/model_uploader.rb +0 -24
data/lib/easy_ml/core/uploaders.rb +0 -7
data/lib/easy_ml/data/dataloader.rb +0 -6
data/lib/easy_ml/data/dataset/data/preprocessor/statistics.json +0 -31
data/lib/easy_ml/data/dataset/data/sample_info.json +0 -1
data/lib/easy_ml/data/dataset/dataset/files/sample_info.json +0 -1
data/lib/easy_ml/data/dataset/splits/file_split.rb +0 -140
data/lib/easy_ml/data/dataset/splits/in_memory_split.rb +0 -49
data/lib/easy_ml/data/dataset/splits/split.rb +0 -98
data/lib/easy_ml/data/dataset/splits.rb +0 -11
data/lib/easy_ml/data/dataset/splitters/date_splitter.rb +0 -43
data/lib/easy_ml/data/dataset/splitters.rb +0 -9
data/lib/easy_ml/data/dataset.rb +0 -430
data/lib/easy_ml/data/datasource/datasource_factory.rb +0 -60
data/lib/easy_ml/data/datasource/file_datasource.rb +0 -40
data/lib/easy_ml/data/datasource/merged_datasource.rb +0 -64
data/lib/easy_ml/data/datasource/polars_datasource.rb +0 -41
data/lib/easy_ml/data/datasource/s3_datasource.rb +0 -89
data/lib/easy_ml/data/datasource.rb +0 -33
data/lib/easy_ml/data/preprocessor/preprocessor.rb +0 -205
data/lib/easy_ml/data/preprocessor/simple_imputer.rb +0 -402
data/lib/easy_ml/deployment.rb +0 -5
data/lib/easy_ml/support/synced_directory.rb +0 -134
data/lib/easy_ml/transforms.rb +0 -29
/data/{lib/easy_ml/core → app/models/easy_ml}/models/hyperparameters.rb +0 -0

checksums.yaml CHANGED Viewed

@@ -1,7 +1,7 @@
 ---
 SHA256:
-  metadata.gz: 194dfdb77406b2509c29056d821804bbf388552d675d2fb08ee5bad296119c58
-  data.tar.gz: e456e94893d3f51f2432355f3b6ce94feda95066f7258f57499122549bebfbe5
+  metadata.gz: 62ec6069cb9e47af4d2fd29668202132af589b1fb526b93c8bd4766aec5df3b1
+  data.tar.gz: 6e06d4e607d50b74f8d7ad5a881380d05bed58f351bc22357bfa3e5038850322
 SHA512:
-  metadata.gz: 279ca003173f2acdd2dcc802cc96fb479658edfd86e6c773dca7615fe550aa3e80999c2c2c8e665ee5affe5fa5b10c888e78c0e426688dc2ce1978d420773722
-  data.tar.gz: 6443bb0f2e3560a0b9f28fe5d657b58bae75a56756db3193dd86bfa0772c19a66350d46d595b4ce133ab328dfdc3893ab1b06ae78c54330ae1a3174e9fc390a7
+  metadata.gz: 61eed2f9f210fd5ac38af1b0972d369d73e5853491a5889c0b04c9dd776e5509514ab98ac56ab8e3bd876223a72a5463c29baa238899220acd369ee5e58c3206
+  data.tar.gz: d266908a752c337c7817484af4235ba78b38e47495d25fe815feafad11b820cd63ca47300619c46f56971d810b2a475a3ebb2c436359026ff5f2f5f794cb0bd1

data/README.md CHANGED Viewed

@@ -2,13 +2,33 @@
 # EasyML
-EasyML is a Ruby gem designed to simplify the process of building, deploying, and managing the lifecycle of machine learning models within a Ruby on Rails application. It is a plug-and-play, opinionated framework that currently supports XGBoost, with plans to expand support to a variety of models and infrastructures. EasyML aims to make deployment and lifecycle management straightforward and efficient.
+~~You can't do machine learning in Ruby.~~
+Deploy models in minutes.
+## What is EasyML?
+EasyML is a **low code/no code**, end-to-end machine learning framework for Ruby on Rails.
+**Get productionized models in minutes.** It takes the guesswork out of:
+- Preprocessing data
+- Storing and batch computing features
+- Training models
+- Metric visualization
+- Deployment and versioning
+- Evaluating model performance
+With a dead-simple point-and-click interface, EasyML makes it stupid easy to train and deploy.
+Oh yeah, and it's open source!
 ## Features
-- **Plug-and-Play Architecture**: EasyML is designed to be easily extendable, allowing for the integration of various machine learning models and data sources.
-- **Opinionated Framework**: Provides a structured approach to model management, ensuring best practices are followed.
-- **Model Lifecycle On Rails**: Seamlessly integrates with Ruby on Rails, allowing simplified deployment of models to production.
+- **No Code (if you want)**: EasyML ships as a Rails engine. Just mount it in your app and get started.
+- **Opinionated Framework**: Provides a structured approach to data and model management, ensuring best practices are followed.
+- **Model Lifecycle On Rails**: Want predictions directly from your Rails app? You can do that.
+- **Easily Extensible**: Want a model that's not supported? Send a pull request!
 ## Current and Planned Features
@@ -89,6 +109,14 @@ MyTrainer.predict(customer_data: "I am worth a lot of money")
 # prediction: true!
 ```
+## Mount The Engine
+```ruby
+Rails.application.routes.draw do
+  mount EasyML::Engine, at: "easy_ml"
+end
+```
 ## Data Management
 EasyML provides a comprehensive data management system that handles all preprocessing tasks, including splitting data into train, test, and validation sets, and avoiding data leakage. The primary abstraction for data handling is the `Dataset` class, which ensures data is properly managed and prepared for machine learning tasks.
@@ -153,12 +181,12 @@ EasyML offers a variety of preprocessing features to prepare your data for machi
   }
   ```
-- **Label Encoding**: Convert categorical variables into integer labels. Use this when you have categorical data that can be ordinally encoded.
+- **Ordinal Encoding**: Convert categorical variables into integer labels. Use this when you have categorical data that can be ordinally encoded.
   ```ruby
   loan_purpose: {
     categorical: {
-      encode_labels: true
+      ordinal_encoding: true
     }
   }
   ```
@@ -170,6 +198,198 @@ EasyML offers a variety of preprocessing features to prepare your data for machi
 - **Batch Processing**: Process data in batches to handle large datasets efficiently.
 - **Null Handling**: Alert and handle null values in datasets to ensure data quality.
+## Feature Store
+The Feature Store is a powerful component of EasyML that helps you manage, compute, and serve features for your machine learning models. Here's how to use it effectively:
+### Setting Up Features
+1. Create a `features` directory in your application:
+```bash
+mkdir app/features
+```
+2. Create feature classes in this directory. Each feature should include the `EasyML::Features` module:
+```ruby
+class MyFeature
+  include EasyML::Features
+  def transform(df, feature)
+    # Your feature transformation logic here
+  end
+  feature name: "My Feature",
+          description: "Description of what this feature does"
+end
+```
+### Feature Types and Configurations
+#### Simple Transform-Only Features
+For features that can be computed using only the input columns:
+```ruby
+class DidConvert
+  include EasyML::Features
+  def transform(df, feature)
+    df.with_column(
+      (Polars.col("rev") > 0).alias("did_convert")
+    )
+  end
+  feature name: "did_convert",
+          description: "Boolean indicating if conversion occurred"
+end
+```
+#### Batch Processing Features
+For features that require processing large datasets in chunks:
+```ruby
+class LastConversionTimeFeature
+  include EasyML::Features
+  def batch(reader, feature)
+    # Efficiently query only the company_id column for batching
+    # This will create batches of batch_size records (default 1000)
+    reader.query(select: ["company_id"], unique: true)["company_id"]
+  end
+  def fit(reader, feature, options = {})
+    batch_start = options.dig(:batch_start)
+    batch_end = options.dig(:batch_end)
+    # More efficient than is_in for continuous ranges
+    df = reader.query(
+      filter: Polars.col("company_id").is_between(batch_start, batch_end),
+      select: ["id", "company_id", "converted_at", "created_at"],
+      sort: ["company_id", "created_at"]
+    )
+    # For each company, find the last time they converted before each application
+    #
+    # This value will be cached in the feature store for fast inference retrieval
+    df.with_columns([
+      Polars.col("converted_at")
+        .shift(1)
+        .filter(Polars.col("converted_at").is_not_null())
+        .over("company_id")
+        .alias("last_conversion_time"),
+      # Also compute days since last conversion
+      (Polars.col("created_at") - Polars.col("last_conversion_time"))
+        .dt.days()
+        .alias("days_since_last_conversion")
+    ])[["id", "last_conversion_time", "days_since_last_conversion"]]
+  end
+  def transform(df, feature)
+    # Pull the pre-computed values from the feature store
+    stored_df = feature.query(filter: Polars.col("id").is_in(df["id"]))
+    return df if stored_df.empty?
+    df.join(stored_df, on: "id", how: "left")
+  end
+  feature name: "Last Conversion Time",
+          description: "Computes the last time a company converted before each application",
+          batch_size: 1000,  # Process 1000 companies at a time
+          primary_key: "id",
+          cache_for: 24.hours  # Cache feature values for 24 hours after running fit
+end
+```
+This example demonstrates several key concepts:
+1. **Efficient Batching**: The `batch` method uses the reader to lazily query only the necessary column for batching
+1. **Batches Groups Together**: All records with the same `company_id` need to be in the same batch to properly compute the feature, so we create a custom batch (instead of using the primary key `id` column, which would split up companies into different batches)
+1. **Column Selection**: Only selects required columns in the reader query
+1. **Feature Computation**: Computes multiple related features (last conversion time and days since) in a single pass.
+1. **Automatic Feature Store Caching**: The feature store automatically caches feature values returned from the `fit` method
+### Performance Optimization
+#### Caching During Development
+Use `cache_for` to save processing time during development:
+```ruby
+feature name: "My Feature",
+        cache_for: 24.hours # After running fit, this feature will be cached for 24 hours (unless new data is read from datasource, like S3)
+```
+#### Early Returns
+Always implement early returns in your transform method to avoid unnecessary reprocessing:
+```ruby
+def transform(df, feature)
+  return df if df["required_column"].nil?
+  # Feature computation logic
+end
+```
+#### Using Reader vs DataFrame
+- The Polars `reader` is a lazy reader that allows you to query data incrementally.
+- If your feature includes a `batch` method or uses the `batch_size` variable, you will receive a reader instead of a dataframe in the `fit` method
+```ruby
+def fit(reader, feature)
+  df = reader.query(select: ["column1", "column2"])
+  # Process only needed columns
+end
+```
+- If you don't have a `batch` method or don't use the `batch_size` variable, you will receive a dataframe in the `fit` method
+````ruby
+def fit(df, feature)
+  # process directly on dataframe
+end
+- To ensure you get a reader instead of a dataframe, include the `batch` method
+```ruby
+def batch(reader, feature)
+  reader.query(select: ["column1"])["column1"]
+end
+feature name: "My Feature", batch_size: 1_000
+````
+### Production Considerations
+#### Handling Missing Data
+When processing historical data:
+1. Check for missing dates:
+```ruby
+def transform(df, feature)
+  missing_dates = feature.store.missing_dates(start_date, end_date)
+  return df if missing_dates.empty?
+  # Process only missing dates
+  process_dates(df, missing_dates)
+end
+```
+### Best Practices
+1. Always specify a `primary_key` to allow the feature store to partition your data
+1. Use `batch/fit` to process large datasets in batches
+1. Use `batch/fit` to allow faster inference feature computation
+1. Use transform-only features when all required columns will be available on the inference dataset
+1. Use `cache_for` to save processing time during development
+1. Only query necessary columns using the reader
 ## Installation
 Install necessary Python dependencies
@@ -194,26 +414,6 @@ pip install optuna
    rails db:migrate
    ```
-3. **Configure CarrierWave for S3 storage**:
-   Ensure you have CarrierWave configured to use AWS S3. If not, add the following configuration:
-   ```ruby
-   # config/initializers/carrierwave.rb
-   CarrierWave.configure do |config|
-     config.fog_provider = 'fog/aws'
-     config.fog_credentials = {
-       provider: 'AWS',
-       aws_access_key_id: ENV['AWS_ACCESS_KEY_ID'],
-       aws_secret_access_key: ENV['AWS_SECRET_ACCESS_KEY'],
-       region: ENV['AWS_REGION'],
-     }
-     config.fog_directory = ENV['AWS_S3_BUCKET']
-     config.fog_public = false
-     config.storage = :fog
-   end
-   ```
 ## Usage
 To use EasyML in your Rails application, follow these steps:
@@ -251,6 +451,14 @@ To install this gem onto your local machine, run `bundle exec rake install`. To
 ## Contributing
+1. Install Appraisals gemfiles:
+```bash
+bundle exec appraisal install
+```
+2. Ensure you run tests against all supported Rails versions
 Bug reports and pull requests are welcome on GitHub at https://github.com/[USERNAME]/easy_ml. This project is intended to be a safe, welcoming space for collaboration, and contributors are expected to adhere to the [code of conduct](https://github.com/[USERNAME]/easy_ml/blob/main/CODE_OF_CONDUCT.md).
 ## License

data/Rakefile CHANGED Viewed

@@ -1,5 +1,6 @@
 # frozen_string_literal: true
+require "sprockets/railtie"
 require "bundler/gem_tasks"
 require "rspec/core/rake_task"
@@ -10,3 +11,47 @@ require "rubocop/rake_task"
 RuboCop::RakeTask.new
 task default: %i[spec rubocop]
+Bundler.require(:default)
+# Load your gem's code
+require_relative "lib/easy_ml"
+# Load the annotate tasks
+require "annotate/annotate_models"
+task :environment do
+  require "combustion"
+  require "sprockets"
+  Combustion.path = "spec/internal"
+  Combustion.initialize! :active_record do |config|
+    config.assets = ActiveSupport::OrderedOptions.new # Stub to avoid errors
+    config.assets.enabled = false # Set false since assets are handled by Vite
+  end
+  EasyML::Engine.eager_load!
+end
+namespace :easy_ml do
+  task annotate_models: :environment do
+    model_dir = File.expand_path("app/models", EasyML::Engine.root)
+    $LOAD_PATH.unshift(model_dir) unless $LOAD_PATH.include?(model_dir)
+    AnnotateModels.do_annotations(
+      is_rake: true,
+      model_dir: [EasyML::Engine.root.join("app/models/easy_ml").to_s],
+      root_dir: [EasyML::Engine.root.join("app/models/easy_ml").to_s],
+      include_modules: true, # Include modules/namespaces in the annotation
+    )
+  end
+  task :create_test_migrations do
+    require "combustion"
+    require "rails/generators"
+    require_relative "lib/easy_ml/railtie/generators/migration/migration_generator"
+    db_files = Dir.glob(EasyML::Engine.root.join("spec/internal/db/migrate/**/*"))
+    FileUtils.rm(db_files)
+    Rails::Generators.invoke("easy_ml:migration", [], { destination_root: EasyML::Engine.root.join("spec/internal") })
+  end
+end

data/app/controllers/easy_ml/application_controller.rb ADDED Viewed

@@ -0,0 +1,67 @@
+require "action_controller"
+module EasyML
+  class ApplicationController < ActionController::Base
+    helper EasyML::ApplicationHelper
+    include InertiaRails::Controller
+    layout "easy_ml/application"
+    protect_from_forgery with: :exception
+    before_action :hot_reload
+    def hot_reload
+      return unless Rails.env.development? && ENV["EASY_ML_DEMO_APP"]
+      Dir[EasyML::Engine.root.join("lib/**/*")].select { |f| Pathname.new(f).extname == ".rb" }.each do |file|
+        load file
+      end
+    end
+    def settings_to_json(settings)
+      SettingsSerializer.new(settings).serializable_hash.dig(:data, :attributes)
+    end
+    def dataset_to_json(dataset)
+      DatasetSerializer.new(dataset).serializable_hash.dig(:data, :attributes)
+    end
+    def datasource_to_json(datasource)
+      DatasourceSerializer.new(datasource).serializable_hash.dig(:data, :attributes)
+    end
+    def model_to_json(model)
+      ModelSerializer.new(model).serializable_hash.dig(:data, :attributes)
+    end
+    def retraining_job_to_json(job)
+      RetrainingJobSerializer.new(job).serializable_hash.dig(:data, :attributes)
+    end
+    def retraining_run_to_json(run)
+      RetrainingRunSerializer.new(run).serializable_hash.dig(:data, :attributes)
+    end
+    def easy_ml_root
+      Rails.application.routes.routes.find { |r| r.app.app == EasyML::Engine }&.path&.spec&.to_s
+    end
+    inertia_share do
+      flash_messages = []
+      flash_messages << { type: "success", message: flash[:notice] } if flash[:notice]
+      flash_messages << { type: "error", message: flash[:alert] } if flash[:alert]
+      flash_messages << { type: "info", message: flash[:info] } if flash[:info]
+      {
+        rootPath: easy_ml_root,
+        url: request.path.gsub(Regexp.new(easy_ml_root), ""),
+        errors: session.delete(:errors) || {},
+        flash: flash_messages,
+      }
+    end
+  end
+end

data/app/controllers/easy_ml/columns_controller.rb ADDED Viewed

@@ -0,0 +1,38 @@
+# == Schema Information
+#
+# Table name: easy_ml_columns
+#
+#  id                  :bigint           not null, primary key
+#  dataset_id          :bigint           not null
+#  name                :string           not null
+#  description         :string
+#  datatype            :string
+#  polars_datatype     :string
+#  is_target           :boolean
+#  hidden              :boolean          default(FALSE)
+#  drop_if_null        :boolean          default(FALSE)
+#  preprocessing_steps :json
+#  sample_values       :json
+#  statistics          :json
+#  created_at          :datetime         not null
+#  updated_at          :datetime         not null
+#
+module EasyML
+  class ColumnsController < ApplicationController
+    def update
+      @column = EasyML::Column.find(params[:id])
+      if @column.update(column_params)
+        head :ok
+      else
+        render json: { errors: @column.errors }, status: :unprocessable_entity
+      end
+    end
+    private
+    def column_params
+      params.require(:column).permit(:hidden)
+    end
+  end
+end

data/app/controllers/easy_ml/datasets_controller.rb ADDED Viewed

@@ -0,0 +1,156 @@
+# == Schema Information
+#
+# Table name: easy_ml_datasets
+#
+#  id                      :bigint           not null, primary key
+#  name                    :string           not null
+#  description             :string
+#  dataset_type            :string
+#  status                  :string
+#  version                 :string
+#  datasource_id           :bigint
+#  root_dir                :string
+#  configuration           :json
+#  num_rows                :bigint
+#  workflow_status         :string
+#  statistics              :json
+#  preprocessor_statistics :json
+#  schema                  :json
+#  refreshed_at            :datetime
+#  created_at              :datetime         not null
+#  updated_at              :datetime         not null
+#
+module EasyML
+  class DatasetsController < ApplicationController
+    def index
+      datasets = Dataset.all
+      render inertia: "pages/DatasetsPage", props: {
+        datasets: datasets.map { |dataset| dataset_to_json(dataset) },
+        constants: Dataset.constants,
+      }
+    end
+    def new
+      render inertia: "pages/NewDatasetPage", props: {
+        constants: Dataset.constants,
+        datasources: Datasource.all.map { |datasource| datasource_to_json(datasource) },
+      }
+    end
+    def create
+      EasyML::Datasource.find_by(id: params.dig(:dataset, :datasource_id))
+      dataset = Dataset.new(dataset_params.to_h)
+      if dataset.save
+        redirect_to easy_ml_datasets_path, notice: "Dataset was successfully created."
+      else
+        redirect_to new_easy_ml_dataset_path, alert: dataset.errors.full_messages.join(", ")
+      end
+    end
+    def destroy
+      dataset = Dataset.find(params[:id])
+      if dataset.destroy
+        redirect_to easy_ml_datasets_path, notice: "Dataset was successfully deleted."
+      else
+        redirect_to easy_ml_datasets_path, alert: "Failed to delete dataset."
+      end
+    end
+    def show
+      dataset = Dataset.find(params[:id])
+      render inertia: "pages/DatasetDetailsPage", props: {
+        dataset: dataset_to_json(dataset),
+        constants: Dataset.constants,
+      }
+    end
+    def update
+      dataset = Dataset.find(params[:id])
+      # Iterate over columns to check and update preprocessing_steps
+      dataset_params[:columns_attributes]&.each do |_, column_attrs|
+        column_attrs[:preprocessing_steps] = nil if column_attrs.dig(:preprocessing_steps, :training, :method) == "none"
+      end
+      if dataset.update(dataset_params)
+        flash.now[:notice] = "Dataset configuration was successfully updated."
+        render inertia: "pages/DatasetDetailsPage", props: {
+          dataset: dataset_to_json(dataset),
+          constants: Dataset.constants,
+        }
+      else
+        flash.now[:error] = dataset.errors.full_messages.join(", ")
+        render inertia: "pages/DatasetDetailsPage", props: {
+          dataset: dataset_to_json(dataset),
+          constants: Dataset.constants,
+        }
+      end
+    end
+    def refresh
+      dataset = Dataset.find(params[:id])
+      dataset.refresh_async
+      redirect_to easy_ml_datasets_path, notice: "Dataset refresh has been initiated."
+    end
+    private
+    def preprocessing_params
+      [:method, { params: [:constant, :categorical_min, :one_hot, :ordinal_encoding, { clip: %i[min max] }] }]
+    end
+    def dataset_params
+      params.require(:dataset).permit(
+        :name,
+        :description,
+        :datasource_id,
+        :target,
+        drop_cols: [],
+        splitter_attributes: %i[
+          splitter_type
+          date_col
+          months_test
+          months_valid
+          train_ratio
+          test_ratio
+          valid_ratio
+          train_files
+          test_files
+          valid_files
+        ],
+        columns_attributes: [
+          :id,
+          :name,
+          :type,
+          :description,
+          :datatype,
+          :polars_datatype,
+          :is_target,
+          :hidden,
+          :drop_if_null,
+          :sample_values,
+          :_destroy,
+          {
+            preprocessing_steps: {
+              training: preprocessing_params,
+              inference: preprocessing_params,
+            },
+            statistics: %i[mean median min max null_count],
+          },
+        ],
+        features_attributes: %i[
+          id
+          name
+          feature_class
+          feature_position
+          _destroy
+        ],
+      )
+    end
+  end
+end