MCPcopy Create free account

hub / github.com/Riley702/enhanced_benchmark_tool / functions

Functions72 in github.com/Riley702/enhanced_benchmark_tool

↓ 2 callersFunctioncompute_adjusted_r2
Computes Adjusted R² Score for regression models. Args: y_true (array-like): True target values. y_pred (array-like): Predic
src/evaluation_metrics.py:197
↓ 2 callersFunctionprofile_dataset
Generate a basic statistical profile for a CSV dataset. Args: file_path: Path to a CSV file. Returns: A dictionary containin
src/enhanced_benchmark_tool/dataset_profiling.py:8
↓ 1 callersFunctionbenchmark_model
Benchmarks a machine learning model for classification or regression. Args: model: Scikit-learn compatible model. X (pd.Data
src/feature_importance.py:20
↓ 1 callersFunctionbenchmark_model
Benchmark a model for classification or regression. Returns a dict of metrics and timing.
src/enhanced_benchmark_tool/model_benchmarking.py:22
↓ 1 callersFunctionbuild_parser
()
src/enhanced_benchmark_tool/cli.py:9
↓ 1 callersFunctionextract_feature_importance
Extracts and returns feature importance from a fitted model, if available. Args: model: A trained scikit-learn compatible model.
src/feature_importance.py:78
↓ 1 callersFunctionextract_feature_importance
Extract normalized feature importance from a fitted model. Supports tree models with feature_importances_ and linear models with coef_.
src/enhanced_benchmark_tool/model_benchmarking.py:79
↓ 1 callersFunctionplot_confusion_matrix
Plots a confusion matrix. Args: y_true (array-like): True labels. y_pred (array-like): Predicted labels. labels (lis
src/visualizations.py:52
↓ 1 callersFunctionplot_feature_importance
Plots feature importance as a horizontal bar chart. Args: feature_importance (dict): Dictionary of feature names and their importanc
src/visualizations.py:31
↓ 1 callersFunctionplot_metrics
Plots benchmark metrics as a bar chart. Args: metrics (dict): Dictionary of benchmark metrics.
src/visualizations.py:10
Functionanalyze_column_types
Analyzes and summarizes the types of columns in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: dict: Cou
src/dataset_profiling.py:209
Functioncalculate_metrics_comparison
Compares multiple machine learning models on a given dataset. Args: models (dict): A dictionary where keys are model names and value
src/evaluation_metrics.py:34
Functioncheck_class_balance
Checks the balance of classes in a categorical target variable. Args: df (pd.DataFrame): Input dataset. target_column (str):
src/dataset_profiling.py:76
Functioncheck_class_balance
Checks the balance of classes in a categorical target variable. Args: df (pd.DataFrame): Input dataset. target_column (str):
src/model_benchmarking.py:75
Functioncompute_classification_confusion_matrices
Computes confusion matrices for multiple classification models. Args: models (dict): Dictionary of classification models. X
src/evaluation_metrics.py:96
Functioncompute_classification_report
Computes a detailed classification report for multiple models. Args: models (dict): Dictionary of classification models. X (
src/evaluation_metrics.py:168
Functioncompute_feature_cardinality
Computes the number of unique values for categorical features. Args: df (pd.DataFrame): Input dataset. categorical_features
src/dataset_profiling.py:169
Functioncompute_regression_errors
Computes additional error metrics for multiple regression models. Args: models (dict): Dictionary of regression models. X (p
src/evaluation_metrics.py:126
Functiondetect_anomalous_values
Identifies anomalous values based on standard deviations from the mean. Args: df (pd.DataFrame): Input dataset. numerical_fe
src/dataset_profiling.py:184
Functiondetect_constant_columns
Identifies columns with constant values. Args: df (pd.DataFrame): Input dataset. Returns: list: List of constant column
src/dataset_profiling.py:155
Functiondetect_duplicate_rows
Identifies duplicate rows in a dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Duplicate rows i
src/dataset_profiling.py:141
Functiondetect_duplicate_rows
Identifies duplicate rows in a dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Duplicate rows i
src/model_benchmarking.py:140
Functiondetect_missing_values
Identifies missing values in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Table showing
src/dataset_profiling.py:27
Functiondetect_missing_values
Identifies missing values in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Table showing
src/model_benchmarking.py:26
Functiondetect_outliers
Identifies outliers in numerical columns using the IQR method. Args: df (pd.DataFrame): Input dataset. threshold (float): Th
src/dataset_profiling.py:50
Functiondetect_outliers
Identifies outliers in numerical columns using the IQR method. Args: df (pd.DataFrame): Input dataset. threshold (float): Th
src/model_benchmarking.py:49
Functiondetect_outliers_iqr
Identifies outliers in numerical features using the Interquartile Range (IQR) method. Args: df (pd.DataFrame): Dataset containing nu
src/data_preprocessing.py:65
Functionevaluate_model_with_classification_report
Generates a classification report with precision, recall, and F1-score. Args: model: A scikit-learn compatible classification model.
src/feature_importance.py:225
Functionevaluate_model_with_cohen_kappa
Evaluates a classification model using Cohen's Kappa score. Args: model: A scikit-learn compatible classification model. X (
src/feature_importance.py:381
Functionevaluate_model_with_confidence_interval
Estimates the confidence interval for model accuracy using bootstrapping. Args: model: A scikit-learn compatible classification mode
src/evaluation_metrics.py:214
Functionevaluate_model_with_log_loss
Evaluates a classification model using log loss. Args: model: A scikit-learn compatible classification model with `predict_proba` me
src/feature_importance.py:256
Functionevaluate_model_with_mean_squared_log_error
Evaluates a regression model using Mean Squared Log Error (MSLE). Args: model: A scikit-learn compatible regression model. X
src/feature_importance.py:410
Functionevaluate_model_with_median_absolute_error
Evaluates a regression model using the median absolute error. Args: model: A scikit-learn compatible regression model. X (pd
src/feature_importance.py:288
Functionevaluate_model_with_roc_auc
Evaluates a classification model using ROC AUC score and plots the ROC curve. Args: model: A scikit-learn compatible classification
src/feature_importance.py:179
Functionevaluate_model_with_thresholds
Evaluates a classification model with varying probability thresholds. Args: model: A scikit-learn compatible classification model wi
src/feature_importance.py:133
Functionfind_high_missing_columns
Identifies columns with missing value percentage higher than the given threshold. Args: df (pd.DataFrame): Input dataset. th
src/dataset_profiling.py:227
Functiongenerate_summary_statistics
Computes additional summary statistics for numerical features. Args: df (pd.DataFrame): Input dataset. Returns: pd.Data
src/dataset_profiling.py:120
Functiongenerate_summary_statistics
Computes additional summary statistics for numerical features. Args: df (pd.DataFrame): Input dataset. Returns: pd.Data
src/model_benchmarking.py:119
Functionidentify_correlations
Identifies highly correlated features in a dataset. Args: df (pd.DataFrame): Input dataset. threshold (float): Correlation t
src/dataset_profiling.py:97
Functionidentify_correlations
Identifies highly correlated features in a dataset. Args: df (pd.DataFrame): Input dataset. threshold (float): Correlation t
src/model_benchmarking.py:96
Functioninitialize_logging
Configures logging for the package. Args: log_level (int): Logging level (default: logging.INFO). log_file (str): Path to th
src/__init__.py:64
Functionload_config
Loads configuration settings from a JSON file. Args: config_file (str): Path to the configuration file (default: 'config.json').
src/__init__.py:45
Functionmain
(argv: list[str] | None = None)
src/enhanced_benchmark_tool/cli.py:16
Functionnormalize_numerical_features
Normalizes numerical features using Min-Max Scaling. Args: df (pd.DataFrame): Dataset containing numerical features. numeric
src/data_preprocessing.py:92
Functionplot_actual_vs_predicted
Plots actual vs predicted values for regression. Args: y_true (array-like): True values. y_pred (array-like): Predicted valu
src/visualizations.py:107
Functionplot_boxplots_for_numerical_features
Creates boxplots for multiple numerical features to detect outliers. Args: df (pd.DataFrame): DataFrame containing numerical feature
src/visualizations.py:255
Functionplot_category_vs_numerical
Creates a box plot comparing a categorical feature against a numerical feature. Args: df (pd.DataFrame): Input DataFrame. ca
src/visualizations.py:288
Functionplot_class_distribution
Plots the distribution of class labels in a dataset. Args: y (array-like): Target labels.
src/visualizations.py:125
Functionplot_confusion_matrix
Plot confusion matrix.
src/enhanced_benchmark_tool/visualizations.py:52
Functionplot_correlation_matrix
Plots a heatmap of feature correlations. Args: df (pd.DataFrame): DataFrame containing numerical features.
src/visualizations.py:143
Functionplot_correlation_matrix
Plot correlation heatmap for numeric columns.
src/enhanced_benchmark_tool/visualizations.py:67
Functionplot_feature_distribution
Plots the distribution of a numerical feature. Args: df (pd.DataFrame): DataFrame containing the feature. feature (str): Col
src/visualizations.py:234
Functionplot_feature_importance
Plot feature importance as horizontal bar chart.
src/enhanced_benchmark_tool/visualizations.py:34
Functionplot_learning_curve
Plots the learning curve of a model. Args: model: A scikit-learn compatible model. X (pd.DataFrame or np.ndarray): Feature m
src/visualizations.py:198
Functionplot_learning_curve
Plot a learning curve for a model.
src/enhanced_benchmark_tool/visualizations.py:80
Functionplot_metrics
Plot metric dict as a bar chart.
src/enhanced_benchmark_tool/visualizations.py:17
Functionplot_pairwise_relationships
Plots pairwise relationships between numerical features. Args: df (pd.DataFrame): DataFrame containing numerical features. n
src/visualizations.py:271
Functionplot_precision_recall_curve
Plots the Precision-Recall curve. Args: y_true (array-like): True binary labels. y_scores (array-like): Predicted probabilit
src/visualizations.py:179
Functionplot_residuals
Plots residuals (errors) of a regression model. Args: y_true (array-like): True values. y_pred (array-like): Predicted value
src/visualizations.py:87
Functionplot_roc_curve
Plots the Receiver Operating Characteristic (ROC) curve. Args: y_true (array-like): True binary labels. y_scores (array-like
src/visualizations.py:155
Functionplot_threshold_metrics
Plots accuracy, precision, recall, and F1-score against different thresholds. Args: threshold_df (pd.DataFrame): DataFrame containin
src/visualizations.py:68
Functionpreprocess_data
Preprocesses the dataset by handling missing values, scaling numerical features, and encoding categorical features. Args: df (pd
src/data_preprocessing.py:18
Functionprofile_dataset
Generates a detailed statistical profile of the dataset. Args: file_path (str): Path to the CSV file containing dataset. Return
src/dataset_profiling.py:6
Functionprofile_dataset
Generates a detailed statistical profile of the dataset. Args: file_path (str): Path to the CSV file containing the dataset. Re
src/model_benchmarking.py:5
Functionreduce_cardinality
Reduces the cardinality of categorical features by grouping rare categories into a single category. Args: df (pd.DataFrame): The dat
src/data_preprocessing.py:109
Functionsummarize_top_n_categories
Summarizes the top N most frequent categories in a categorical column. Args: df (pd.DataFrame): Input dataset. column (str):
src/dataset_profiling.py:242
Functiontest_benchmark_model
()
tests/test_model_benchmarking.py:7
Functiontest_extract_feature_importance
()
tests/test_dataset_profiling.py:18
Functiontest_plot_confusion_matrix
()
tests/test_visualizations.py:21
Functiontest_plot_feature_importance
()
tests/test_visualizations.py:16
Functiontest_plot_metrics
()
tests/test_visualizations.py:11
Functiontest_profile_dataset
(tmp_path)
tests/test_dataset_profiling.py:7