Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/Riley702/enhanced_benchmark_tool
/ functions
Functions
72 in github.com/Riley702/enhanced_benchmark_tool
⨍
Functions
72
◇
Types & classes
0
↓ 2 callers
Function
compute_adjusted_r2
Computes Adjusted R² Score for regression models. Args: y_true (array-like): True target values. y_pred (array-like): Predic
src/evaluation_metrics.py:197
↓ 2 callers
Function
profile_dataset
Generate a basic statistical profile for a CSV dataset. Args: file_path: Path to a CSV file. Returns: A dictionary containin
src/enhanced_benchmark_tool/dataset_profiling.py:8
↓ 1 callers
Function
benchmark_model
Benchmarks a machine learning model for classification or regression. Args: model: Scikit-learn compatible model. X (pd.Data
src/feature_importance.py:20
↓ 1 callers
Function
benchmark_model
Benchmark a model for classification or regression. Returns a dict of metrics and timing.
src/enhanced_benchmark_tool/model_benchmarking.py:22
↓ 1 callers
Function
build_parser
()
src/enhanced_benchmark_tool/cli.py:9
↓ 1 callers
Function
extract_feature_importance
Extracts and returns feature importance from a fitted model, if available. Args: model: A trained scikit-learn compatible model.
src/feature_importance.py:78
↓ 1 callers
Function
extract_feature_importance
Extract normalized feature importance from a fitted model. Supports tree models with feature_importances_ and linear models with coef_.
src/enhanced_benchmark_tool/model_benchmarking.py:79
↓ 1 callers
Function
plot_confusion_matrix
Plots a confusion matrix. Args: y_true (array-like): True labels. y_pred (array-like): Predicted labels. labels (lis
src/visualizations.py:52
↓ 1 callers
Function
plot_feature_importance
Plots feature importance as a horizontal bar chart. Args: feature_importance (dict): Dictionary of feature names and their importanc
src/visualizations.py:31
↓ 1 callers
Function
plot_metrics
Plots benchmark metrics as a bar chart. Args: metrics (dict): Dictionary of benchmark metrics.
src/visualizations.py:10
Function
analyze_column_types
Analyzes and summarizes the types of columns in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: dict: Cou
src/dataset_profiling.py:209
Function
calculate_metrics_comparison
Compares multiple machine learning models on a given dataset. Args: models (dict): A dictionary where keys are model names and value
src/evaluation_metrics.py:34
Function
check_class_balance
Checks the balance of classes in a categorical target variable. Args: df (pd.DataFrame): Input dataset. target_column (str):
src/dataset_profiling.py:76
Function
check_class_balance
Checks the balance of classes in a categorical target variable. Args: df (pd.DataFrame): Input dataset. target_column (str):
src/model_benchmarking.py:75
Function
compute_classification_confusion_matrices
Computes confusion matrices for multiple classification models. Args: models (dict): Dictionary of classification models. X
src/evaluation_metrics.py:96
Function
compute_classification_report
Computes a detailed classification report for multiple models. Args: models (dict): Dictionary of classification models. X (
src/evaluation_metrics.py:168
Function
compute_feature_cardinality
Computes the number of unique values for categorical features. Args: df (pd.DataFrame): Input dataset. categorical_features
src/dataset_profiling.py:169
Function
compute_regression_errors
Computes additional error metrics for multiple regression models. Args: models (dict): Dictionary of regression models. X (p
src/evaluation_metrics.py:126
Function
detect_anomalous_values
Identifies anomalous values based on standard deviations from the mean. Args: df (pd.DataFrame): Input dataset. numerical_fe
src/dataset_profiling.py:184
Function
detect_constant_columns
Identifies columns with constant values. Args: df (pd.DataFrame): Input dataset. Returns: list: List of constant column
src/dataset_profiling.py:155
Function
detect_duplicate_rows
Identifies duplicate rows in a dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Duplicate rows i
src/dataset_profiling.py:141
Function
detect_duplicate_rows
Identifies duplicate rows in a dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Duplicate rows i
src/model_benchmarking.py:140
Function
detect_missing_values
Identifies missing values in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Table showing
src/dataset_profiling.py:27
Function
detect_missing_values
Identifies missing values in the dataset. Args: df (pd.DataFrame): Input dataset. Returns: pd.DataFrame: Table showing
src/model_benchmarking.py:26
Function
detect_outliers
Identifies outliers in numerical columns using the IQR method. Args: df (pd.DataFrame): Input dataset. threshold (float): Th
src/dataset_profiling.py:50
Function
detect_outliers
Identifies outliers in numerical columns using the IQR method. Args: df (pd.DataFrame): Input dataset. threshold (float): Th
src/model_benchmarking.py:49
Function
detect_outliers_iqr
Identifies outliers in numerical features using the Interquartile Range (IQR) method. Args: df (pd.DataFrame): Dataset containing nu
src/data_preprocessing.py:65
Function
evaluate_model_with_classification_report
Generates a classification report with precision, recall, and F1-score. Args: model: A scikit-learn compatible classification model.
src/feature_importance.py:225
Function
evaluate_model_with_cohen_kappa
Evaluates a classification model using Cohen's Kappa score. Args: model: A scikit-learn compatible classification model. X (
src/feature_importance.py:381
Function
evaluate_model_with_confidence_interval
Estimates the confidence interval for model accuracy using bootstrapping. Args: model: A scikit-learn compatible classification mode
src/evaluation_metrics.py:214
Function
evaluate_model_with_log_loss
Evaluates a classification model using log loss. Args: model: A scikit-learn compatible classification model with `predict_proba` me
src/feature_importance.py:256
Function
evaluate_model_with_mean_squared_log_error
Evaluates a regression model using Mean Squared Log Error (MSLE). Args: model: A scikit-learn compatible regression model. X
src/feature_importance.py:410
Function
evaluate_model_with_median_absolute_error
Evaluates a regression model using the median absolute error. Args: model: A scikit-learn compatible regression model. X (pd
src/feature_importance.py:288
Function
evaluate_model_with_roc_auc
Evaluates a classification model using ROC AUC score and plots the ROC curve. Args: model: A scikit-learn compatible classification
src/feature_importance.py:179
Function
evaluate_model_with_thresholds
Evaluates a classification model with varying probability thresholds. Args: model: A scikit-learn compatible classification model wi
src/feature_importance.py:133
Function
find_high_missing_columns
Identifies columns with missing value percentage higher than the given threshold. Args: df (pd.DataFrame): Input dataset. th
src/dataset_profiling.py:227
Function
generate_summary_statistics
Computes additional summary statistics for numerical features. Args: df (pd.DataFrame): Input dataset. Returns: pd.Data
src/dataset_profiling.py:120
Function
generate_summary_statistics
Computes additional summary statistics for numerical features. Args: df (pd.DataFrame): Input dataset. Returns: pd.Data
src/model_benchmarking.py:119
Function
identify_correlations
Identifies highly correlated features in a dataset. Args: df (pd.DataFrame): Input dataset. threshold (float): Correlation t
src/dataset_profiling.py:97
Function
identify_correlations
Identifies highly correlated features in a dataset. Args: df (pd.DataFrame): Input dataset. threshold (float): Correlation t
src/model_benchmarking.py:96
Function
initialize_logging
Configures logging for the package. Args: log_level (int): Logging level (default: logging.INFO). log_file (str): Path to th
src/__init__.py:64
Function
load_config
Loads configuration settings from a JSON file. Args: config_file (str): Path to the configuration file (default: 'config.json').
src/__init__.py:45
Function
main
(argv: list[str] | None = None)
src/enhanced_benchmark_tool/cli.py:16
Function
normalize_numerical_features
Normalizes numerical features using Min-Max Scaling. Args: df (pd.DataFrame): Dataset containing numerical features. numeric
src/data_preprocessing.py:92
Function
plot_actual_vs_predicted
Plots actual vs predicted values for regression. Args: y_true (array-like): True values. y_pred (array-like): Predicted valu
src/visualizations.py:107
Function
plot_boxplots_for_numerical_features
Creates boxplots for multiple numerical features to detect outliers. Args: df (pd.DataFrame): DataFrame containing numerical feature
src/visualizations.py:255
Function
plot_category_vs_numerical
Creates a box plot comparing a categorical feature against a numerical feature. Args: df (pd.DataFrame): Input DataFrame. ca
src/visualizations.py:288
Function
plot_class_distribution
Plots the distribution of class labels in a dataset. Args: y (array-like): Target labels.
src/visualizations.py:125
Function
plot_confusion_matrix
Plot confusion matrix.
src/enhanced_benchmark_tool/visualizations.py:52
Function
plot_correlation_matrix
Plots a heatmap of feature correlations. Args: df (pd.DataFrame): DataFrame containing numerical features.
src/visualizations.py:143
Function
plot_correlation_matrix
Plot correlation heatmap for numeric columns.
src/enhanced_benchmark_tool/visualizations.py:67
Function
plot_feature_distribution
Plots the distribution of a numerical feature. Args: df (pd.DataFrame): DataFrame containing the feature. feature (str): Col
src/visualizations.py:234
Function
plot_feature_importance
Plot feature importance as horizontal bar chart.
src/enhanced_benchmark_tool/visualizations.py:34
Function
plot_learning_curve
Plots the learning curve of a model. Args: model: A scikit-learn compatible model. X (pd.DataFrame or np.ndarray): Feature m
src/visualizations.py:198
Function
plot_learning_curve
Plot a learning curve for a model.
src/enhanced_benchmark_tool/visualizations.py:80
Function
plot_metrics
Plot metric dict as a bar chart.
src/enhanced_benchmark_tool/visualizations.py:17
Function
plot_pairwise_relationships
Plots pairwise relationships between numerical features. Args: df (pd.DataFrame): DataFrame containing numerical features. n
src/visualizations.py:271
Function
plot_precision_recall_curve
Plots the Precision-Recall curve. Args: y_true (array-like): True binary labels. y_scores (array-like): Predicted probabilit
src/visualizations.py:179
Function
plot_residuals
Plots residuals (errors) of a regression model. Args: y_true (array-like): True values. y_pred (array-like): Predicted value
src/visualizations.py:87
Function
plot_roc_curve
Plots the Receiver Operating Characteristic (ROC) curve. Args: y_true (array-like): True binary labels. y_scores (array-like
src/visualizations.py:155
Function
plot_threshold_metrics
Plots accuracy, precision, recall, and F1-score against different thresholds. Args: threshold_df (pd.DataFrame): DataFrame containin
src/visualizations.py:68
Function
preprocess_data
Preprocesses the dataset by handling missing values, scaling numerical features, and encoding categorical features. Args: df (pd
src/data_preprocessing.py:18
Function
profile_dataset
Generates a detailed statistical profile of the dataset. Args: file_path (str): Path to the CSV file containing dataset. Return
src/dataset_profiling.py:6
Function
profile_dataset
Generates a detailed statistical profile of the dataset. Args: file_path (str): Path to the CSV file containing the dataset. Re
src/model_benchmarking.py:5
Function
reduce_cardinality
Reduces the cardinality of categorical features by grouping rare categories into a single category. Args: df (pd.DataFrame): The dat
src/data_preprocessing.py:109
Function
summarize_top_n_categories
Summarizes the top N most frequent categories in a categorical column. Args: df (pd.DataFrame): Input dataset. column (str):
src/dataset_profiling.py:242
Function
test_benchmark_model
()
tests/test_model_benchmarking.py:7
Function
test_extract_feature_importance
()
tests/test_dataset_profiling.py:18
Function
test_plot_confusion_matrix
()
tests/test_visualizations.py:21
Function
test_plot_feature_importance
()
tests/test_visualizations.py:16
Function
test_plot_metrics
()
tests/test_visualizations.py:11
Function
test_profile_dataset
(tmp_path)
tests/test_dataset_profiling.py:7