MCPcopy Create free account

hub / github.com/amazon-science/AnoLLM-large-language-models-for-tabular-anomaly-detection / functions

Functions88 in github.com/amazon-science/AnoLLM-large-language-models-for-tabular-anomaly-detection

↓ 5 callersMethoddecision_function
Obtain anomaly scores for each sample in the test data df_test: pandas dataframe of test data n_permutations: number of permutations to calculate
anollm/anollm.py:206
↓ 5 callersMethodfit
Fine-tune AnoLLM using tabular data. Args: data: Pandas DataFrame that contains the tabular data column_names: If data is Numpy Array, the fe
anollm/anollm.py:115
↓ 5 callersFunctionload_data
(args)
src/data_utils.py:550
↓ 4 callersMethodget_column_names
(self)
anollm/anollm_dataset.py:45
↓ 3 callersMethod__init__
(self, hidden_sizes, num_bins = 7)
src/baselines/dte.py:18
↓ 3 callersFunctionconvert_np_to_df
(X_np)
src/data_utils.py:542
↓ 3 callersFunctiondf_to_numpy
( X: pd.DataFrame, dataset_name: Optional[str] = None, method: Optional[str] = 'ordinal', normalize_
src/data_utils.py:665
↓ 3 callersMethodfit
(self, X_train, y_train = None, X_test = None, y_test = None, verbose=False)
src/baselines/dte.py:106
↓ 3 callersMethodfix_column_order
(self)
anollm/anollm_dataset.py:55
↓ 3 callersMethodforward_noise
Takes data point and a timestep as input and returns the noisy version of it
src/baselines/dte.py:83
↓ 3 callersFunctionget_metrics
(args, only_raw = False, only_normalized = False, only_ordinal = False)
src/get_results.py:78
↓ 3 callersFunctionget_run_name
(args, method)
evaluate_baselines.py:51
↓ 3 callersFunctionget_text_columns
(dataset_name)
src/data_utils.py:641
↓ 3 callersFunctionis_baseline
(s)
src/get_results.py:137
↓ 3 callersMethodprepare
Preprocess the data by tokenizing each column and truncating the columns to max_length Inputs: max_length_dict specifies the maximum length of
anollm/anollm_dataset.py:60
↓ 3 callersMethodset_textual_columns
(self, columns: tp.List[str])
anollm/anollm_dataset.py:34
↓ 3 callersMethodset_tokenizer
Set the Tokenizer Args: tokenizer: Tokenizer from HuggingFace
anollm/anollm_dataset.py:22
↓ 2 callersFunction_array_to_dataframe
Converts a Numpy Array to a Pandas DataFrame Args: data: Pandas DataFrame or Numpy NDArray columns: If data is a Numpy Array, col
anollm/anollm_utils.py:5
↓ 2 callersMethod_getitem
Get one instance of the tabular data, permuted, converted to text and tokenized.
anollm/anollm_dataset.py:125
↓ 2 callersFunctionaggregate_results
(m_dicts)
src/get_results.py:161
↓ 2 callersFunctionbenchmark
(args)
evaluate_baselines.py:66
↓ 2 callersFunctionget_max_length_dict
(dataset_name)
src/data_utils.py:651
↓ 2 callersFunctionget_model
()
train_anollm.py:119
↓ 2 callersMethodget_n_columns
(self)
anollm/anollm_dataset.py:41
↓ 2 callersFunctionget_run_name
(args)
train_anollm.py:66
↓ 2 callersFunctionload_adbench_data
(dataset)
src/data_utils.py:478
↓ 2 callersFunctionload_dataset
(dataset_name, data_dir)
src/data_utils.py:82
↓ 2 callersFunctionscores_calc_internal
(query, positive,no_negatives,tau)
src/baselines/icl.py:17
↓ 2 callersMethodshuffle_column_order
(self)
anollm/anollm_dataset.py:49
↓ 2 callersFunctionsplit_data
( X: pd.DataFrame, dataset_name: str, n_splits: int, data_dir: str, train_ratio: Optional[float]
src/data_utils.py:493
↓ 1 callersMethod__init__
(self, seed=0, model_name="ICL", num_epochs = 2000, no_batchs = 3000, no_negatives=1000, temperature=0.1, lr=0
src/baselines/icl.py:131
↓ 1 callersFunctiona_minus_b
(a,b)
src/baselines/icl.py:73
↓ 1 callersFunctionbinning
Gives the bin number for a given t based on T (maximum) and the number of bins This is floor(t*num_bins/T) bounded by 0 and T-1
src/baselines/dte.py:49
↓ 1 callersMethodcompute_loss
(self, x, t)
src/baselines/dte.py:103
↓ 1 callersFunctiondata_generator
(subsample=None, target_label=None)
src/data_utils.py:400
↓ 1 callersMethoddecision_function
(self, X)
src/baselines/dte.py:141
↓ 1 callersFunctionfilter_results
(d:dict)
src/get_results.py:142
↓ 1 callersFunctionflatten
(l)
src/data_utils.py:409
↓ 1 callersFunctionget_args
()
evaluate_anollm.py:16
↓ 1 callersFunctionget_args
()
evaluate_baselines.py:34
↓ 1 callersFunctionget_args
()
train_anollm.py:16
↓ 1 callersFunctionget_args
()
src/get_results.py:11
↓ 1 callersFunctionget_args
()
src/get_avg_results.py:9
↓ 1 callersMethodload_from_state_dict
Load AnoLLM model from state_dict Args: path: path where AnoLLM model is saved
anollm/anollm.py:316
↓ 1 callersFunctionmain
()
evaluate_anollm.py:53
↓ 1 callersFunctionmain
()
evaluate_baselines.py:174
↓ 1 callersFunctionmain
()
train_anollm.py:92
↓ 1 callersFunctionmain
()
src/get_results.py:201
↓ 1 callersFunctionmain
()
src/get_avg_results.py:24
↓ 1 callersFunctionnormalize
(X, method, n_buckets)
src/data_utils.py:582
↓ 1 callersFunctionpositive_matrice_builder
(dataset, kernel_size)
src/baselines/icl.py:43
↓ 1 callersFunctionprint_dataset_information
(dataset, data_dir)
src/data_utils.py:795
↓ 1 callersMethodsave_state_dict
Save AnoLLM Model Saves the model weights and a configuration file in the given directory. Warning: Only works in DDP setting! Args: path:
anollm/anollm.py:297
↓ 1 callersMethodset_anomaly_label
(self, labels)
anollm/anollm_dataset.py:30
↓ 1 callersMethodset_eval_setting
(self, n_permutations)
anollm/anollm_trainer.py:51
↓ 1 callersFunctionsplit_on_uppercase
(s)
src/data_utils.py:241
↓ 1 callersFunctiontabular_metrics
Calculates evaluation metrics for tabular anomaly detection. Adapted from https://github.com/xuhongzuo/DeepOD/blob/main/deepod/metrics/_anom
src/get_results.py:27
↓ 1 callersFunctiontake_per_row_complement
(A, indx, num_elem=3)
src/baselines/icl.py:33
FunctionIP_to_country
(ip)
src/data_utils.py:334
Method__call__
(self, features: tp.List[tp.Dict[str, tp.Any]])
anollm/anollm_dataset.py:207
Method__getitem__
(self, idx)
src/baselines/icl.py:87
Method__getitems__
(self, keys: tp.Union[int, slice, str, list])
anollm/anollm_dataset.py:191
Method__init__
Args: llm: HuggingFace checkpoint of a pretrained large language model, used a basis of our model experiment_dir: Directory, where the trai
anollm/anollm.py:46
Method__init__
(self, seed = 0, model_name = "DTE", hidden_size = [256, 512, 256], epochs = 400, batch_size = 64, lr = 1e-4,
src/baselines/dte.py:57
Method__init__
(self, seed = 0, model_name = "DTE_categorical", hidden_size = [256, 512, 256], epochs = 400, batch_size = 64,
src/baselines/dte.py:163
Method__init__
(self, seed = 0, model_name = "DTE_inverse_gamma", hidden_size = [256, 512, 256], epochs = 400, batch_size = 6
src/baselines/dte.py:187
Method__init__
(self, seed = 0, model_name = "DTE_gaussian", hidden_size = [256, 512, 256], epochs = 400, batch_size = 64, lr
src/baselines/dte.py:224
Method__init__
(self, data)
src/baselines/icl.py:81
Method__init__
(self, kernel_size,hdn_size,d)
src/baselines/icl.py:94
Method__len__
(self)
src/baselines/icl.py:84
Function_seed_worker
Helper function to set worker seed during Dataloader initialization.
anollm/anollm_trainer.py:151
Methodcompute_loss
(self, x_0, t)
src/baselines/dte.py:170
Methodcompute_loss
(self, x_0, t)
src/baselines/dte.py:190
Methodcompute_loss
(self, x_0, t)
src/baselines/dte.py:227
Methoddecision_function
(self, X)
src/baselines/dte.py:207
Methoddecision_function
(self, test_X)
src/baselines/icl.py:211
Methodevaluate
(self, eval_dataset=None, ignore_keys=None, metric_key_prefix: str = "eval")
anollm/anollm_trainer.py:54
Functionf1_calculator
(classes, losses)
src/baselines/icl.py:61
Functionfilter_anomalies
(X_test, y_test)
src/data_utils.py:811
Methodfit
(self,X_train, y_train=None)
src/baselines/icl.py:150
Methodforward
(self, x)
src/baselines/dte.py:40
Methodforward
(self, x)
src/baselines/icl.py:112
Methodget_item_test
(self, key)
anollm/anollm_dataset.py:175
Methodget_train_dataloader
(self)
anollm/anollm_trainer.py:27
Functionget_word
(n)
src/data_utils.py:597
Functionordinal
(n)
src/data_utils.py:586
Methodset_epoch
(self, epoch)
anollm/anollm_dataset.py:222
Functiontake_per_row
(A, indx, num_elem=2)
src/baselines/icl.py:56