Code
Hub
Workspaces
Following
Trending
Connect
MCP
copy
Create free account
hub
/
github.com/SchwinnL/LLM_Embedding_Attack
/ functions
Functions
37 in github.com/SchwinnL/LLM_Embedding_Attack
⨍
Functions
37
◇
Types & classes
2
↓ 4 callers
Function
create_one_hot_and_embeddings
(tokens, embed_weights, model)
unlearning_utils.py:15
↓ 4 callers
Function
get_embedding_matrix
(model)
unlearning_utils.py:121
↓ 4 callers
Method
log
( self, logits, input_tokens, target_tokens, embeddings_attack,
embedding_attack_unlearning.py:346
↓ 3 callers
Method
adjust_shape_il
(self, tensor_to_adjust, intermediate_layers)
embedding_attack_unlearning.py:182
↓ 3 callers
Method
calc_loss
(self, input_tokens, target_tokens, embeddings_attack)
embedding_attack_unlearning.py:214
↓ 3 callers
Function
create_one_hot_and_embeddings
(tokens, embed_weights, model)
embedding_attack_toxic.py:108
↓ 3 callers
Method
forward
(self, inputs_embeds, intermediate_layers, attention_mask=None)
embedding_attack_unlearning.py:190
↓ 2 callers
Function
generate
(model, input_embeddings, num_tokens=50)
embedding_attack_toxic.py:69
↓ 2 callers
Function
get_embedding_matrix
(model)
embedding_attack_toxic.py:57
↓ 2 callers
Function
init_attack_embeddings
(model, tokenizer, control_prompt, device, repeat=0)
unlearning_utils.py:37
↓ 2 callers
Method
set_il_tensor
(self, intermediate_layers, add_last_layer=True)
embedding_attack_unlearning.py:159
↓ 1 callers
Method
attack
(self, dataset_name, dataloader_train, dataloader_test=None)
embedding_attack_unlearning.py:566
↓ 1 callers
Function
calc_loss
(model, embeddings, embeddings_attack, embeddings_target, targets)
embedding_attack_toxic.py:100
↓ 1 callers
Function
create_one_hot
(model, tokens)
unlearning_utils.py:24
↓ 1 callers
Function
create_pytorch_dataset_from_csv
Create a PyTorch dataset from a list of string tuples. Args: model (torch.nn.Module): The PyTorch model. tokenizer (transfor
unlearning_utils.py:192
↓ 1 callers
Method
generate_text
(self, input_tokens, embeddings_attack, num_tokens=50, decode_input=False)
embedding_attack_unlearning.py:257
↓ 1 callers
Function
get_attention_mask
(model, input_tokens, target_tokens, embeddings_attack)
unlearning_utils.py:129
↓ 1 callers
Function
get_config
(attack_config, model_name, dataset_name, shuffle, seed, test_split)
unlearning_utils.py:281
↓ 1 callers
Function
get_experiment_path
(model_name, dataset_name)
unlearning_utils.py:292
↓ 1 callers
Method
individual_attack
(self, dataloader)
embedding_attack_unlearning.py:505
↓ 1 callers
Function
load_dataset_and_dataloader
( tokenizer, dataset_name, batch_size, csv_columns=[0, 1], test_split=0, shuffle=True, device="cuda:0" )
unlearning_utils.py:164
↓ 1 callers
Function
load_model_and_tokenizer
(model_path, tokenizer_path=None, device="cuda:0", **kwargs)
embedding_attack_toxic.py:26
↓ 1 callers
Function
load_model_and_tokenizer
(model_path, tokenizer_path=None, device="cuda:0", **kwargs)
unlearning_utils.py:80
↓ 1 callers
Function
load_tokenizer
(tokenizer_path)
unlearning_utils.py:94
↓ 1 callers
Method
logit_lense
(self, inputs_embeds, intermediate_layers, attention_mask=None)
embedding_attack_unlearning.py:200
↓ 1 callers
Method
no_attack
(self, dataloader)
embedding_attack_unlearning.py:544
↓ 1 callers
Function
num_affirmative_response
(logits_pred, target_tokens, return_sample_wise=False)
unlearning_utils.py:145
↓ 1 callers
Function
print_result_dict
(result_dict)
unlearning_utils.py:48
↓ 1 callers
Function
run
Embedding space attack on Llama2. String will overall look like: [fixed_prompt] + [control_prompt] + [target]
embedding_attack_toxic.py:121
↓ 1 callers
Function
run_attack
Embedding space attack on Llama2. String will overall look like: [fixed_prompt] + [control_prompt] + [target]
embedding_attack_unlearning.py:53
↓ 1 callers
Function
save_results
(result_dict, attack_config, model_name, dataset_name, shuffle, seed, test_split)
unlearning_utils.py:261
↓ 1 callers
Method
universal_attack
(self, dataloader_train, dataloader_test=None)
embedding_attack_unlearning.py:443
Method
__getitem__
(self, indices)
unlearning_utils.py:256
Method
__init__
( self, model, tokenizer, attack_type="individual", iters=10,
embedding_attack_unlearning.py:119
Method
__init__
(self, data, max_length=256)
unlearning_utils.py:249
Method
__len__
(self)
unlearning_utils.py:253
Method
add_to_dict
(key, value, num_repeats, repeat_type="list", flatten=False)
embedding_attack_unlearning.py:392