MCPcopy Create free account

hub / github.com/adamkarvonen/activation_oracles / functions

Functions716 in github.com/adamkarvonen/activation_oracles

↓ 1 callersFunctioncount_stats
Count samples and tokens in training data.
experiments/explorations/count_training_data.py:193
↓ 1 callersFunctioncreate_activating_sequences_data
( datapoint_type: str, model_name: str, sae_repo_id: str, sae_layer_percent: int, use_deco
nl_probes/dataset_classes/sae_training_data.py:275
↓ 1 callersFunctioncreate_assistant_mask
Create input_ids and assistant_masks for training, where assistant_masks indicates which tokens should have loss computed (1 for assistant to
nl_probes/trl_training/personaqa_train.py:178
↓ 1 callersMethodcreate_dataset
Note: Will always make all split(s) at the same time. This is so we ensure that train / test splits have no overlap.
nl_probes/dataset_classes/act_dataset_manager.py:61
↓ 1 callersMethodcreate_dataset
(self)
nl_probes/dataset_classes/latentqa_dataset.py:54
↓ 1 callersMethodcreate_dataset
(self)
nl_probes/dataset_classes/past_lens_dataset.py:54
↓ 1 callersFunctioncreate_detection_eval_data
( eval_data_file: str, eval_data_start_index: int, sae_ids: list[int], cfg: lightweight_sft.SelfInterpTrai
nl_probes/autointerp_detection_eval/local_eval.py:95
↓ 1 callersFunctioncreate_detection_eval_data
Reads seeded SAE hard negatives and builds per-SAE train/test splits for detection. Ensures all entries share the same SAEInfo and match the
nl_probes/autointerp_detection_eval/lora_hf_eval.py:55
↓ 1 callersFunctioncreate_incremental_turn_dataset
Creates a new dataset where each conversation is expanded into multiple rows with incrementally increasing turns. Required for Qwen3 tokeniza
nl_probes/trl_training/taboo_train.py:257
↓ 1 callersFunctioncreate_latentqa_training_datapoint
( datapoint_dict: dict, tokenizer: AutoTokenizer, act_layers: list[int], dataset_params: LatentQADatasetCo
nl_probes/dataset_classes/latentqa_dataset.py:100
↓ 1 callersFunctioncreate_personaqa_dataset
(folder: str)
nl_probes/trl_training/personaqa_train.py:246
↓ 1 callersFunctioncreate_training_data_from_activations
Create training data from collected activations.
experiments/simple_llama_model_demo.py:202
↓ 1 callersFunctioncreate_training_data_from_activations
( acts_BLD_by_layer_dict: dict[int, torch.Tensor], context_input_ids: list[int], investigator_prom
experiments/patchscopes/patchscopes_full_open_ended_eval.py:292
↓ 1 callersFunctioncreate_vector_dataset
( datapoints: list[ClassificationDatapoint], tokenizer: AutoTokenizer, model_name: str, batch_
nl_probes/dataset_classes/classification.py:167
↓ 1 callersFunctioncreate_verbalizer_inputs
( acts_BLD_by_layer_dict: dict[int, torch.Tensor], context_input_ids: list[int], verbalizer_prompt
nl_probes/base_experiment.py:176
↓ 1 callersFunctioncreate_yes_no_data
( model_name: str, dataset_type: str, sft_data_file: str, sft_data_folder: str, device: to
nl_probes/dataset_classes/sae_training_data.py:408
↓ 1 callersMethoddecode
(self, feature_acts: torch.Tensor)
nl_probes/sae.py:169
↓ 1 callersMethoddecode
(self, feature_acts: torch.Tensor)
nl_probes/sae.py:261
↓ 1 callersFunctiondeterministic_hash
(something: str)
nl_probes/autointerp_detection_eval/caller.py:261
↓ 1 callersFunctiondownload_hf_folder
Download a specific folder from a Hugging Face repository.
experiments/simple_llama_model_demo.py:127
↓ 1 callersMethodencode
(self, x: torch.Tensor)
nl_probes/sae.py:163
↓ 1 callersMethodencode
Note: x can be either shape (B, F) or (B, L, F)
nl_probes/sae.py:242
↓ 1 callersFunctionencode_messages
Encode message dictionaries into tokenized inputs.
experiments/simple_llama_model_demo.py:62
↓ 1 callersFunctionencode_messages
( tokenizer: AutoTokenizer, message_dicts: list[list[dict[str, str]]], add_generation_prompt: bool
experiments/patchscopes/patchscopes_full_open_ended_eval.py:187
↓ 1 callersFunctioneval_features_batch
( eval_batch: BatchData, model: AutoModelForCausalLM, submodule: torch.nn.Module, tokenizer: A
nl_probes/utils/eval.py:22
↓ 1 callersFunctionevaluate_dataset_file
Return (accuracy, items) for a single .tsv dataset file. items is a list of (prompt, response, ground_truth) tuples.
experiments/patchscopes/patchscopes_zero_shot_all.py:98
↓ 1 callersFunctionevaluate_sentence_matching
Use GPT-5-mini to identify which sentences match the explanation. Args: batch: Mixed sentences batch with target explanation
nl_probes/autointerp_detection_eval/eval_detection_v2.py:530
↓ 1 callersFunctionexample_main
()
nl_probes/autointerp_detection_eval/caller.py:1171
↓ 1 callersFunctionextract_lr_from_column
Extract learning rate from column name. Returns None if not a loss column.
experiments/final_paper_plots/plot_train_loss_lr_sweep.py:20
↓ 1 callersFunctionextract_message_llm
(text: str)
experiments/final_paper_plots/plot_ssc_results.py:198
↓ 1 callersFunctionextract_message_llm
(text: str)
experiments/final_paper_plots/plot_layer_comparison_secret_keeping.py:283
↓ 1 callersFunctionextract_message_llm
(text: str)
experiments/final_paper_plots/plot_secret_keeping_results.py:325
↓ 1 callersFunctionextract_message_llm
(text: str)
experiments/plotting/plot_ssc_results.py:150
↓ 1 callersFunctionextract_message_llm
(text: str)
experiments/plotting/plot_secret_keeping_results.py:288
↓ 1 callersFunctionfilter_by_allowed_labels
Filter bars to only include those with allowed labels. Args: names: List of LoRA names labels: List of legend labels mean
experiments/final_paper_plots/plot_personaqa_results_all_models.py:463
↓ 1 callersMethodfinalize
(self, dataset_loaders: list[ActDatasetLoader])
nl_probes/configs/sft_config.py:67
↓ 1 callersFunctionfind_most_similar_features
Find the most similar features to a target feature using cosine similarity of encoder vectors.
nl_probes/autointerp_detection_eval/create_hard_negatives_v2.py:36
↓ 1 callersFunctionfind_pattern_in_tokens
( token_ids: list[int], special_token_str: str, num_positions: int, tokenizer: AutoTokenizer )
nl_probes/utils/dataset_utils.py:261
↓ 1 callersFunctionfix_json_file
Fix a single JSON file.
experiments/final_paper_plots/fix_taboo_json_files.py:18
↓ 1 callersFunctionformat_prompts
(prompts: list[list[dict]], model_name: str)
experiments/explorations/vllm_inference_demo.py:44
↓ 1 callersFunctionformat_prompts_for_chat
(prompts: list[dict], tok)
experiments/personaqa_knowledge_eval.py:198
↓ 1 callersFunctionformat_prompts_for_chat
(prompts: list[dict], tok)
experiments/personaqa_knowledge_yes_no_eval.py:175
↓ 1 callersMethodfrom_named_datasets
(dataset_names, batch_size=1, shuffle=True)
nl_probes/dataset_classes/classification_dataset_manager.py:817
↓ 1 callersMethodfrom_system
(content: str)
nl_probes/autointerp_detection_eval/caller.py:86
↓ 1 callersFunctiongen
()
nl_probes/dataset_classes/past_lens_dataset.py:134
↓ 1 callersFunctiongender_calculate_accuracy
(record: dict, sequence: bool)
experiments/final_paper_plots/plot_secret_keeping_results.py:207
↓ 1 callersFunctiongender_calculate_accuracy
(record: dict, sequence: bool)
experiments/final_paper_plots/plot_model_progression_line_chart_shapes.py:443
↓ 1 callersFunctiongender_calculate_accuracy
(record: dict, sequence: bool)
experiments/plotting/plot_secret_keeping_results.py:175
↓ 1 callersFunctiongender_comparison
Check if response matches ground truth gender.
experiments/final_paper_plots/plot_lr_sweep_combined.py:103
↓ 1 callersFunctiongenerate_explanations_for_model
Generate explanations for all SAE activations using a specific model.
nl_probes/autointerp_detection_eval/eval_detection_v2.py:620
↓ 1 callersFunctionget_all_patchscopes_prompts
(files: list[str], tokenizer: AutoTokenizer, max_words: int | None)
experiments/patchscopes/patchscopes_full_open_ended_eval.py:170
↓ 1 callersFunctionget_best_of_n_scores
Calculate best-of-N scores for each record, filtered by the best investigator prompt. Args: data: JsonSchema object loaded from JSON
experiments/final_paper_plots/plot_ssc_results.py:266
↓ 1 callersFunctionget_best_of_n_scores
( data: JsonSchema, response_type: ResponseType = "full_sequence_responses", best_of_n: int = 5,
experiments/final_paper_plots/plot_layer_comparison_secret_keeping.py:322
↓ 1 callersFunctionget_best_of_n_scores
Calculate best-of-N scores for each record, filtered by the best investigator prompt. Args: data: JsonSchema object loaded from JSON
experiments/plotting/plot_ssc_results.py:212
↓ 1 callersFunctionget_best_of_n_scores
Calculate best-of-N scores for each record, filtered by the best investigator prompt.
experiments/plotting/plot_secret_keeping_results.py:339
↓ 1 callersFunctionget_bos_eos_pad_mask
Create mask for BOS, EOS, and PAD tokens
nl_probes/utils/common.py:71
↓ 1 callersFunctionget_classification_datapoints
( dataset_name: str, num_qa_per_sample: int, train_examples: int, test_examples: int, rand
nl_probes/dataset_classes/classification.py:131
↓ 1 callersMethodget_file_handler
(self)
nl_probes/autointerp_detection_eval/caller.py:463
↓ 1 callersFunctionget_hf_repo_id
(hf_repo_name: str)
nl_probes/configs/sft_config.py:89
↓ 1 callersFunctionget_introspection_prompt
(sae_layer: int, num_positions: int)
nl_probes/autointerp_detection_eval/eval_detection_v2.py:34
↓ 1 callersFunctionget_message_char_length
(example)
nl_probes/trl_training/taboo_train.py:329
↓ 1 callersFunctionget_model_kwargs
Return model kwargs based on model name.
experiments/classification_eval.py:140
↓ 1 callersFunctionget_model_name
(series_name: str)
experiments/final_paper_plots/plot_model_progression_line_chart_shapes.py:800
↓ 1 callersFunctionget_persona
(persona_id: str, personas: list[dict])
nl_probes/trl_training/personaqa_train.py:262
↓ 1 callersFunctionget_prompt_tokens_only
User prompt should be labeled as -100
nl_probes/utils/dataset_utils.py:136
↓ 1 callersFunctionget_samples_from_groups
Get all ContextQASample objects from specified groups. Args: group_names: List of group names (e.g., ["sst2", "ag_news"]) nu
nl_probes/dataset_classes/classification_dataset_manager.py:843
↓ 1 callersFunctionget_text_only_lora_targets
Returns LoRA target pattern for text-only training on VLMs, or None if not a VLM.
nl_probes/utils/activation_utils.py:129
↓ 1 callersFunctionhf_mixed_dataset_to_generator
Get a mix of pretrain and chat data at a specified ratio. By default, 90% of the data will be pretrain and 10% will be chat. Default datasets:
nl_probes/dataset_classes/past_lens_dataset.py:72
↓ 1 callersFunctionis_valid
(i, j)
datasets/classification_datasets/gmt/comparisons/data_gen.py:22
↓ 1 callersFunctionjudge_quirk
(ground_truth: str, response: str, response_type: ResponseType)
experiments/final_paper_plots/plot_ssc_results.py:154
↓ 1 callersFunctionjudge_quirk
(ground_truth: str, response: str, response_type: ResponseType)
experiments/final_paper_plots/plot_layer_comparison_secret_keeping.py:257
↓ 1 callersFunctionjudge_quirk
(ground_truth: str, response: str, response_type: ResponseType)
experiments/final_paper_plots/plot_secret_keeping_results.py:291
↓ 1 callersFunctionjudge_quirk
(ground_truth: str, response: str, response_type: ResponseType)
experiments/plotting/plot_ssc_results.py:106
↓ 1 callersFunctionjudge_quirk
(ground_truth: str, response: str, response_type: ResponseType)
experiments/plotting/plot_secret_keeping_results.py:254
↓ 1 callersFunctionlength_grouped_reorder
( data: list[TrainingDataPoint], batch_size: int, window_mult: int, )
nl_probes/sft.py:514
↓ 1 callersMethodload_cache
(self)
nl_probes/autointerp_detection_eval/caller.py:446
↓ 1 callersFunctionload_classification_ood_accuracies
Load classification results for a single base model and compute OOD accuracy per LoRA checkpoint. Returns dict mapping lora_name -> (mean, er
experiments/final_paper_plots/plot_model_progression_line_chart_shapes.py:101
↓ 1 callersFunctionload_classification_results
Load classification results from folder.
experiments/final_paper_plots/plot_all_data_diversity.py:158
↓ 1 callersFunctionload_claude_results
Load hardcoded Claude results from TSV data. Args: is_open_ended: If True, return open-ended results; if False, return yes/no results
experiments/final_paper_plots/plot_personaqa_results_all_models.py:222
↓ 1 callersFunctionload_datasets_for_layer_percent
Load all classification datasets for a specific model and layer percent.
experiments/classification_eval.py:158
↓ 1 callersFunctionload_dictionary_learning_batch_topk_sae
( repo_id: str, filename: str, model_name: str, device: torch.device, dtype: torch.dtype,
nl_probes/sae.py:270
↓ 1 callersFunctionload_eval_data
( cfg: lightweight_sft.SelfInterpTrainingConfig, selected_eval_features: list[int], sae_info: SAEI
nl_probes/autointerp_detection_eval/local_eval.py:58
↓ 1 callersFunctionload_gemma_scope_jumprelu_sae
( repo_id: str, filename: str, layer: int, model_name: str, device: torch.device, dtyp
nl_probes/sae.py:178
↓ 1 callersFunctionload_gender_gemma_results
Load Gender results for Gemma-2-9B-IT, matching plot_secret_keeping_results.py (GENDER_SEQUENCE=True and CHOSEN_GENDER_PROMPT). Returns d
experiments/final_paper_plots/plot_model_progression_line_chart_shapes.py:469
↓ 1 callersFunctionload_gender_results
Load all JSON files from the directory.
experiments/plotting/plot_secret_keeping_results.py:190
↓ 1 callersFunctionload_json_schema
(json_path: str)
experiments/final_paper_plots/plot_ssc_results.py:135
↓ 1 callersFunctionload_json_schema
(json_path: str)
experiments/final_paper_plots/plot_layer_comparison_secret_keeping.py:357
↓ 1 callersFunctionload_json_schema
(json_path: str)
experiments/plotting/plot_ssc_results.py:87
↓ 1 callersFunctionload_json_schema
(json_path: str)
experiments/plotting/plot_secret_keeping_results.py:385
↓ 1 callersFunctionload_knowledge_eval_results
Load knowledge eval results from folder. Args: folder_path: Path to folder containing base_model.json and personaqa_lora.json ver
experiments/final_paper_plots/plot_personaqa_knowledge_eval_all_models.py:87
↓ 1 callersFunctionload_model_data
(model_name: str, prefix: str, keywords)
experiments/final_paper_plots/plot_classification_layer_sweep_lines.py:80
↓ 1 callersFunctionload_multi_caller
Non-exhaustive list of models. For demonstration purposes. Simply copy and create a new function for your needs.
nl_probes/autointerp_detection_eval/caller.py:1125
↓ 1 callersFunctionload_personaqa_open_ended_sequence_results
Load PersonaQA open-ended sequence results and compute mean sequence-level accuracy per LoRA. Uses the same logic as plot_personaqa_results_a
experiments/final_paper_plots/plot_model_progression_line_chart_shapes.py:207
↓ 1 callersFunctionload_personaqa_results
Load all JSON files from the directory.
experiments/final_paper_plots/plot_qwen3-8b_eval_results.py:84
↓ 1 callersFunctionload_personaqa_results
Load PersonAQA results from directory and _orig subdirectory.
experiments/final_paper_plots/plot_all_data_diversity.py:260
↓ 1 callersFunctionload_results
Load all JSON files from the directory.
experiments/patchscopes/plot_patchscopes_results.py:102
↓ 1 callersFunctionload_results
Load all JSON files from the directory.
experiments/final_paper_plots/plot_gender_eval_results.py:114
↓ 1 callersFunctionload_results
Load all JSON files from the directory.
experiments/final_paper_plots/plot_old_personaqa_results.py:101
↓ 1 callersFunctionload_results
Load all JSON files from the directory.
experiments/final_paper_plots/plot_ssc_results.py:358
↓ 1 callersFunctionload_results
Load all JSON files from the directory.
experiments/final_paper_plots/plot_taboo_eval_results.py:127
← previousnext →301–400 of 716, ranked by callers