MCPcopy Create free account

hub / github.com/huggingface/smollm / functions

Functions1,907 in github.com/huggingface/smollm

↓ 4 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
vision/m4/models/vllama3/modeling_vllama3.py:370
↓ 4 callersFunctionround_by_factor
Round 'number' to the nearest integer multiple of 'factor'.
vision/smolvlm2/smolvlm/mm_utils.py:28
↓ 4 callersMethodset_state
(self, n_seen_examples_per_worker)
vision/m4/training/dataset.py:556
↓ 4 callersFunctionset_verbosity
Set the verbosity level for the 🤗 M4's root logger. Args: verbosity (`int`): Logging level, e.g., one of: -
vision/m4/utils/logging.py:128
↓ 4 callersFunctionsmart_resize
Rescale (height, width) so that: - aspect ratio <= max_ratio, - total area in [min_pixels, max_pixels], - each dimension is mul
vision/smolvlm2/smolvlm/mm_utils.py:40
↓ 4 callersMethodto_dict
(self)
tools/smol_tools/smol_tools/chatter.py:15
↓ 4 callersFunctionunique_tolist
(l_)
vision/m4/sourcing/processing/extracting_ngrams/utils.py:91
↓ 4 callersMethodupdate_summary_chat
Update the summary chat display with new message
tools/smol_tools/demo_tkinter.py:206
↓ 4 callersMethodverify
(self, should_verify: bool)
vision/m4/training/config.py:383
↓ 4 callersFunctionvision_model_name_to_model
returns the model if supported, asserts otherwise
vision/m4/training/setup_vision_model.py:15
↓ 3 callersMethod__init__
(self, config)
vision/m4/models/perceiver/perceiver.py:423
↓ 3 callersMethod_compute_mmmu_style_vqa_accuracy
(self, generated_texts_unique, answers_unique, normalize_text_fn, accept_mcq)
vision/m4/evaluation/custom_metrics/open_ended_vqa_metrics.py:109
↓ 3 callersMethod_get_item
(self, idx: int)
vision/smolvlm2/smolvlm/datasets/dataset.py:537
↓ 3 callersMethod_get_item
(self, idx: int)
vision/smolvlm2/smolvlm/datasets/dataset_clip_sampling.py:669
↓ 3 callersMethod_save
( self, train_logs, curr_opt_step, curr_epoch, gbs_running, )
vision/m4/training/trainer.py:1248
↓ 3 callersMethod_split_heads
Splits hidden_size dim into attn_head_size and num_heads
vision/m4/models/vgpt2/modeling_vgpt2.py:274
↓ 3 callersFunctionapply_rotary_pos_emb
Applies Rotary Position Embedding to the query and key tensors. Args: q (`torch.Tensor`): The query tensor. k (`torch.Tensor`): T
vision/m4/models/vllama3/modeling_vllama3.py:309
↓ 3 callersMethodcheck_clip_score
(media_info, text_key, clip_score_min_cutoff)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:346
↓ 3 callersMethodcheck_common_word_ratio
( text, strip_characters, common_words, common_word_ratio_min_cutoff, )
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:327
↓ 3 callersMethodcheck_format
(media_info, valid_formats)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:157
↓ 3 callersMethodcheck_image_in_simplified_dom_tree
(media_info)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:151
↓ 3 callersFunctioncheck_is_number
Check if the given string is a number
vision/m4/evaluation/custom_metrics/utils.py:405
↓ 3 callersMethodcheck_repetition_ratio
(media_info, text_key, repetition_ratio_max_cutoff)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:337
↓ 3 callersFunctioncheck_s3_file
(file_key)
vision/m4/scripts/s3_checkpoint_download_convert_upload.py:36
↓ 3 callersMethodcheck_word_repetition_ratio
( text, strip_characters, word_repetition_length, word_repetition_max_cutoff,
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:202
↓ 3 callersMethodcompute_character_repetition_ratio
(text, character_repetition_length)
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:152
↓ 3 callersFunctioncompute_clip_score
Args texts: List[str] images: (:obj:`PIL.Image.Image`, :obj:`np.ndarray`, :obj:`torch.Tensor`): The image to be p
vision/m4/sourcing/data_collection/utils/clip_utils.py:20
↓ 3 callersMethodcompute_common_word_ratio
(text, strip_characters, common_words)
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:317
↓ 3 callersMethodcompute_flagged_word_ratio
(text, strip_characters, flagged_words)
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:250
↓ 3 callersMethodcompute_lang_id_pred_score
(text, lang_id_model)
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:343
↓ 3 callersMethodcompute_perplexity_score
( text, non_printing_characters_re, digits_re, unicode_punctuation, sentencepiece_model, kenlm_model
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:406
↓ 3 callersMethodcompute_special_character_ratio
(text, special_characters)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:287
↓ 3 callersMethodcompute_stopword_ratio
(text, stopwords)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:305
↓ 3 callersMethodcompute_word_repetition_ratio
(text, strip_characters, word_repetition_length)
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:185
↓ 3 callersFunctionconvert_img_to_bytes
(img_path, format)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_aokvqa.py:26
↓ 3 callersFunctioncreate_ds_scienceqa
`split` is "train", "validation" or "test".
vision/data/datasets_processing_scripts/integrate_evaluation_benchmarks_chatbot/scienceqa_no_mcq.py:29
↓ 3 callersFunctioncreate_ds_scienceqa
`split` is "train", "validation" or "test".
vision/data/datasets_processing_scripts/integrate_evaluation_benchmarks_chatbot/scienceqa.py:14
↓ 3 callersMethodelapsed
(self)
vision/m4/utils/training/timer.py:38
↓ 3 callersFunctionextract_all_files_for_split
(split_files, split)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_pgm.py:39
↓ 3 callersFunctionextract_all_files_for_split
(split_files, split)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_raven.py:43
↓ 3 callersFunctionfetch_single_image
(image_url, timeout=None, retries=0, retry_none=False)
vision/m4/sourcing/data_collection/utils/fetching_utils.py:44
↓ 3 callersFunctionfind_image_path
(image_id)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_aokvqa.py:35
↓ 3 callersFunctionfloor_by_factor
Floor 'number' to the nearest integer multiple of 'factor'.
vision/smolvlm2/smolvlm/mm_utils.py:36
↓ 3 callersFunctionformat_numbers_in_string
(input_str)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/build_ds_sft.py:128
↓ 3 callersFunctionget_config
(args=None)
vision/m4/evaluation/generation/config.py:87
↓ 3 callersMethodget_dom_viz_html
(self, html)
vision/m4/sourcing/data_collection/visualization/global_visualization.py:114
↓ 3 callersMethodget_dom_viz_html
(self, html)
vision/m4/sourcing/data_collection/visualization/wikipedia/global_visualization.py:113
↓ 3 callersFunctionget_finepersonas_emails_dataset
( config_name: str, n: int | None = None )
text/data/smoltalk/rewrite/pipeline/dataset.py:48
↓ 3 callersFunctionget_m4_cache_dir
()
vision/m4/sourcing/pmd/__init__.py:12
↓ 3 callersFunctionget_mapper
( tokenizer, image_transform, dataset_type: DatasetTypes, image_seq_len: int, max_seq_len:
vision/m4/training/dataset.py:98
↓ 3 callersFunctionhash_url_to_filename
Adapted from datasets.
vision/m4/sourcing/data_collection/utils/fetching_utils.py:27
↓ 3 callersFunctionhtml_to_web_documents
( dataset, dom_tree_simplificator, pre_extraction_simplificator, num_proc, html_column_nam
vision/m4/sourcing/data_collection/processors/web_document_extractor.py:31
↓ 3 callersMethodhtml_to_web_documents
(self)
vision/m4/sourcing/data_collection/processors/web_document_extractor.py:363
↓ 3 callersFunctioninit_dict
()
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_aokvqa.py:43
↓ 3 callersFunctionkl_div
(p, q, nb_bins=NB_BINS)
vision/m4/sourcing/data_collection/utils/kl_utils.py:7
↓ 3 callersFunctionload_annotations
(_ANNOTATIONS_PATH)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_table_datasets.py:269
↓ 3 callersFunctionload_gqa
(split)
vision/data/datasets_processing_scripts/integrate_evaluation_benchmarks_chatbot/gqa.py:35
↓ 3 callersMethodload_map_image_url_to_pos
(self)
vision/m4/sourcing/data_collection/processors/web_document_image_deduplication.py:266
↓ 3 callersMethodload_state
Loads the state_dict at `m4_states_{process_index}.pkl`
vision/m4/training/dataset.py:1416
↓ 3 callersFunctionload_vsr
(split)
vision/data/datasets_processing_scripts/integrate_evaluation_benchmarks_chatbot/vsr.py:38
↓ 3 callersFunctionmodel_name_to_classes
returns config_class, model_class for a given model name or path
vision/m4/training/setup_language_model.py:22
↓ 3 callersFunctionmprint
(*args, **kwargs)
vision/smolvlm2/smolvlm/utils.py:14
↓ 3 callersFunctionpad
(arr, target, pad_val)
vision/smolvlm2/smolvlm/datasets/dataset_clip_sampling.py:68
↓ 3 callersFunctionprocess_ds_wrapped
(ds: Union[DatasetDict, Dataset], batch_size: int, num_proc: int)
vision/m4/utils/datasets/get_self_contained_ds.py:76
↓ 3 callersMethodremove_empty_els_in_list
(self, list_)
vision/m4/sourcing/data_collection/processors/web_document_line_deduplication.py:40
↓ 3 callersMethodsave_model
Saves the model. Supports big models or PEFT seamlessly if not using DeepSpeed.
vision/smolvlm2/smolvlm/train/smolvlm_trainer.py:109
↓ 3 callersMethodsave_state
Saves state_dict to `m4_states_{process_index}.pkl`
vision/m4/training/dataset.py:1406
↓ 3 callersFunctionselect_n
(dataset: "Dataset", n: int)
text/data/smoltalk/rewrite/pipeline/dataset.py:107
↓ 3 callersMethodset_title
(self)
vision/m4/sourcing/data_collection/visualization/pair_visualization.py:32
↓ 3 callersFunctionset_verbosity_info
Set the verbosity to the `INFO` level.
vision/m4/utils/logging.py:147
↓ 3 callersMethodsimpler_get_splitted_images_and_corresponding_text
(self, image)
vision/m4/models/vgpt2/evaluation_captioning_in_context_vgpt2.py:119
↓ 3 callersFunctionsimplify_media_node
(node, page_url)
vision/m4/sourcing/data_collection/utils/simplification_utils.py:168
↓ 3 callersMethodsplit_on_whitespace
This method also removes concatenated spaces.
vision/m4/sourcing/data_collection/processors/pair_filtering.py:226
↓ 3 callersMethodstandardize_whitespace
There are different whitespace characters.
vision/m4/sourcing/data_collection/processors/pair_filtering.py:203
↓ 3 callersMethodstart
(self)
vision/m4/utils/training/timer.py:52
↓ 3 callersMethodstop
(self)
vision/m4/utils/training/timer.py:41
↓ 3 callersFunctiontokenize_text_sublist
(curr_text_sublist, curr_image_sublist_text, curr_image_text, tokenizer)
vision/m4/training/packing.py:1065
↓ 2 callersMethod__init__
(self, out=True, err=True, replay=True)
vision/m4/testing_utils.py:405
↓ 2 callersMethod__init__
(self, value=0, lower=200, always_apply=False, p=0.5)
vision/m4/training/utils.py:180
↓ 2 callersMethod__init__
(self, data_source, sample_generator)
vision/m4/training/dataset.py:543
↓ 2 callersMethod__init__
(self, activation, input_size, intermediate_size, output_size)
vision/m4/models/common.py:101
↓ 2 callersMethod__init__
( self, additional_vocab_size=0, vocab_size=32000, hidden_size=4096, i
vision/m4/models/vmistral/configuration_vmistral.py:254
↓ 2 callersMethod__init__
( self, vocab_size=32000, additional_vocab_size=0, hidden_size=4096, i
vision/m4/models/idefics/configuration_idefics.py:210
↓ 2 callersMethod__init__
( self, additional_vocab_size=0, vocab_size=128_256, hidden_size=4096,
vision/m4/models/vllama3/configuration_vllama3.py:286
↓ 2 callersMethod_check_if_training_is_over_and_maybe_save_model
( self, curr_opt_step, curr_epoch, gbs_running, max_num_updates,
vision/m4/training/trainer.py:1384
↓ 2 callersMethod_compute_vqa_accuracy
(self, generated_texts_unique, answers_unique, normalize_text_fn)
vision/m4/evaluation/custom_metrics/open_ended_vqa_metrics.py:73
↓ 2 callersFunction_convert_to_rgb
(image)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/build_ds_sft.py:101
↓ 2 callersMethod_create_example_prompt
( self, prompt_template_id, class_name, images, multiple_images_in_sin
vision/m4/models/vgpt2/evaluation_classification_in_context_vgpt2.py:379
↓ 2 callersMethod_create_example_prompt
(self, prompt_template_id, image, eos_token, caption="", context=None, without_image=False)
vision/m4/models/vgpt2/evaluation_captioning_in_context_vgpt2.py:283
↓ 2 callersMethod_create_example_prompt
( self, prompt_template_id, question, image, eos_token, answer
vision/m4/models/vgpt2/evaluation_open_ended_vqa_in_context_vgpt2.py:378
↓ 2 callersMethod_create_prompt
(self, question, answer="")
vision/m4/models/vgpt2/evaluation_classification_vqa_in_context_vgpt2.py:147
↓ 2 callersMethod_do_batch
(self, batch, curr_opt_step, dataset_name=None, dataset_idx=None, validation=False)
vision/m4/training/trainer.py:609
↓ 2 callersMethod_get_clip_scores
If possible, modifies `media_info`to add clip scores on available texts
vision/m4/sourcing/data_collection/processors/pair_extractor.py:90
↓ 2 callersFunction_get_datasets
(task, args, vision_encoder, vision_encoder_processor)
vision/m4/evaluation/evaluators/in_contexter.py:158
↓ 2 callersFunction_get_library_name
()
vision/m4/utils/logging.py:49
↓ 2 callersFunction_get_seqlens_in_batch
Convert a 1D integer-coded mask (like [1,1,1,2,2,2,2,3,3,3,0,0,...]) into sub-sequence lengths. We assume sub-sequence IDs appear in ascendin
vision/smolvlm2/smolvlm/model/varlen_packing.py:14
↓ 2 callersMethod_get_system_prompt
(self)
tools/smol_tools/smol_tools/agent.py:93
↓ 2 callersMethod_get_worker_id_and_worker_total_num
(self)
vision/m4/training/dataset.py:961
↓ 2 callersFunction_read_stream
(stream, callback)
vision/m4/testing_utils.py:1047
↓ 2 callersMethod_remove_digits_string
(self, string)
vision/m4/sourcing/data_collection/processors/dom_tree_simplificator.py:129
← previousnext →101–200 of 1,907, ranked by callers