MCPcopy Create free account

hub / github.com/huggingface/smollm / functions

Functions1,907 in github.com/huggingface/smollm

↓ 159 callersMethodstrip
Way faster than text.strip(strip_characters) since strip_characters is a set instead of a str, and it contains a lot of elements (all
vision/m4/sourcing/data_collection/processors/pair_filtering.py:239
↓ 74 callersMethodfrom_pretrained
(cls, embeddings, freeze=True, **kwargs)
vision/m4/models/custom_modules.py:244
↓ 55 callersMethodfrom_dict
(cls, data)
tools/smol_tools/smol_tools/chatter.py:23
↓ 53 callersFunctioncorrect_casing
(text, is_question=False)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/build_ds_sft.py:114
↓ 34 callersMethodupdate
(self, task, advance)
vision/m4/utils/progress.py:72
↓ 27 callersFunctionconvert_img_to_bytes
(img_path, format)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/build_ds_sft.py:92
↓ 18 callersMethodcopy
(self)
vision/smolvlm2/smolvlm/conversation.py:290
↓ 17 callersMethodload_dataset
(self)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/merge_on_image_individual_dataset.py:81
↓ 15 callersFunctionexport_dataset_shard_idx_to_tar
( hf_datasets_paths: List[Union[str, Path]], saving_dir: Union[str, Path], ds_type: DatasetTypes,
vision/m4/utils/datasets/create_webdataset_tar.py:361
↓ 13 callersFunction_get_library_root_logger
()
vision/m4/utils/logging.py:53
↓ 13 callersFunctioninit_dict
()
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_pgm.py:26
↓ 13 callersMethodtraverse
(self)
vision/m4/sourcing/data_collection/processors/pre_extraction_simplificator.py:69
↓ 12 callersFunctiondeepspeed_gathered_parameters_context_manager
Under zero.Init returns a context manager that will gather the sharded param, otherwise returns an empty list If `modify` is `True`, gather
vision/m4/training/utils.py:848
↓ 12 callersMethodstate_dict
(self)
vision/m4/training/dataset.py:582
↓ 11 callersMethodregister_forward_hook
(self)
vision/m4/utils/activation_tracker.py:120
↓ 10 callersFunctioncompute_tflops_per_batch_per_gpu
( num_layers, batch_size, q_seq_len, k_seq_len, hidden_size, kv_in_dim, ff_exp_fac
vision/m4/training/utils.py:592
↓ 10 callersFunctionis_torch_available
()
vision/m4/testing_utils.py:49
↓ 10 callersMethodplot_distributions
hist_data is a list of statistics lists (works up to 3, if more is needed, add some colors and annotation colors)
vision/m4/sourcing/data_collection/visualization/pair_visualization.py:112
↓ 10 callersMethodstart
(self)
vision/m4/utils/training/timer.py:27
↓ 10 callersMethodtruncate
(list_, max_val)
vision/m4/sourcing/data_collection/visualization/pair_visualization.py:148
↓ 9 callersMethod__init__
(self, config)
vision/m4/models/vllama3/modeling_vllama3.py:337
↓ 9 callersFunction_configure_library_root_logger
()
vision/m4/utils/logging.py:57
↓ 9 callersFunctionbuild_image_transform
( image_size=384, min_image_size=378, max_image_size=None, eval=False, vision_encoder_type
vision/m4/training/utils.py:310
↓ 9 callersFunctionmake_selectolax_tree
(html_str)
vision/m4/sourcing/data_collection/utils/utils.py:18
↓ 9 callersMethodrender
(self, task)
vision/m4/utils/progress.py:24
↓ 8 callersFunction_convert_to_rgb
(image)
vision/m4/training/utils.py:237
↓ 8 callersMethoddelta
delta since last delta call
vision/m4/utils/training/timer.py:31
↓ 8 callersFunctionfreeze_model
(model, module_exceptions=[])
vision/m4/training/utils.py:70
↓ 8 callersMethodtrain
(self, maybe_torch_profile_scheduler=None)
vision/m4/training/trainer.py:1612
↓ 7 callersMethod__init__
( self, hidden_size: int, intermediate_size: int, hidden_act: str, )
vision/m4/models/idefics/modeling_idefics.py:159
↓ 7 callersMethod_split_array
(self, array, nb_combinations)
vision/m4/models/vgpt2/evaluation_image_caption_matching_vgpt2.py:72
↓ 7 callersMethodcompute
Compute the score of a generative task using a llm as a judge. The generative task can be multiturn with 2 turns max, in that case, w
text/evaluation/smollm3/tasks.py:514
↓ 7 callersMethodfrom_config
(cls, config, **kwargs)
vision/m4/models/custom_modules.py:50
↓ 7 callersFunctionget_splitted_images_and_corresponding_text
( image, vision_encoder_max_image_size, max_image_size, pre_split_scale_up_max, pre_split_
vision/m4/training/packing.py:26
↓ 7 callersMethodload_state_dict
(self, state_dict)
vision/m4/training/dataset.py:590
↓ 7 callersMethodprocess
Process the input text and yield results as they're generated
tools/smol_tools/smol_tools/base.py:45
↓ 7 callersFunctiontrim
(image)
vision/data/datasets_processing_scripts/create_fine_tuning_datasets/create_table_datasets.py:20
↓ 6 callersMethod__init__
(self, intermediate_size, config)
vision/m4/models/vgpt2/modeling_vgpt2.py:345
↓ 6 callersFunctioncmd_retry_loop
(cmd, max_retries=5)
vision/m4/scripts/s3_checkpoint_download_convert_upload.py:76
↓ 6 callersFunctionexport_dataset_all_shard_idx_to_tar
( hf_datasets_paths: List[Union[str, Path]], saving_dir: Union[str, Path], ds_type: DatasetTypes,
vision/m4/utils/datasets/create_webdataset_tar.py:226
↓ 6 callersFunctionformat_secs_to_time
converts seconds delta as generated by 2 snapshots of time.time() into hh:mm:ss
vision/m4/utils/training/timer.py:7
↓ 6 callersMethodfrom_pretrained
(cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs)
vision/m4/models/vgpt2/configuration_vgpt2.py:281
↓ 6 callersFunctionget_ngrams
(ids: np.ndarray, voc_size: int, n: int)
vision/m4/sourcing/processing/extracting_ngrams/utils.py:95
↓ 6 callersMethodget_percentage_ratio
(self, ratio_numerator=0, denominator=1)
vision/m4/sourcing/data_collection/visualization/pair_stat_dashboard.py:348
↓ 6 callersFunctionget_stats
(var, ctx)
vision/m4/training/utils.py:943
↓ 6 callersFunctionload_dataset_html
(shuffle=False, buffer_size=10000, seed=42)
vision/m4/sourcing/data_collection/utils/utils.py:5
↓ 6 callersMethodparse
(cls)
vision/m4/training/config.py:547
↓ 6 callersMethodreset_state
(self)
vision/m4/training/dataset.py:1189
↓ 6 callersMethodstep
(self, advance_steps)
vision/m4/utils/progress.py:58
↓ 5 callersFunction_get_web_dataset
( urls, tar_to_samples_ops, decode_and_batch_ops, shuffle_initial_urls_list=False, shuffle
vision/m4/training/dataset_utils.py:348
↓ 5 callersMethodanalyse_variable
(self, var, ctx, current_module_stats)
vision/m4/utils/activation_tracker.py:75
↓ 5 callersFunctioncheck_img_exception
(img)
vision/m4/utils/datasets/create_webdataset_tar.py:25
↓ 5 callersFunctioncorrect_casing_finqa
(text, is_question=False, is_context=False)
vision/data/datasets_processing_scripts/build_concatenation_datasets_sft/build_ds_sft.py:4006
↓ 5 callersFunctionformat_secs_to_sec_fractions
converts seconds delta as generated by 2 snapshots of time.time() into ss.msec
vision/m4/utils/training/timer.py:12
↓ 5 callersMethodfrom_pretrained
(cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs)
vision/m4/models/vmistral/configuration_vmistral.py:374
↓ 5 callersMethodfrom_pretrained
(cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs)
vision/m4/models/vllama3/configuration_vllama3.py:413
↓ 5 callersFunctionget_stats_format
(ctx)
vision/m4/training/utils.py:963
↓ 5 callersFunctionget_tokenizer
We artificially separate `tokenizer_add_tokens` and `tokenizer_add_special_tokens` is a dictionary whose keys only takes into account special tok
vision/m4/training/utils.py:508
↓ 5 callersMethodget_words_from_text
Get words from a text. Non reversible since the text is split on multiple characters, words are stripped of special characters and cha
vision/m4/sourcing/data_collection/processors/web_document_filtering.py:126
↓ 5 callersMethodget_words_from_text
Get words from a text. Non reversible since the text is split on multiple characters, words are stripped of special characters and cha
vision/m4/sourcing/data_collection/processors/pair_filtering.py:261
↓ 5 callersMethodload_dataset
(self)
vision/m4/sourcing/data_collection/visualization/web_document_visualization.py:21
↓ 5 callersMethodset_epoch
(self, epoch)
vision/m4/training/dataset.py:1222
↓ 5 callersMethodsimpler_get_splitted_images_and_corresponding_text
(self, image)
vision/m4/models/vgpt2/evaluation_classification_in_context_vgpt2.py:68
↓ 5 callersMethodsimpler_get_splitted_images_and_corresponding_text
(self, image)
vision/m4/models/vgpt2/evaluation_open_ended_vqa_in_context_vgpt2.py:164
↓ 4 callersMethod__init__
(self, config: VMistralConfig, vision_model=None)
vision/m4/models/vmistral/modeling_vmistral.py:963
↓ 4 callersMethod_create_chat_completion
Helper method to create chat completions with standard parameters
tools/smol_tools/smol_tools/base.py:49
↓ 4 callersMethod_get_additional_step_logs
(self)
vision/m4/training/trainer.py:991
↓ 4 callersMethod_get_class_name_value
(self, prompt_template_id, class_name)
vision/m4/models/vgpt2/evaluation_classification_in_context_vgpt2.py:356
↓ 4 callersFunction_search_subsequence
Searches for the first occurrence of 'pattern' in 'sequence' starting at offset 'start'. Returns the index of that occurrence, or -1 if n
vision/smolvlm2/smolvlm/datasets/dataset.py:284
↓ 4 callersFunction_search_subsequence
Searches for the first occurrence of 'pattern' in 'sequence' starting at offset 'start'. Returns the index of that occurrence, or -1 if n
vision/smolvlm2/smolvlm/datasets/dataset_clip_sampling.py:416
↓ 4 callersFunctionceil_by_factor
Ceil 'number' to the nearest integer multiple of 'factor'.
vision/smolvlm2/smolvlm/mm_utils.py:32
↓ 4 callersMethodcheck_number_words
(media_info, text_key, number_words_min_cutoff, number_words_max_cutoff)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:275
↓ 4 callersMethodcheck_size_image
( media_info, original_width_min_cutoff, original_width_max_cutoff, original_h
vision/m4/sourcing/data_collection/processors/pair_filtering.py:164
↓ 4 callersMethodcheck_special_character_ratio
(media_info, text_key, special_character_ratio_max_cutoff)
vision/m4/sourcing/data_collection/processors/pair_filtering.py:294
↓ 4 callersFunctioncompute_perceiver_tflops_per_batch_per_gpu
( num_layers, batch_size, q_seq_len, vision_embed_seq_len, q_k_v_input_dim, attention_
vision/m4/training/utils.py:674
↓ 4 callersFunctionconvert_to_number
(string)
vision/m4/evaluation/custom_metrics/utils.py:398
↓ 4 callersFunctioncreate_ds_mmbench
`split` is "validation" or "test".
vision/data/datasets_processing_scripts/integrate_evaluation_benchmarks_chatbot/mmbench.py:26
↓ 4 callersMethoddisplay_distribution_plot
( self, list_extraction_methods, list_metric_to_compare, title=None, bin_size=[1, 1], max_value=None
vision/m4/sourcing/data_collection/visualization/pair_stat_dashboard.py:392
↓ 4 callersMethodformat_print_logs
compact formatting of the logs with pre-specified formatter for each log entry, plus a catch-all if new log entries are added but for
vision/m4/training/trainer.py:997
↓ 4 callersMethodfrom_pretrained
(cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs)
vision/m4/models/idefics/configuration_idefics.py:311
↓ 4 callersFunctionget_deepspeed_plugin
()
vision/m4/training/utils.py:806
↓ 4 callersMethodget_input_embeddings
(self)
vision/m4/models/vgpt2/modeling_vgpt2.py:819
↓ 4 callersFunctionget_jz_dataset_dir
()
vision/m4/sourcing/pmd/__init__.py:17
↓ 4 callersFunctiongreedy_packing
Args details: `images_to_pack` -> # Each tensor is of size (3, im_height, im_width) `output_input_ids` -> # Each tensor is of size (max_s
vision/m4/training/packing.py:153
↓ 4 callersFunctionis_deepspeed_zero_init_enabled
()
vision/m4/training/utils.py:817
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_343_smolvlm_05b_1st_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_341_smolvlm_025b_1st_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_347_smolvlm_500M_2nd_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_348_smolvlm_2B/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_345_vsmollm2_256M_2nd_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_349_vsmollm2_500M_3rd_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_350_smolvlm_2B_2nd_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/experiments/pretraining/vloom/tr_346_vsmollm2_256M_3rd_stage/resize_embed_for_eou.py:36
↓ 4 callersFunctionload
(weight_name)
vision/m4/scripts/resize_embed_for_eou.py:38
↓ 4 callersFunctionload_examples
(num_docs)
vision/m4/sourcing/data_collection/visualization/wikipedia/explore.py:32
↓ 4 callersMethodoverride_vision_model
(cls, model, vision_model_name, vision_config, torch_dtype)
vision/m4/models/custom_modules.py:32
↓ 4 callersMethodpredict
(self, **kwargs)
vision/m4/models/vgpt2/evaluation_image_caption_matching_vgpt2.py:202
↓ 4 callersFunctionprepare_result_return
This function returns the end dictionary at the exit of the dataloader. Mostly batchify things and pad accordingly.
vision/m4/training/packing.py:378
↓ 4 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
vision/m4/models/perceiver/perceiver.py:47
↓ 4 callersFunctionrepeat_kv
This is the equivalent of torch.repeat_interleave(x, dim=1, repeats=n_rep). The hidden states go from (batch, num_key_value_heads, seqlen, he
vision/m4/models/vmistral/modeling_vmistral.py:325
next →1–100 of 1,907, ranked by callers