| 1 | export default interface Inference { |
| 2 | /** Send back pure media or JSON. Default: `true` */ |
| 3 | json?: boolean; |
| 4 | /** Stream results back. Default: `false` */ |
| 5 | stream?: boolean; |
| 6 | |
| 7 | /** Maximum length of generated tokens, defaults to 20. Overrides `max_new_tokens`. */ |
| 8 | max_length?: number; |
| 9 | |
| 10 | /** Maximum number of tokens to generate, ignoring prompt tokens. */ |
| 11 | max_new_tokens?: number; |
| 12 | |
| 13 | /** Minimum sequence length, defaults to 0. Overrides `min_new_tokens`. */ |
| 14 | min_length?: number; |
| 15 | |
| 16 | /** Minimum number of tokens to generate, ignoring prompt tokens. */ |
| 17 | min_new_tokens?: number; |
| 18 | |
| 19 | /** Controls stopping condition for beam search. `true` stops at `num_beams` complete candidates; `never` continues indefinitely. */ |
| 20 | early_stopping?: boolean | "never"; |
| 21 | |
| 22 | /** Maximum computation time in seconds. Generation completes current pass after time expires. */ |
| 23 | max_time?: number; |
| 24 | |
| 25 | /** Whether to use sampling instead of greedy decoding, defaults to false. */ |
| 26 | do_sample?: boolean; |
| 27 | |
| 28 | /** Number of beams for beam search, defaults to 1. */ |
| 29 | num_beams?: number; |
| 30 | |
| 31 | /** Number of groups to divide beams into for diversity, defaults to 1. */ |
| 32 | num_beam_groups?: number; |
| 33 | |
| 34 | /** Balances model confidence and degeneration penalty in contrastive search decoding. */ |
| 35 | penalty_alpha?: number; |
| 36 | |
| 37 | /** Whether to use past attentions to speed up decoding, defaults to true. */ |
| 38 | use_cache?: boolean; |
| 39 | |
| 40 | /** Modulates next token probabilities, defaults to 1.0. */ |
| 41 | temperature?: number; |
| 42 | |
| 43 | /** Keeps highest probability vocabulary tokens for top-k filtering, defaults to 50. */ |
| 44 | top_k?: number; |
| 45 | |
| 46 | /** Keeps smallest set of tokens summing to at least `top_p`, defaults to 1.0. */ |
| 47 | top_p?: number; |
| 48 | |
| 49 | /** Local typicality, keeps smallest set of most typical tokens summing to `typical_p`, defaults to 1.0. */ |
| 50 | typical_p?: number; |
| 51 | |
| 52 | /** Only samples tokens with conditional probability above `epsilon_cutoff`. */ |
| 53 | epsilon_cutoff?: number; |
| 54 | |
| 55 | /** Hybrid sampling method using `eta_cutoff` and expected token probability. */ |
| 56 | eta_cutoff?: number; |
| 57 | |
| 58 | /** Subtracts from a beam's score if it generates a token same as any other beam's token at that time. */ |
| 59 | diversity_penalty?: number; |
| 60 |
nothing calls this directly
no outgoing calls
no test coverage detected