| 8 | return self.opt |
| 9 | |
| 10 | def initialize(self, parser): |
| 11 | parser.add_argument('--pretrained_dir', type=str, default='./checkpoints') |
| 12 | parser.add_argument('--seed', default=15, type=int) |
| 13 | parser.add_argument('--fix_noise_seed', action='store_true') |
| 14 | |
| 15 | # video |
| 16 | parser.add_argument('--input_size', type=int, default=512, help='input image size') |
| 17 | parser.add_argument('--input_nc', type=int, default=3, help='input image channel') |
| 18 | parser.add_argument('--fps', type=float, default=25.) |
| 19 | |
| 20 | # audio |
| 21 | parser.add_argument('--sampling_rate', type=int, default=16000) |
| 22 | parser.add_argument('--audio_marcing', type=int, default=2, help='number of adjacent frames. For value v, t -> [t-v, ..., t, ..., t+v]') |
| 23 | parser.add_argument('--wav2vec_sec', default=2, type=float, help='window length L (seconds), 50 frames') |
| 24 | parser.add_argument('--wav2vec_model_path', default='./checkpoints/wav2vec2-base-960h') |
| 25 | parser.add_argument('--audio2emotion_path', default='./checkpoints/wav2vec-english-speech-emotion-recognition') |
| 26 | parser.add_argument('--attention_window', default=2, type=int, help='attention window size, e.g., if 1, attend frames of t-1, t, t+1 for frame t') |
| 27 | |
| 28 | parser.add_argument('--only_last_features', action='store_true') |
| 29 | parser.add_argument('--average_emotion', action='store_true', help='averaging emotion or not.') |
| 30 | |
| 31 | # dropout |
| 32 | parser.add_argument('--audio_dropout_prob', default=0.1, type=float) |
| 33 | parser.add_argument('--ref_dropout_prob', default=0.1, type=float) |
| 34 | parser.add_argument('--emotion_dropout_prob', default=0.1, type=float) |
| 35 | |
| 36 | # model Hyper Parameters |
| 37 | parser.add_argument('--style_dim', type=int, default=512, help='w latent dimension') |
| 38 | parser.add_argument('--dim_a', type=int, default=512, help='audio dimension') |
| 39 | parser.add_argument('--dim_w', type=int, default=512, help='face dimension') |
| 40 | parser.add_argument('--dim_h', type=int, default=1024, help='hidden dimension') |
| 41 | parser.add_argument('--dim_m', type=int, default=20, help='dimension of orthogonal basis') |
| 42 | parser.add_argument('--dim_e', type=int, default=7, help='emotion dimension') |
| 43 | |
| 44 | # option for FMT |
| 45 | parser.add_argument('--fmt_depth', default=8, type=int) |
| 46 | parser.add_argument('--num_heads', default=8, type=int) |
| 47 | parser.add_argument('--mlp_ratio', default=4.0, type=float) |
| 48 | parser.add_argument('--no_learned_pe', action='store_true') |
| 49 | parser.add_argument('--num_prev_frames', type=int, default=10) |
| 50 | parser.add_argument('--max_grad_norm', default=1, type=float, help='max grad norm for training transformers') |
| 51 | |
| 52 | parser.add_argument('--ode_atol', default=1e-5, type=float) |
| 53 | parser.add_argument('--ode_rtol', default=1e-5, type=float) |
| 54 | parser.add_argument('--nfe', default=10, type=int, |
| 55 | help='Number of Function Evaluateions (NFEs) for ODE solver') |
| 56 | parser.add_argument('--torchdiffeq_ode_method', default='euler', |
| 57 | help='ODE solver') |
| 58 | parser.add_argument('--a_cfg_scale', default=2.0, type=float, |
| 59 | help='audio classifier-free guidance (vector field) scale') |
| 60 | parser.add_argument('--e_cfg_scale', default=1.0, type=float, |
| 61 | help='emotion classifier-free guidance (vector field) scale') |
| 62 | parser.add_argument('--r_cfg_scale', default=1.0, type=float, |
| 63 | help='reference classifier-free guidance (vector field) scale') |
| 64 | |
| 65 | # option for Diffusion (ablation) |
| 66 | parser.add_argument('--n_diff_steps', type=int, default=500, help='number of diffusion steps') |
| 67 | parser.add_argument('--diff_schedule', type=str, default='cosine', choices=['linear', 'cosine', 'quadratic', 'sigmoid']) |