(self, video_file)
| 308 | |
| 309 | @torch.no_grad() |
| 310 | def get_video_embedding(self, video_file): |
| 311 | pixel_values = load_video(video_file) |
| 312 | TC, H, W = pixel_values.shape |
| 313 | pixel_values = pixel_values.reshape(TC // 3, 3, H, W).transpose(0, 1) # [C, T, H, W] |
| 314 | pixel_values = pixel_values.unsqueeze(0).to(self.device, dtype=self.dtype) |
| 315 | assert len(pixel_values.shape) == 5 |
| 316 | language_model_inputs = self.model.extract_feature(pixel_values) |
| 317 | return language_model_inputs |
| 318 | |
| 319 | @torch.no_grad() |
| 320 | def answer(self, conversations, language_model_inputs, modal_type="image"): |
no test coverage detected