| 281 | return encoder_out, encoder_out_lens |
| 282 | |
| 283 | def data_template(self, data): |
| 284 | system, user, assistant = [], [], [] |
| 285 | for i, item in enumerate(data): |
| 286 | role = item["role"] |
| 287 | content = item["content"] |
| 288 | if role == "system": |
| 289 | system.append(content) |
| 290 | elif role == "user": |
| 291 | if "audio" in item: |
| 292 | audio = item["audio"] |
| 293 | content = [content, audio] |
| 294 | user.append(content) |
| 295 | elif role == "assistant": |
| 296 | assistant.append(content) |
| 297 | |
| 298 | system = system * len(user) |
| 299 | |
| 300 | contents = { |
| 301 | "system": system, |
| 302 | "user": user, |
| 303 | "assistant": assistant, |
| 304 | } |
| 305 | |
| 306 | return contents |
| 307 | |
| 308 | def data_load_speech(self, contents: dict, tokenizer, frontend, meta_data={}, **kwargs): |
| 309 | system = contents["system"] |