MCPcopy Create free account
hub / github.com/allenai/OLMoASR / process_transcripts_parallel

Function process_transcripts_parallel

scripts/data/processing/text_to_jsonl.py:257–284  ·  view source on GitHub ↗

Process transcript files in parallel. Args: input_files: List of transcript file paths num_processes: Number of processes to use (default: system CPU count) Returns: List of transcript metadata dictionaries

(
    input_files: FileList, num_processes: Optional[int] = None
)

Source from the content-addressed store, hash-verified

255
256
257def process_transcripts_parallel(
258 input_files: FileList, num_processes: Optional[int] = None
259) -> List[TranscriptDict]:
260 """
261 Process transcript files in parallel.
262
263 Args:
264 input_files: List of transcript file paths
265 num_processes: Number of processes to use (default: system CPU count)
266
267 Returns:
268 List of transcript metadata dictionaries
269 """
270 if num_processes is None:
271 num_processes = multiprocessing.cpu_count()
272
273 print(f"Processing {len(input_files)} files using {num_processes} processes")
274
275 with multiprocessing.Pool(processes=num_processes) as pool:
276 transcript_dicts = list(
277 tqdm(
278 pool.imap_unordered(parallel_process_file, input_files),
279 total=len(input_files),
280 desc="Processing transcripts",
281 )
282 )
283
284 return transcript_dicts
285
286
287def text_to_jsonl(

Callers 1

text_to_jsonlFunction · 0.85

Calls

no outgoing calls

Tested by

no test coverage detected