MCPcopy Create free account
hub / github.com/Topdu/OpenOCR / predict

Method predict

tools/infer_doc.py:421–776  ·  view source on GitHub ↗

Predicts the layout parsing result for the given input. Args: input (Union[str, list[str], np.ndarray, list[np.ndarray]]): Input image path, list of image paths, numpy array of an image, or list of

(
        self,
        input: Union[str, list[str], np.ndarray, list[np.ndarray]],
        use_doc_orientation_classify: Union[bool, None] = False,
        use_doc_unwarping: Union[bool, None] = False,
        use_layout_detection: Union[bool, None] = None,
        use_chart_recognition: Union[bool, None] = None,
        layout_threshold: Optional[Union[float, dict]] = None,
        layout_nms: Optional[bool] = None,
        layout_unclip_ratio: Optional[Union[float, Tuple[float, float],
                                            dict]] = None,
        layout_merge_bboxes_mode: Optional[str] = None,
        use_queues: Optional[bool] = None,
        prompt_label: Optional[Union[str, None]] = None,
        format_block_content: Union[bool, None] = None,
        repetition_penalty: Optional[float] = None,
        temperature: Optional[float] = None,
        top_p: Optional[float] = None,
        min_pixels: Optional[int] = None,
        max_pixels: Optional[int] = None,
        max_new_tokens: Optional[int] = None,
        merge_layout_blocks: Optional[bool] = None,
        markdown_ignore_labels: Optional[list[str]] = None,
        **kwargs,
    )

Source from the content-addressed store, hash-verified

419 return parsing_res_lists, table_res_lists, imgs_in_doc
420
421 def predict(
422 self,
423 input: Union[str, list[str], np.ndarray, list[np.ndarray]],
424 use_doc_orientation_classify: Union[bool, None] = False,
425 use_doc_unwarping: Union[bool, None] = False,
426 use_layout_detection: Union[bool, None] = None,
427 use_chart_recognition: Union[bool, None] = None,
428 layout_threshold: Optional[Union[float, dict]] = None,
429 layout_nms: Optional[bool] = None,
430 layout_unclip_ratio: Optional[Union[float, Tuple[float, float],
431 dict]] = None,
432 layout_merge_bboxes_mode: Optional[str] = None,
433 use_queues: Optional[bool] = None,
434 prompt_label: Optional[Union[str, None]] = None,
435 format_block_content: Union[bool, None] = None,
436 repetition_penalty: Optional[float] = None,
437 temperature: Optional[float] = None,
438 top_p: Optional[float] = None,
439 min_pixels: Optional[int] = None,
440 max_pixels: Optional[int] = None,
441 max_new_tokens: Optional[int] = None,
442 merge_layout_blocks: Optional[bool] = None,
443 markdown_ignore_labels: Optional[list[str]] = None,
444 **kwargs,
445 ) -> PaddleOCRVLResult:
446 """
447 Predicts the layout parsing result for the given input.
448
449 Args:
450 input (Union[str, list[str], np.ndarray, list[np.ndarray]]): Input image path, list of image paths,
451 numpy array of an image, or list of numpy arrays.
452 use_doc_orientation_classify (Optional[bool]): Whether to use document orientation classification.
453 use_doc_unwarping (Optional[bool]): Whether to use document unwarping.
454 layout_threshold (Optional[float]): The threshold value to filter out low-confidence predictions. Default is None.
455 layout_nms (bool, optional): Whether to use layout-aware NMS. Defaults to False.
456 layout_unclip_ratio (Optional[Union[float, Tuple[float, float]]], optional): The ratio of unclipping the bounding box.
457 Defaults to None.
458 If it's a single number, then both width and height are used.
459 If it's a tuple of two numbers, then they are used separately for width and height respectively.
460 If it's None, then no unclipping will be performed.
461 layout_merge_bboxes_mode (Optional[str], optional): The mode for merging bounding boxes. Defaults to None.
462 use_queues (Optional[bool], optional): Whether to use queues. Defaults to None.
463 prompt_label (Optional[Union[str, None]], optional): The label of the prompt in ['ocr', 'formula', 'table', 'chart']. Defaults to None.
464 format_block_content (Optional[bool]): Whether to format the block content. Default is None.
465 repetition_penalty (Optional[float]): The repetition penalty parameter used for VL model sampling. Default is None.
466 temperature (Optional[float]): Temperature parameter used for VL model sampling. Default is None.
467 top_p (Optional[float]): Top-p parameter used for VL model sampling. Default is None.
468 min_pixels (Optional[int]): The minimum number of pixels allowed when the VL model preprocesses images. Default is None.
469 max_pixels (Optional[int]): The maximum number of pixels allowed when the VL model preprocesses images. Default is None.
470 max_new_tokens (Optional[int]): The maximum number of new tokens. Default is None.
471 merge_layout_blocks (Optional[bool]): Whether to merge layout blocks. Default is None.
472 markdown_ignore_labels (Optional[list[str]]): The list of ignored markdown labels. Default is None.
473 **kwargs (Any): Additional settings to extend functionality.
474
475 Returns:
476 PaddleOCRVLResult: The predicted layout parsing result.
477 """
478 model_settings = self.get_model_settings(

Callers 1

process_batchFunction · 0.95

Calls 3

get_model_settingsMethod · 0.95
getMethod · 0.80

Tested by

no test coverage detected