Predicts the layout parsing result for the given input. Args: input (Union[str, list[str], np.ndarray, list[np.ndarray]]): Input image path, list of image paths, numpy array of an image, or list of
(
self,
input: Union[str, list[str], np.ndarray, list[np.ndarray]],
use_doc_orientation_classify: Union[bool, None] = False,
use_doc_unwarping: Union[bool, None] = False,
use_layout_detection: Union[bool, None] = None,
use_chart_recognition: Union[bool, None] = None,
layout_threshold: Optional[Union[float, dict]] = None,
layout_nms: Optional[bool] = None,
layout_unclip_ratio: Optional[Union[float, Tuple[float, float],
dict]] = None,
layout_merge_bboxes_mode: Optional[str] = None,
use_queues: Optional[bool] = None,
prompt_label: Optional[Union[str, None]] = None,
format_block_content: Union[bool, None] = None,
repetition_penalty: Optional[float] = None,
temperature: Optional[float] = None,
top_p: Optional[float] = None,
min_pixels: Optional[int] = None,
max_pixels: Optional[int] = None,
max_new_tokens: Optional[int] = None,
merge_layout_blocks: Optional[bool] = None,
markdown_ignore_labels: Optional[list[str]] = None,
**kwargs,
)
| 419 | return parsing_res_lists, table_res_lists, imgs_in_doc |
| 420 | |
| 421 | def predict( |
| 422 | self, |
| 423 | input: Union[str, list[str], np.ndarray, list[np.ndarray]], |
| 424 | use_doc_orientation_classify: Union[bool, None] = False, |
| 425 | use_doc_unwarping: Union[bool, None] = False, |
| 426 | use_layout_detection: Union[bool, None] = None, |
| 427 | use_chart_recognition: Union[bool, None] = None, |
| 428 | layout_threshold: Optional[Union[float, dict]] = None, |
| 429 | layout_nms: Optional[bool] = None, |
| 430 | layout_unclip_ratio: Optional[Union[float, Tuple[float, float], |
| 431 | dict]] = None, |
| 432 | layout_merge_bboxes_mode: Optional[str] = None, |
| 433 | use_queues: Optional[bool] = None, |
| 434 | prompt_label: Optional[Union[str, None]] = None, |
| 435 | format_block_content: Union[bool, None] = None, |
| 436 | repetition_penalty: Optional[float] = None, |
| 437 | temperature: Optional[float] = None, |
| 438 | top_p: Optional[float] = None, |
| 439 | min_pixels: Optional[int] = None, |
| 440 | max_pixels: Optional[int] = None, |
| 441 | max_new_tokens: Optional[int] = None, |
| 442 | merge_layout_blocks: Optional[bool] = None, |
| 443 | markdown_ignore_labels: Optional[list[str]] = None, |
| 444 | **kwargs, |
| 445 | ) -> PaddleOCRVLResult: |
| 446 | """ |
| 447 | Predicts the layout parsing result for the given input. |
| 448 | |
| 449 | Args: |
| 450 | input (Union[str, list[str], np.ndarray, list[np.ndarray]]): Input image path, list of image paths, |
| 451 | numpy array of an image, or list of numpy arrays. |
| 452 | use_doc_orientation_classify (Optional[bool]): Whether to use document orientation classification. |
| 453 | use_doc_unwarping (Optional[bool]): Whether to use document unwarping. |
| 454 | layout_threshold (Optional[float]): The threshold value to filter out low-confidence predictions. Default is None. |
| 455 | layout_nms (bool, optional): Whether to use layout-aware NMS. Defaults to False. |
| 456 | layout_unclip_ratio (Optional[Union[float, Tuple[float, float]]], optional): The ratio of unclipping the bounding box. |
| 457 | Defaults to None. |
| 458 | If it's a single number, then both width and height are used. |
| 459 | If it's a tuple of two numbers, then they are used separately for width and height respectively. |
| 460 | If it's None, then no unclipping will be performed. |
| 461 | layout_merge_bboxes_mode (Optional[str], optional): The mode for merging bounding boxes. Defaults to None. |
| 462 | use_queues (Optional[bool], optional): Whether to use queues. Defaults to None. |
| 463 | prompt_label (Optional[Union[str, None]], optional): The label of the prompt in ['ocr', 'formula', 'table', 'chart']. Defaults to None. |
| 464 | format_block_content (Optional[bool]): Whether to format the block content. Default is None. |
| 465 | repetition_penalty (Optional[float]): The repetition penalty parameter used for VL model sampling. Default is None. |
| 466 | temperature (Optional[float]): Temperature parameter used for VL model sampling. Default is None. |
| 467 | top_p (Optional[float]): Top-p parameter used for VL model sampling. Default is None. |
| 468 | min_pixels (Optional[int]): The minimum number of pixels allowed when the VL model preprocesses images. Default is None. |
| 469 | max_pixels (Optional[int]): The maximum number of pixels allowed when the VL model preprocesses images. Default is None. |
| 470 | max_new_tokens (Optional[int]): The maximum number of new tokens. Default is None. |
| 471 | merge_layout_blocks (Optional[bool]): Whether to merge layout blocks. Default is None. |
| 472 | markdown_ignore_labels (Optional[list[str]]): The list of ignored markdown labels. Default is None. |
| 473 | **kwargs (Any): Additional settings to extend functionality. |
| 474 | |
| 475 | Returns: |
| 476 | PaddleOCRVLResult: The predicted layout parsing result. |
| 477 | """ |
| 478 | model_settings = self.get_model_settings( |
no test coverage detected