MCPcopy Create free account

hub / github.com/VectifyAI/PageIndex / functions

Functions136 in github.com/VectifyAI/PageIndex

↓ 28 callersMethodinfo
(self, message, **kwargs)
pageindex/utils.py:305
↓ 14 callersFunctionllm_completion
(model, prompt, chat_history=None, return_finish_reason=False)
pageindex/utils.py:32
↓ 13 callersFunctionextract_json
(content)
pageindex/utils.py:99
↓ 8 callersMethoderror
(self, message, **kwargs)
pageindex/utils.py:308
↓ 6 callersFunctioncount_tokens
(text, model=None)
pageindex/utils.py:26
↓ 6 callersFunctionformat_structure
(structure, order=None)
pageindex/utils.py:640
↓ 5 callersFunctioncheck_if_toc_transformation_is_complete
(content, toc, model=None)
pageindex/page_index.py:143
↓ 5 callersMethodload
Load the configuration, merging user options with default values.
pageindex/utils.py:670
↓ 4 callersFunctionconvert_physical_index_to_int
(data)
pageindex/utils.py:518
↓ 4 callersFunctionllm_acompletion
(model, prompt)
pageindex/utils.py:62
↓ 4 callersMethodlog
(self, level, message, **kwargs)
pageindex/utils.py:294
↓ 3 callersMethod_read_json
Read a JSON file, returning None on any error.
pageindex/client.py:148
↓ 3 callersFunctionget_pdf_name
(pdf_path)
pageindex/utils.py:271
↓ 3 callersFunctionmd_to_tree
(md_path, if_thinning=False, min_token_threshold=None, if_add_node_summary='no', summary_token_threshold=None,
pageindex/page_index_md.py:243
↓ 3 callersFunctionmeta_processor
(page_list, mode=None, toc_content=None, toc_page_list=None, start_index=1, opt=None, logger=None)
pageindex/page_index.py:959
↓ 3 callersFunctionpost_processing
(structure, end_physical_index)
pageindex/utils.py:433
↓ 3 callersFunctionstructure_to_list
(structure)
pageindex/utils.py:159
↓ 2 callersMethod_ensure_doc_loaded
Load full document JSON on demand (structure, pages, etc.).
pageindex/client.py:208
↓ 2 callersMethod_make_meta_entry
Build a lightweight meta entry from a document dict.
pageindex/client.py:133
↓ 2 callersMethod_read_meta
Read and validate _meta.json, returning None on any corruption.
pageindex/client.py:181
↓ 2 callersMethod_rebuild_meta
Scan individual doc JSON files and return a meta dict.
pageindex/client.py:170
↓ 2 callersFunction_run
()
examples/agentic_vectorless_rag_demo.py:89
↓ 2 callersFunctionadd_node_text
(node, pdf_pages)
pageindex/utils.py:552
↓ 2 callersFunctionadd_page_number_to_toc
(part, structure, model=None)
pageindex/page_index.py:461
↓ 2 callersFunctioncheck_title_appearance
(item, page_list, start_index=1, model=None)
pageindex/page_index.py:13
↓ 2 callersFunctioncheck_title_appearance_in_start_concurrent
(structure, page_list, model=None, logger=None)
pageindex/page_index.py:74
↓ 2 callersFunctionconvert_page_to_int
(data)
pageindex/utils.py:541
↓ 2 callersFunctioncreate_clean_structure_for_description
Create a clean structure for document description generation, excluding unnecessary fields like 'text'.
pageindex/utils.py:599
↓ 2 callersFunctionfind_all_children
Find all direct and indirect children of a parent node
pageindex/page_index_md.py:91
↓ 2 callersFunctionfind_toc_pages
(start_page_index, page_list, opt, logger=None)
pageindex/page_index.py:341
↓ 2 callersFunctiongenerate_doc_description
(structure, model=None)
pageindex/utils.py:622
↓ 2 callersFunctiongenerate_node_summary
(node, model=None)
pageindex/utils.py:578
↓ 2 callersMethodget_document
Return document metadata JSON.
pageindex/client.py:220
↓ 2 callersMethodget_document_structure
Return document tree structure JSON (without text fields).
pageindex/client.py:224
↓ 2 callersFunctionget_json_content
(response)
pageindex/utils.py:85
↓ 2 callersFunctionpage_index_main
(doc, opt=None)
pageindex/page_index.py:1066
↓ 2 callersFunctionpage_list_to_group_text
(page_contents, token_lengths, max_tokens=20000, overlap_page=1)
pageindex/page_index.py:426
↓ 2 callersFunctionremove_fields
(data, fields=['text'])
pageindex/utils.py:466
↓ 2 callersFunctiontoc_extractor
(page_list, toc_page_list, model)
pageindex/page_index.py:222
↓ 2 callersFunctiontoc_transformer
(toc_content, model=None)
pageindex/page_index.py:273
↓ 2 callersFunctionwrite_node_id
(data, node_id=0)
pageindex/utils.py:132
↓ 1 callersFunction_count_pages
Return total page count for a PDF document.
pageindex/retrieve.py:27
↓ 1 callersMethod_filepath
(self)
pageindex/utils.py:318
↓ 1 callersFunction_get_md_page_content
For Markdown documents, 'pages' are line numbers. Find nodes whose line_num falls within [min(page_nums), max(page_nums)] and return their te
pageindex/retrieve.py:56
↓ 1 callersFunction_get_pdf_page_content
Extract text for specific PDF pages (1-indexed). Prefer cached pages, fallback to PDF.
pageindex/retrieve.py:36
↓ 1 callersMethod_load_workspace
(self)
pageindex/client.py:196
↓ 1 callersMethod_load_yaml
(path)
pageindex/utils.py:661
↓ 1 callersFunction_normalize_retrieve_model
Preserve supported Agents SDK prefixes and route other provider paths via LiteLLM.
pageindex/client.py:18
↓ 1 callersFunction_parse_pages
Parse a pages string like '5-7', '3,8', or '12' into a sorted list of ints.
pageindex/retrieve.py:12
↓ 1 callersMethod_save_doc
(self, doc_id: str)
pageindex/client.py:157
↓ 1 callersMethod_save_meta
(self, doc_id: str, entry: dict)
pageindex/client.py:189
↓ 1 callersFunction_traverse
(nodes)
pageindex/utils.py:690
↓ 1 callersFunction_traverse
(nodes)
pageindex/retrieve.py:65
↓ 1 callersMethod_validate_keys
(self, user_dict)
pageindex/utils.py:665
↓ 1 callersFunctionadd_page_offset_to_toc_json
(data, offset)
pageindex/page_index.py:416
↓ 1 callersFunctionadd_preface_if_needed
(data)
pageindex/utils.py:372
↓ 1 callersFunctionbuild_tree_from_nodes
(node_list)
pageindex/page_index_md.py:190
↓ 1 callersFunctioncalculate_page_offset
(pairs)
pageindex/page_index.py:394
↓ 1 callersFunctioncheck_title_appearance_in_start
(title, page_text, model=None, logger=None)
pageindex/page_index.py:48
↓ 1 callersFunctioncheck_toc
(page_list, opt=None)
pageindex/page_index.py:696
↓ 1 callersFunctionclean_node
(node)
pageindex/utils.py:361
↓ 1 callersFunctiondetect_page_index
(toc_content, model=None)
pageindex/page_index.py:202
↓ 1 callersFunctionextract_matching_page_pairs
(toc_page, toc_physical_index, start_page_index)
pageindex/page_index.py:379
↓ 1 callersFunctionextract_node_text_content
(node_list, markdown_lines)
pageindex/page_index_md.py:62
↓ 1 callersFunctionextract_nodes_from_markdown
(markdown_content)
pageindex/page_index_md.py:32
↓ 1 callersFunctionfind_node
(data, node_id)
pageindex/utils.py:193
↓ 1 callersFunctionfix_incorrect_toc
(toc_with_page_number, page_list, incorrect_results, start_index=1, model=None, logger=None)
pageindex/page_index.py:760
↓ 1 callersFunctionfix_incorrect_toc_with_retries
(toc_with_page_number, page_list, incorrect_results, start_index=1, max_attempts=3, model=None, logger=None)
pageindex/page_index.py:878
↓ 1 callersFunctiongenerate_summaries_for_structure
(structure, model=None)
pageindex/utils.py:589
↓ 1 callersFunctiongenerate_summaries_for_structure_md
(structure, summary_token_threshold, model=None)
pageindex/page_index_md.py:19
↓ 1 callersFunctiongenerate_toc_continue
(toc_content, part, model=None)
pageindex/page_index.py:507
↓ 1 callersFunctiongenerate_toc_init
(part, model=None)
pageindex/page_index.py:542
↓ 1 callersFunctionget_document
Return JSON with document metadata: doc_id, doc_name, doc_description, type, status, page_count (PDF) or line_count (Markdown).
pageindex/retrieve.py:81
↓ 1 callersFunctionget_document_structure
Return tree structure JSON with text fields removed (saves tokens).
pageindex/retrieve.py:100
↓ 1 callersFunctionget_node_summary
(node, summary_token_threshold=200, model=None)
pageindex/page_index_md.py:10
↓ 1 callersFunctionget_number_of_pages
(pdf_path)
pageindex/utils.py:426
↓ 1 callersFunctionget_page_content
Retrieve page content for a document. pages format: '5-7', '3,8', or '12' For PDF: pages are physical page numbers (1-indexed). For
pageindex/retrieve.py:110
↓ 1 callersMethodget_page_content
Return page content for the given pages string (e.g. '5-7', '3,8', '12').
pageindex/client.py:230
↓ 1 callersFunctionget_page_tokens
(pdf_path, model=None, pdf_parser="PyPDF2")
pageindex/utils.py:387
↓ 1 callersFunctionget_parent_structure
Helper function to get the parent structure code
pageindex/utils.py:325
↓ 1 callersFunctionget_text_of_pdf_pages
(pdf_pages, start_page, end_page)
pageindex/utils.py:414
↓ 1 callersFunctionget_text_of_pdf_pages_with_labels
(pdf_pages, start_page, end_page)
pageindex/utils.py:420
↓ 1 callersMethodindex
Index a document. Returns a document_id.
pageindex/client.py:55
↓ 1 callersFunctionlist_to_tree
(data)
pageindex/utils.py:324
↓ 1 callersFunctionpage_index
(doc, model=None, toc_check_page_num=None, max_page_num_each_node=None, max_token_num_each_node=None,
pageindex/page_index.py:1113
↓ 1 callersFunctionpage_index_builder
()
pageindex/page_index.py:1082
↓ 1 callersFunctionprint_json
(data, max_len=40, indent=2)
pageindex/utils.py:480
↓ 1 callersFunctionprint_toc
(tree, indent=0)
pageindex/utils.py:474
↓ 1 callersFunctionprocess_and_check_item
(incorrect_item)
pageindex/page_index.py:768
↓ 1 callersFunctionprocess_large_node_recursively
(node, page_list, opt=None, logger=None)
pageindex/page_index.py:1000
↓ 1 callersFunctionprocess_no_toc
(page_list, start_index=1, model=None, logger=None)
pageindex/page_index.py:576
↓ 1 callersFunctionprocess_none_page_numbers
(toc_items, page_list, start_index=1, model=None)
pageindex/page_index.py:656
↓ 1 callersFunctionprocess_toc_no_page_numbers
(toc_content, toc_page_list, page_list, start_index=1, model=None, logger=None)
pageindex/page_index.py:597
↓ 1 callersFunctionprocess_toc_with_page_numbers
(toc_content, toc_page_list, page_list, toc_check_page_num=None, model=None, logger=None)
pageindex/page_index.py:622
↓ 1 callersFunctionquery_agent
Run a document QA agent using the OpenAI Agents SDK. Streams text output token-by-token and returns the full answer string. Tool calls are al
examples/agentic_vectorless_rag_demo.py:55
↓ 1 callersFunctionremove_page_number
(data)
pageindex/page_index.py:368
↓ 1 callersFunctionremove_structure_text
(data)
pageindex/utils.py:495
↓ 1 callersFunctionreorder_dict
(data, key_order)
pageindex/utils.py:634
↓ 1 callersFunctionsanitize_filename
(filename, replacement='-')
pageindex/utils.py:266
↓ 1 callersFunctionsimplify_data
(obj)
pageindex/utils.py:481
next →1–100 of 136, ranked by callers