コンテンツにスキップ

LlamaParse - RAG用ドキュメント 解析 チートシート

LlamaParse - RAG用ドキュメント 解析 チートシート

LlamaParseはドキュメント 解析サービス LlamaIndexチームから、具体的にLLMおよびRAGパイプライン向けに構築。フォーカスは困難なケース:複雑な表、マルチ列レイアウト、数字、埋め込みチャート持つPDF。汎用テキスト エクストラクター 平坦化の使用不可能なテキスト。クリーンマークダウン出力構造を保持し、顕著な機能は自然言語 解析指示—レイアウト および何をするか記述し、抽出ルール設定ではなく。

LlamaParse はホスト型サービス フリー ティア付き(APIキー 必須)。完全ローカル 解析用DoclingまたはMarkerを参照。

インストール

MethodCommand
pippip install llama-parse
With LlamaIndexpip install llama-index llama-parse
API keyexport LLAMA_CLOUD_API_KEY="llx-..."
Verifypython -c "from llama_parse import LlamaParse; print('ok')"

基本的な解析

from llama_parse import LlamaParse

parser = LlamaParse(result_type="markdown")
documents = parser.load_data("./report.pdf")
print(documents[0].text)
ParameterPurpose
result_type"markdown"(構造保持)または"text"
num_workers平行ページ 処理
verbose進歩 出力
languageドキュメント言語 ヒント
parsing_instruction自然言語 ガイダンス(以下)

解析指示(差別化因子)

parser = LlamaParse(
    result_type="markdown",
    parsing_instruction="""
    これはファイナンシャル レポートです。すべてのテーブルをマークダウン テーブルとして保持します。
    各グラフ場合、傾向を説明する1段落を記述します。
    ページ ヘッダーおよびフッターを無視します。
    """,
)

プレーン言語データ および目的のハンドリングで説明してコード記述抽出ではなく—ドメイン固有レイアウト用有用(請求書、科学論文、法律契約)汎用パーサー 悪い場所。

非同期 & バッチ

import asyncio

async def parse_many(paths):
    parser = LlamaParse(result_type="markdown", num_workers=8)
    return await parser.aload_data(paths)

docs = asyncio.run(parse_many(["a.pdf", "b.pdf", "c.pdf"]))
MethodUse
load_data(path)単一 ファイル、同期
aload_data([paths])非同期、複数ファイル
get_json_result(path)ページ メタデータ持つ構造化JSON
get_images(...)埋め込み画像抽出

サポートされた入力

FormatNote
PDFプライマリー ターゲット、スキャン(OCR)含む
DOCX / PPTX / XLSXOffice形式
HTMLWeb ドキュメント
ImagesPNG/JPEGビアOCR

RAGパイプラインにワイアリング

from llama_parse import LlamaParse
from llama_index.core import VectorStoreIndex
from llama_index.core.node_parser import MarkdownElementNodeParser

docs = LlamaParse(result_type="markdown").load_data("./manual.pdf")

# マークダウン対応チャンキング テーブルおよびセクション かじります
node_parser = MarkdownElementNodeParser()
nodes = node_parser.get_nodes_from_documents(docs)

index = VectorStoreIndex(nodes)

マークダウン出力とマークダウン対応ノード パーサーをペアリング 点:テーブルは解析およびチャンキング生き残る、これはほとんどのRAGパイプライン 表形式の事実が失われるところ。

テーブル処理

TechniqueWhy
result_type="markdown"テーブル マークダウン グリッド
Parsing instruction for tables強制一貫 テーブル ハンドリング
MarkdownElementNodeParserテーブル 1つのチャンク保つ
Row-per-sentence serialization個々 ラインが検索可能

コスト & 実際的なメモ

ConsiderationDetail
Hosted serviceドキュメント LlamaCloud に送信
Free tier制限 ページ毎日
Caching同じファイル再解析 結果を再利用できます
Privacy機密ドキュメント ローカル パーサー 好む

LlamaParse対ローカルパーサー

AspectLlamaParseDoclingMarker
HostingCloud serviceLocalLocal
Complex tables非常に強い強い良い
Custom instructions自然言語設定設定
Privacyデータはマシン 離れる完全ローカル完全ローカル
Best for困難 レイアウト、高速結果Self-ホスト RAG 摂取GPU バルク 変換

プライバシー敏感コーパス用Doclingを使用;バルク ローカル 変換Markerを使用。

リソース