3分钟上手NVIDIA-Nemotron-Parse-v1.1-TC:完整安装与图像解析教程
【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC
NVIDIA-Nemotron-Parse-v1.1-TC是一款强大的图像文本解析工具,能够快速识别文档中的文本、表格和数学公式等元素,并提取结构化信息。本教程将帮助你在3分钟内完成安装并掌握基本使用方法,让文档处理效率提升20%!
🌟 为什么选择NVIDIA-Nemotron-Parse-v1.1-TC?
这款工具基于Transformer架构的视觉编码器-解码器模型,相比传统OCR技术,它具有以下优势:
- 支持复杂文档布局解析,包括标题、段落、表格、图片等语义分类
- 能提取LaTeX格式的数学公式和多行列复杂表格
- 通过4倍视觉 token 压缩技术,比上一代版本提速20%
- 保留表格、标题、图片、脚注等元素的页面顺序
🚀 快速安装步骤
1️⃣ 克隆项目仓库
git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC2️⃣ 安装依赖
项目依赖已整理在requirements.txt中,包含PyTorch、Transformers等核心库:
pip install -r requirements.txt📸 图像解析实战教程
基础使用示例
以下是使用example.py进行图像解析的核心代码:
# 加载模型和处理器 model_path = "nvidia/NVIDIA-Nemotron-Parse-v1.1-TC" device = "cuda:0" model = AutoModel.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch.bfloat16 ).to(device).eval() tokenizer = AutoTokenizer.from_pretrained(model_path) processor = AutoProcessor.from_pretrained(model_path, trust_remote_code=True) # 加载图像并设置任务提示 image = Image.open("path/to/your/image.jpg") task_prompt = "</s><s><predict_bbox><predict_classes><output_markdown>" # 处理图像并生成结果 inputs = processor(images=[image], text=task_prompt, return_tensors="pt").to(device) outputs = model.generate(**inputs, generation_config=generation_config) generated_text = processor.batch_decode(outputs, skip_special_tokens=True)[0]输出后处理
解析结果可以通过postprocessing.py进行格式化:
# 提取类别、边界框和文本 classes, bboxes, texts = extract_classes_bboxes(generated_text) bboxes = [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 指定输出格式 table_format = 'latex' # 可选: latex | HTML | markdown text_format = 'markdown' # 可选: markdown | plain texts = [postprocess_text(text, cls=cls, table_format=table_format, text_format=text_format) for text, cls in zip(texts, classes)]💡 高级功能:VLLM加速推理
对于大规模解析任务,推荐使用VLLM进行加速:
# 安装VLLM依赖 uv venv --python 3.12 --seed source .venv/bin/activate uv pip install "git+https://github.com/amalad/vllm.git@nemotron_parse" uv pip install timm albumentations📊 模型能力展示
NVIDIA-Nemotron-Parse-v1.1-TC在布局理解、表格提取和公式识别方面表现出色:
布局理解
能够精准识别文档中的各类元素及其空间位置:
表格提取
支持复杂表格结构,包括合并单元格等格式:
公式识别
能将数学公式转换为LaTeX格式,保留完整数学符号和结构:
⚠️ 注意事项
- 推荐使用NVIDIA GPU(Hopper/Ampere/Turing架构)以获得最佳性能
- 输入图像分辨率建议在1024×1280至1664×2048之间
- 默认提示词
</s><s><predict_bbox><predict_classes><output_markdown>适用于大多数场景 - 如需仅输出边界框和类别,可使用提示词
</s><s><predict_bbox><predict_classes><output_no_text>
通过本教程,你已经掌握了NVIDIA-Nemotron-Parse-v1.1-TC的基本安装和使用方法。这款工具将帮助你轻松处理各类文档,从学术论文到业务报表,让文本提取和结构化变得前所未有的简单!
【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考