ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

lift-oQ6快速上手:10分钟在Mac上跑通发票转JSON提取

lift-oQ6快速上手:10分钟在Mac上跑通发票转JSON提取 lift-oQ6快速上手10分钟在Mac上跑通发票转JSON提取【免费下载链接】lift-oQ6项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ6发票、收据、采购单……每天成堆的票据要人工录入费时又易错。如果你也想实现发票转JSON的自动化那么lift-oQ6是一个非常值得尝试的开源视觉语言模型。它由 datalab-to/lift 模型转换而来经过 oQ6 量化后体积仅 7.7GB在 MacApple Silicon 芯片上即可完全本地运行上传一张发票图片就能直接输出规范的 JSON 结构化数据全程离线、不上传任何敏感票据。本文手把手带你 10 分钟跑通发票信息提取全流程新手也能轻松上手。什么是 lift-oQ6为发票信息提取而生的视觉语言模型lift-oQ6 是一个约 90 亿参数的多模态视觉语言模型VLM核心能力是把 PDF 或图片直接看懂并输出符合 JSON Schema 的结构化数据。它特别适合这几类场景发票识别与提取把发票图片里的号码、金额、明细行转成 JSON 字段票据单据结构化收据、报关单、合同、医疗单据等版式文档表格与表单理解复杂版式的表格、多栏文档的字段定位项目底层基于 qwen3_5 架构视觉编码器负责理解图像版面语言模型负责生成结构化文本。简单说给它一张图它给你一份 JSON。为什么推荐在 Mac 上本地跑发票转JSON相比云端 OCR 接口本地部署 lift-oQ6 有三个明显优势优势说明 数据安全发票含企业信息本地推理不上传服务器隐私无忧 零调用成本一次下载反复使用没有按次计费⚡ 速度快经量化后生成速度约 73 tokens/秒单张发票秒级出结果lift-oQ6 是 oQ6 量化版本采用数据驱动的分层混合精度量化约 6bit/权重模型文件约 7.7GB运行峰值内存约 9.4GB对 Mac 的内存要求相当友好。准备工作Mac 上运行发票识别需要什么在开始之前请确认你的环境满足以下条件一台 Apple Silicon 芯片的 MacM1、M2、M3、M4 或更新机型均可至少 16GB 统一内存模型 系统运行更从容8GB 也能跑但会偏紧约 10GB 可用磁盘空间存放模型文件安装 uv 工具Python 包管理工具用于快速拉起运行环境一张发票图片支持 PNG、JPG 等常见格式建议清晰、角度端正 没有安装 uv 的话在终端执行curl -LsSf https://astral.sh/uv/install.sh | sh即可一键安装。第一步获取 lift-oQ6 模型文件先通过 git clone 把模型仓库拉取到本地git clone https://gitcode.com/hf_mirrors/mlx-community/lift-oQ6仓库中包含模型权重model-00001-of-00002.safetensors、model-00002-of-00002.safetensors、config.json 配置文件、tokenizer.json 分词器以及完整的权重索引 model.safetensors.index.json拉取后即可直接使用。第二步最快配置方法——一条命令完成发票转JSON提取模型就绪后用 mlx-vlm 的生成工具一条命令就能完成发票图片到 JSON 的转换uvx --from mlx-vlm mlx_vlm.generate \ --model /path/to/lift-oQ6 \ --image invoice.png \ --prompt Extract the invoice as JSON. \ --max-tokens 800把/path/to/lift-oQ6换成你刚才 clone 的本地路径invoice.png换成你的发票图片。命令执行后模型会自动识别图片内容并输出类似这样的 JSON 结果{ invoice_number: INV-2026-0818, date: 2026-08-18, total: 1280.00, vendor: 示例科技有限公司 }第一次运行会先加载模型约几十秒之后每次提取只需数秒非常丝滑。✨第三步进阶用 JSON Schema 约束发票提取结果上面是自由发挥的输出。如果希望发票提取结果字段完全可控可以启动 mlx-vlm 自带的 OpenAI 兼容服务端配合 JSON Schema 做结构化约束——解码时由 llguidance 引擎强制保证输出格式合法不会出现字段缺失或类型错误。先启动服务uvx --from mlx-vlm mlx_vlm.server --model /path/to/lift-oQ6 --port 8080再用 Python 调用接口定义好你想要的发票字段结构import base64, json from openai import OpenAI client OpenAI(base_urlhttp://127.0.0.1:8080/v1, api_keylocal) img base64.b64encode(open(invoice.png, rb).read()).decode() schema { type: object, properties: { invoice_number: {type: string}, total: {type: number}, line_items: {type: array, items: {type: object, properties: { description: {type: string}, amount: {type: number}}}}, }, required: [invoice_number, total], } resp client.chat.completions.create( modelmlx-community/lift-oQ6, messages[{role: user, content: [ {type: text, text: Extract this invoice.}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ]}], response_format{type: json_schema, json_schema: {name: invoice, schema: schema}}, temperature0.0, max_tokens800, ) print(json.loads(resp.choices[0].message.content))这样返回的 JSON 一定包含invoice_number和total字段明细行也会按line_items数组输出非常适合直接对接财务系统或数据库。实用技巧与注意事项1. 终止符修复已内置⚠️本仓库的 generation_config.json 已设置eos_token_id: [248044, 248046]。上游版本只设置了 248044但对话结束符|im_end|对应 248046不修复会导致服务端无限输出|im_end|。如果你从其他来源重新转换模型记得手动补上这一项。2. 温度参数建议设为 0发票金额、号码这类字段必须准确建议temperature0.0避免随机性带来的提取误差。3. 按需选择量化档位同一系列还有 oQ8、oQ5、oQ4、oQ3 等变体精度和速度各有取舍变体约 bpw模型大小生成速度lift-oQ8≈8.69.7 GB58 t/slift-oQ6本文≈67.7 GB73 t/slift-oQ4≈4.65.6 GB100 t/s追求更高精度选 oQ8追求极限速度选 oQ4oQ6 是两者间的平衡点日常发票提取完全够用。4. 关于提取质量原版 FP16 模型在 Datalab 225 份文档的基准上达到 90.2% 的字段级准确率。量化版本在简单发票测试上均表现正常但对更复杂、对抗性更强的文档低比特位版本可能略有下降建议先用真实发票测试。常见问题排查 Q运行时提示内存不足怎么办关闭其他大型应用释放内存或换用更小体积的 oQ4/oQ3 变体。Q发票图片太模糊提取结果不准尽量使用清晰、平整、无反光的扫描件截图类电子发票通常识别效果最好。Q输出结果一直不结束检查模型路径下的 generation_config.json 是否正确配置了 eos_token_id 数组这是本仓库已修复好的关键点。Q可以批量处理多张发票吗可以写一个循环逐张调用 generate 命令或服务端接口即可配合--max-tokens 800控制单张输出长度。现在你已经掌握了在 Mac 上运行 lift-oQ6 进行发票转JSON提取的完整方法从克隆模型仓库、一行命令快速出结果到用 JSON Schema 锁定输出格式整个过程 10 分钟即可跑通。接下来不妨拿你手头真实的发票试一试感受一下本地 AI 提取票据信息的效率吧【免费下载链接】lift-oQ6项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/lift-oQ6创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表