分类导航

发现更多优质 AI 工具

全部 编程代码 创作写作 视频音频 图像视觉 学习辅导 办公效率 设计创意 大模型 提示词 Skills 自动化 知识库 开源 副业
RapidOCR图标

RapidOCR

RapidOCR 使用指南一、平台介绍RapidOCR 是由 RapidAI 团队开发的开源离线 OCR 工具套件。其基于 PaddleOCR 进行了 ONNX 轻量化优化,旨在提供更快、更轻的识别方案。1. 核心特性纯本地运行:完全脱离云端依赖,无网络环境下即可工作。跨端轻量化:资源占用低,适合嵌入式及边缘设备。性能优越:推理速度远超原版 PaddleOCR。2. 开源协议与版权工程代码:采用 Apache 2.0 协议,完全开源免费。模型版权:识别模型的版权归属百度,商用需遵守相应协议(合规性已确保)。3. 配套地址导航📘 官方文档:https://rapidai.github.io/RapidOCRDocs/latest/💻 GitHub 源码:https://github.com/RapidAI/RapidOCR🔗 在线 Demo:https://huggingface.co/spaces/RapidAI/RapidOCRv2二、主要功能模块1. 文字识别能力默认支持:中英混合文本,包含数字与标点符号。特殊布局:支持竖排文本及多语言模型转换(如日韩文、繁体中文等)。输出结果:提供文字内容 txts、坐标框 boxes 及置信度分数 scores,并可生成带标注的可视化图片。2. 多推理后端支持用户可根据硬件环境按需选用不同的推理引擎:🏃‍♂️ rapidocr_onnxruntime(默认):轻量快速,通用性好。🧠 rapidocr_openvino:专为 Intel CPU 设备加速优化。🔗 rapidocr_paddle:原生 Paddle 推理接口,适合特定场景。3. SDK 与集成支持语言覆盖:提供 Python、C++、Java、C# 全平台开发包。应用场景:可轻松嵌入桌面软件、服务端系统或边缘计算设备中。4. 配套工具服务rapidocr_api:一键启动 HTTP 识别服务,对外暴露标准 API 接口。命令行工具:支持单张图片或批量图片的离线识别与结果导出。Docker 镜像:提供一键部署服务端环境的能力。5. 自定义微调能力支持开发者使用自有数据集进行模型微调。允许替换检测、识别及分类阶段的子模型,满足个性化需求。三、适用人群与场景建议✅ 推荐使用场景开发者群体:需要本地 OCR 集成、构建私有化系统或开发内网项目的技术人员。数据处理任务:批量处理票据、截图、扫描文档以提取文字,且对隐私敏感(严禁数据上传云端)的场景。桌面工具作者:正在制作自制截图 OCR、PDF 转 Word/文本提取器等独立软件的开发人员。中小企业 IT:部署于内网的文档管理系统、证件识别系统或表单数字化项目,希望避免云 API 调用费用及流量限制的用户。❌ 不适合场景零代码用户:没有编程基础且无命令行操作意愿的普通大众(软件本身不提供独立可视化 GUI)。特殊文本需求:超高精度古籍识别、复杂手写体文字等(该工具主要针对印刷体优化,专业手写 OCR 效果较弱)。四、免费与付费说明🚫 无隐形消费全程免费模式:不存在订阅制、按量计费或定价页面。永久开放权限:所有工程代码、推理包及基础中英模型均永久免费,个人与商业用途均可直接使用(需遵守开源协议)。💸 唯一的付费项开发者赞助:唯一涉及费用的项目是自愿向开发团队进行的 GitHub Sponsor 赞助。此行为非强制性质,也不用于解锁任何软件功能。无云端 API 收费:因工具纯本地运行,不存在云服务的调用次数、流量上限等计费体系。五、如何使用1. Python 环境安装在终端或命令行中执行以下指令进行基础依赖库的安装:bashpip install rapidocr onnxruntime 2. Python 代码调用示例支持读取本地图片路径,也支持直接传入网络图片 URL。pythonfrom rapidocr import RapidOCR # 初始化识别器(默认加载 ONNX Runtime) ocr = RapidOCR() # 执行识别:输入为图片文件名或 URL result = ocr("test.jpg") # 输出结果结构解析 print(result.txts) # 打印文字内容列表 print(result.boxes) # 打印坐标框列表 print(result.scores) # 打印置信度分数 # 生成带边框的标注图片保存至本地 result.vis("output.jpg") 3. 命令行快速识别工具无需编写代码,直接使用 CLI 进行批量处理:bashrapidocr -img test.jpg --vis_res -v--verbose: 可开启详细日志输出。-w--workers: 设置工作线程数(多线程加速)。4. 启动 HTTP 识别服务适合需要后端 API 对接 Web 或小程序的场景:bashrapidocr_api -p 9000 -workers 2 # POST http://127.0.0.1:9000/ocr -> 上传图片即可调用 5. 跨语言集成指引对于 C++、Java 或 C# 开发者,请查阅官方文档对应语言的 SDK 章节。通常流程为:下载对应的 ONNX 模型文件后,加载至相应语言的推理接口中复用代码逻辑。六、注意事项🔒 1. 网络与隐私安全字体依赖:首次运行可视化功能(vis())时会自动联网下载默认字体包。若处于断网环境,请注释 result.vis 方法或提前准备本地中文字体文件以规避报错。数据安全:所有图片均在本地内存处理完毕即销毁,无数据外传行为,非常适合涉密内网及隐私敏感场景使用。🛠️ 2. 环境兼容性配置Windows 依赖:必须在 Windows 系统安装 VC++ 2015+ 运行库(如 Visual Studio Build Tools),否则 onnxruntime 组件会因缺少 C/C++ 运行时而报错。Python 版本建议:推荐使用 Python 3.8 ~ 3.11 版本,过高或过低的版本可能导致第三方依赖包冲突或兼容性问题。⚡ 3. 性能优化技巧Intel CPU 加速:若使用 Intel 平台处理图片较多,优先选择 openvino 后端推理包,实测速度可提升 30%+。批量识别策略:避免在单进程中阻塞等待,建议启动多个实例或配置多进程(如开启 HTTP API 服务)来并发处理任务队列。📚 4. 模型能力边界认知文本类型限制:手写文字、艺术字等效果较差;最佳适配场景为印刷体文档、手机截屏、标准票据。多语言扩展:默认仅提供中英双语,若需识别其他语种(如日文),需要自行下载并配置对应的 ONNX 模型文件至环境目录中。⚖️ 5. 商用合规提示代码协议:工程源代码采用 Apache 2.0,使用自由无限制。模型版权注意:核心的 PP-OCR 模型版权归属百度。若用于商业用途(如对外售卖 SaaS、企业级集成),请务必阅读并遵守百度的开源模型协议及商业授权条款。🐳 6. Docker 部署细节模型挂载:Docker 启动时需手动将本地预训练模型目录挂载进容器,否则镜像首次运行会尝试自动下载大体积文件,耗时较长且占用带宽。嵌入式设备:硬件资源紧张(如树莓派)时,建议选用轻量级 small 尺寸模型,以减少内存与显存占用。🖥️ 7. GUI 界面缺失提醒原生提供的是 API/命令行接口,无预装的桌面版可视化软件。若需要图形化操作体验(如拖拽图片识别),开发者需自行封装界面或基于现有 Python SDK 开发前端程序。

Datalab图标

Datalab

🚀 Datalab.to 使用指南一、平台定位与简介官网地址:https://www.datalab.to核心身份:开源文档 AI 托管 API 平台技术底层:基于 Marker / Surya / Chandra 等开源 OCR 文档模型主攻方向:PDF/扫描件高精度解析、版面识别、表格提取二、核心功能详解多格式深度解析支持 PDF、图片扫描件转制为 Markdown、HTML、JSON。自动智能识别页眉、段落、图片位置及嵌套表格结构。多种模式精度档位Fast:速度快,价格低(适合预览)。Balanced:均衡模式(日常通用)。Accurate:高精度(擅长复杂表格解析与追踪修订内容)。多语言识别能力覆盖 91 种语种。针对手写体、模糊扫描件有专门优化算法。结构化数据抽取将非结构化表格转为结构化 JSON。计费单位:500 个单元格计为 1 页。可视化调试工具提供在线 Playground,地址:https://www.datalab.to/playground支持直接上传文件预览结果。开发与异步任务配套 Python SDK 简化开发流程。支持异步 API 任务提交,自动轮询接口状态获取最终结果。私有化部署方案Docker 镜像一键拉取。数据不出内网,支持离线运行与模型微调。三、适用人群分析✅ 适合谁?开发者 / 数据工程师:搭建合同、发票、试卷、财报自动解析流水线。行业特定团队:法律(文档检索)、金融(研报处理)、财税(票据提取)。知识库从业者:批量将 PDF 转结构化文档入库,构建企业知识站。合规敏感型企业:政务、医疗等对数据隐私有严格要求的私有化合规需求方。❌ 不适合谁?纯普通无代码用户:平台重度依赖 API 调用,缺乏可视化管理后台。超大文件实时处理场景:单文件或并发量极大时可能需要额外拆分与等待机制。四、免费 & 付费定价策略💰 1. 新手福利(免费注册)赠送额度:$5 美元免费余额。时效性:无过期时间限制,用完即止。使用范围:仅限云端 API 调用测试;本地开源模型若用于个人/科研需自行付费授权商用。☁️ 2. 云端托管(Pay-as-you-go)查看详情:https://www.datalab.to/pricingFast / Balanced 模式:$4 / 1000页。Accurate 解析/表格追踪:$6 / 1000页。Accurate 高精度抽取:$25 / 1000页。福利:注册月度固定赠送 $25,超额按量扣费。支持标准邮件通知账单。🏠 3. 私有化部署(Self-Hosted)查看详情:https://www.datalab.to/onprem订阅费用:$5000 /月。服务包含:离线内网运行、专属技术对接支持、自定义模型微调。五、使用步骤指南🛠️ 方式一:在线调试(新手推荐)访问 Playground 官网面板。上传 PDF 或图片文件至系统。选择解析模式,点击生成 Markdown/JSON 预览。🛠️ 方式二:API 开发调用(生产环境)注册账号并进入控制台获取 API Key。请求地址:https://www.datalab.to/api/v1/convert操作步骤:上传文件 -> 提交异步任务 -> 轮询结果接口 (request_check_url)。python# 【极简调用示例】Python SDK 风格伪代码 import requests, time API_KEY = "你的实际 API KEY" url = "https://www.datalab.to/api/v1/convert" headers = {"X-API-Key": API_KEY} files = {"file": open("test.pdf", "rb")} data = { "output_format": "markdown", "mode": "balanced" } # 提交请求获取任务 ID / check_url res = requests.post(url, headers=headers, files=files, data=data).json() # 轮询等待结果处理(实际生产中建议使用重试机制) while True: poll = requests.get(res["request_check_url"], headers=headers).json() if poll["status"] == "complete": print(poll["markdown"]) break time.sleep(2) 🛠️ 方式三:本地部署(内网环境)拉取官方 Docker 镜像。在离线网络环境中运行开源 Marker / Surya 模型,无需访问公网 API。六、注意事项与避坑指南 ⚠️🌐 网络限制:服务器位于海外(美国/欧洲),国内直连上传或轮询可能超时慢速;无国内节点。📂 文件规格:单文件大小上限 200MB,单次处理页数上限 7000页。超限请拆分上传。⏳ 数据时效:云端任务完成后,源文件与中间结果保留期最短为 1小时自动删除,务必及时拉取 JSON/Markdown 文本。🚦 限流机制:免费及基础账号有 RPM(请求频率)限制。批量处理易触发 429 状态码,需在代码中加入休眠重试逻辑。💵 计费明细:云端 API 响应体自带 cost_breakdown 字段,包含详细费用拆解;表格复杂程度直接影响成本(单元格数折算)。🚫 免费额度规则:注册时信用卡仅用于身份核验,不扣费。一旦余额耗尽将返回 403 Forbidden。订阅付费后原免费额度清零。⏳ 商用授权红线:若企业年收入或融资额超过 500万美金(具体标准视条款为准),本地开源模型不可直接免费商用,必须购买私有化商业许可。🔍 精度取舍建议:遇到扫描模糊、多层嵌套表格,务必切换至 Accurate 模式;Fast 模式极易丢失复杂结构。🔐 密钥安全警告:严禁将 X-API-Key 硬编码在前端页面或公开的 Git 仓库中,防止余额被盗刷。💳 支付渠道限制:仅支持境外信用卡充值/扣费。不支持微信、支付宝直接充额续费(需购买企业年付或通过其他合规国际卡通道)。

MinerU图标

MinerU

MinerU 使用指南一、平台介绍上海 AI 实验室开源的文档结构化解析引擎。其核心优势在于强大的内容还原能力,专为 RAG 知识库、学术论文、财报合同等复杂场景设计。核心技术:采用 VLM(视觉语言模型)+ OCR 双引擎架构。主要目标:精准还原复杂排版、表格及数学公式。部署形态:提供在线网页工具、桌面客户端、云端 API、本地开源部署四种使用方式。二、核心功能特性1. 内容识别能力版面智能还原:自动过滤页眉页脚,双栏论文按阅读顺序重组输出;精准区分标题/正文/列表/图片区域。复杂表格解析:支持跨页、合并单元格及无框表格的识别与重绘。可转换为 Markdown / HTML / CSV 格式。公式深度识别:自动将行内及多行数学公式还原为标准 LaTeX 语法。高难度 OCR 扫描件:针对有阴影、畸变或手写印刷混合文档进行优化,支持全球 109 种语言。2. 输入与输出规范广泛文件格式:完美兼容 PDF / DOCX / PPTX / PNG/JPG 图片等格式。⚠️ 限制提示:单文件上限通常为 200MB 或 200 页(云端版)。结构化输出选项:支持导出 Markdown、layout.json、content_list.json 及带坐标的结构化数据,便于程序直接读取。3. 生态与 API 集成原生对接工具:无缝衔接 LangChain / Dify / FastGPT / MCP 等主流 AI 框架。多语言 SDK:提供 Python、Go、TS (TypeScript) 开发包,方便开发者快速接入。双 API 模式:🟢 Agent 轻量版:免 Token,适合测试与小型文件(≤10MB/20页),响应速度快。🔵 精准解析版:需申请 Token,支持大文件、批量处理及高精度模式需求。三、适用人群分析✅ 推荐使用场景科研学生:批量提取论文数据、整理文献笔记、公式转 LaTeX 辅助写作。RAG 开发者:作为知识库预处理工具,负责文档向量化前的清洗与解析环节。职场办公族:快速结构化财报分析、合同审查、技术手册拆解及招标文件处理。数据分析师:将 PDF 中的复杂表格批量导出为可用数据进行二次加工。❌ 不推荐/非核心场景企业级超高并发:若需要 7×24 小时持续高流量跑通,免费额度可能受限(需商务定制)。简单格式转换:如果仅需简单的 PDF 转 Word,使用轻量级工具即可满足。四、资源获取与定价说明🆓 免费资源(永久可用)在线网页提取器 (Online):每日提供免费额度,支持单文件上传至 200MB/200 页。注册仅需邮箱,无需信用卡验证。桌面客户端 (Win/Mac/Linux):完全免费无额度限制,数据本地运行不消耗云端配额。强烈推荐用于处理大文件或隐私敏感文档。开源源码 (GitHub):提供 Docker/代码仓库支持私有化部署。零云服务费,算力自备(需显卡加速)。云端 API 试用 Token:注册后可获得每日 1000 页免费额度,次日自动重置。💰 付费与定制说明订阅套餐:目前无公开月付/年付订阅。触发收费场景:当免费额度耗尽、企业级高并发需求或需要私有化部署定制开发时。计费方式:按量付费或联系客服进行商务询价。🔗 官方地址(实时更新)Token 申请 & 额度管理:https://mineru.net/apiManage/tokenAPI 文档 & 计费说明:https://mineru.net/apiManage/docs五、三种主流使用方式(图文步骤)🌐 方式一:在线网页版适用:临时少量文件处理,无需安装任何软件。访问官网页面 https://mineru.net/OpenSourceTools/Extractor。通过邮箱完成登录注册。拖拽上传文件;若扫描 PDF 请勾选「OCR」选项;若是学术论文建议开启「公式识别」。等待解析完成后,左侧预览原文右侧查看 Markdown,支持下载对应格式或 JSON 数据。💻 方式二:本地客户端版(强烈推荐)适用:重度个人用户、处理大文件/敏感文档、无需消耗云端额度。访问官网首页点击“桌面端”图标,分别下载 Win/Mac/Linux版本安装包。安装完成后直接拖拽任意文件夹内的文档进入软件窗口。批量解析完全本地运行,图片原文件不生成网络链接(不会上传至服务器)。导出时可选择保留完整离线素材包,方便备份或二次编辑。🐍 方式三:API 开发者接入版适用:系统集成、自动化脚本编写、后端服务对接。访问 管理后台 注册并获取您的专属 API Token。在代码中发起异步请求提交任务,通过轮询 task_id 查询处理状态与结果。Python 极简调用示例:json{ "file_name": "paper.pdf", "language": "ch", // 设置语言 (zh/en等) "enable_table": true, "is_ocr": true, // 扫描件必须开启此选项 "enable_formula": true // 论文建议开启公式识别 } 六、避坑指南与注意事项为避免使用过程中的常见问题,请仔细阅读以下核心提示:⚠️ 图片链接失效问题:在线网页版导出的 Markdown 中,若包含图片通常为临时云链接。建议批量下载图片或在导出时保存本地副本;大量文件处理建议使用客户端模式。💡 OCR 选项必选:对于扫描件(纯图像 PDF),解析界面必须勾选「OCR」功能,否则系统会将其识别为空白文本框而非内容。📉 额度管理策略:云端 API 每日免费额上限固定(1000 页左右)。若需高频批量处理,请在次日重置前及时刷新 Token;长期高并发任务请直接部署本地客户端。💻 硬件门槛提示:开源版本支持 Docker/源码运行。若无 NVIDIA 显卡 GPU,纯 CPU 模式的解析速度会非常慢,建议配置显存或购买服务器云部署加速服务。🔒 数据合规安全:涉及涉密合同、内部财务资料等敏感信息,严禁上传至云端网页版。务必使用本地客户端(Local Version)或在企业内网进行私有化部署。⏳ 异步处理机制:调用 API 提交大文件任务后是异步的,接口不会立即返回结果文本。程序需编写轮询逻辑查询 task_id 状态直至完成。🌐 网络稳定性:在国内大陆地区直接访问在线网页版偶尔会遇到上传超时或解析中断的情况。涉及关键工作流时建议走本地客户端方案,避免依赖外网服务。💡 Token 安全警告:请务必保管好 API Token,禁止将其硬编码在前端页面代码中或推送到公开的 GitHub/GitLab 仓库中。Token 泄露可能导致免费额度被恶意消耗。

Tesseract OCR图标

Tesseract OCR

Tesseract-OCR 使用指南一、平台介绍与背景1. 官方资源与定位核心文档站:tessdoc (https://tesseract-ocr.github.io/),提供详尽的在线参考。开源仓库:GitHub 上的 tesseract 项目地址为 https://github.com/tesseract-ocr/tesseract。产品属性:本地离线运行的开源 OCR 引擎。由 HP 研发、Google 长期维护至今。2. 版本与架构特点当前稳定版:v5.x,基于 LSTM(长短期记忆网络)神经网络技术识别印刷文字。核心优势:无云端依赖支持本地化部署;支持跨平台运行(Windows/macOS/Linux/嵌入式设备)。3. 文档与资源站作用该站点不仅是安装教程库,还包含以下关键内容:命令行参数详解表。API 接口开发文档。多语种语言包(traineddata)下载指引。模型训练指南及第三方封装工具清单。二、主要功能特性文字提取能力:支持将图片与扫描件转换为纯文本,兼容 TIFF/JPG/PNG 等多种图像格式。多语言识别:内置全球百余种语种,包含简体中文 chi_sim、繁体中文 chi_tra、英文 eng 等常用包。灵活的页面分割 (PSM):提供多种模式以适应不同场景,如单行文字检测、整块段落提取、表格文本处理或纯数字识别。结构化输出格式:可生成纯 TXT/HTML,以及带坐标信息的 hOCR 文件,方便制作可检索的 PDF。双引擎切换模式 (OEM):支持传统字符模型与 LSTM 深度学习模型的自由切换 (--oem 参数)。多语言 API 接口:核心为 C/C++ API,并拥有 Python/Java/Go/C#等丰富的第三方封装库。自定义模型训练:允许用户针对特定票据、证件或特殊字体进行专属识别库的训练(Custom Training)。批量处理支持:原生脚本及代码包中均包含对多页 TIFF 文档的批量识别逻辑。三、适用人群与场景分析✅ 推荐使用人群【开发者】:需开发本地 OCR 工具、RPA(流程自动化)节点或构建私有化文档系统时,避免数据泄露于云端 API。【办公/学生用户】:用于批量扫描纸质试卷、书籍插图转文字,无需依赖网络即可处理隐私敏感资料。【小型企业团队】:希望进行低成本票据数字化与合同电子化部署(无按量计费费用)。【嵌入式开发者】:需将识别功能轻量化集成到本地设备或边缘计算节点中时。❌ 不推荐使用人群处理手写体者:Tesseract 主要擅长印刷体,对复杂潦草的手写笔迹、签名效果较差(除非经过特殊训练)。低质量图片场景:对于反光严重、模糊不清、倾斜度大的照片,识别率会急剧下降。高精度证件需求:如银行系统对身份证/银行卡的高精度字符要求,需配合复杂的图像预处理算法才能达到标准。四、免费与商用情况说明🆓 完全永久免费Tesseract-OCR 及其所有资源均不收取任何费用。开源协议:采用 Apache License v2.0。个人使用及商业应用均可完全免费,无授权费。限制解除:没有调用次数上限、无服务订阅制、无隐性收费页面、无输出水印。成本构成:唯一的支出仅为服务器硬件或本地机器的部署维护成本;第三方封装的 GUI 工具软件才可能涉及商业付费(非官方引擎本身)。资源公开:所有语言训练数据包 (traineddata) 均开源免费下载。五、快速使用步骤指南📌 第一步:安装核心引擎 (Engine)Windows 系统:访问 https://github.com/UB-Mannheim/tesseract/wiki,下载官方安装包并勾选 "Add to PATH"。 macOS 用户:终端执行 brew install tesseract && brew install tesseract-lang(若未安装 Homebrew)。 Ubuntu/Linux:使用包管理器快速部署 sudo apt install tesseract-ocr tesseract-ocr-chi-sim libtesseract-dev。 🧪 第二步:验证与测试在终端窗口执行以下命令,输出版本号即为安装成功标志:bashtesseract -v 📂 第三步:配置中文语言包引擎默认不包含完整中文字库,需手动下载简体中文识别数据包 chi_sim.traineddata(建议同时安装英文或目标语种),将其放入工程目录下的 tessdata 文件夹。💻 第四步:命令行基础指令 (CLI)bash# 1. 基础英文识别 tesseract test.png output.txt # 2. 简体中文整块文本,启用 LSTM 模型与自动页面分割 tesseract -l chi_sim --psm 6 --oem 3 input_scan.jpg output # 3. 生成带坐标信息的 hocr文件 (便于网页展示) tesseract test.png output.hocr 🐍 第五步:Python 程序调用示例使用 pytesseract 封装库进行开发,注意 Windows 环境下需指定 tesseract.exe 路径。pythonimport pytesseract from PIL import Image # 【Windows】必须配置执行文件绝对路径 (macOS/Linux通常可跳过) pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe' img = Image.open("document.png") text = pytesseract.image_to_string(img, lang="chi_sim") # 指定语言包 # 输出识别结果到控制台 print(text) 六、核心注意事项与避坑指南🛑 环境配置类PATH变量生效:Windows用户修改环境变量后,必须关闭并重新打开终端/命令行窗口才能使用 tesseract 命令。版本兼容问题:v4.x 与 v5.x 不通用。模型文件 (traineddata)、配置参数在不同大版本间不可混用。🖼️ 图像质量类乱码风险处理:识别结果中出现乱码,通常是因为系统缺少对应字体或编码问题,需确保指定 UTF-8 输出或安装相关中文字体支持(针对 v4)。图像预处理需求:模糊、反光强、倾斜大阴影的图片直接运行效果极差。建议先使用 OpenCV/CNN 工具进行灰度化、去噪、二值化等增强处理。🛠️ 开发与功能类PSM模式选择关键性:参数 --psm (Page Segmentation Mode) 决定分割逻辑。psm 7 -> 单行文字/表格识别(不检测文档边框)。psm 6 -> 单个文档块/整页扫描默认模式。psm 3 -> 自动尝试分析所有内容,但速度较慢。建议:针对纯文本区域用 psm 12 (假设单列);复杂版面用默认 6。🚫 局限性与部署类无原生图形界面:Tesseract 核心仅有 CLI/API,所见即所得的 GUI(如 gImageReader)均属第三方开发工具。手写体短板明显:仅对印刷体友好。艺术字、手写签名若非专门训练模型,基本无法准确识别。部署包依赖管理:Windows打包软件时,务必确认是否附带了 tessdata 文件夹及对应的语言文件(.traineddata),否则运行时提示缺库。⚖️ 商用合规类开源协议义务:若修改源码或分发二进制程序,必须在文档中保留 Apache License v2.0 的声明,禁止抹去官方版权标识与来源链接。

OCRmyPDF图标

OCRmyPDF

OCRmyPDF 实用指南核心定位:开源、安全、高效的命令行 PDF OCR 工具,Python 开发,底层基于 Tesseract OCR、Ghostscript、qpdf。📜 开源协议:MPL-2.0(可商用,修改源码需公开)一、主要功能OCRmyPDF 不仅仅是简单的文字识别,它专注于“增强 PDF":生成可检索 PDF/A:默认输出存档标准 PDF/A,也可切换为普通 PDF。图像智能预处理:自动纠偏(--deskew)页面旋转校正(--rotate-pages)降噪与对比度增强多语言混合识别:支持中英文混扫(-l chi_sim+eng)及百种语言。性能优化:批量/单文件处理原地覆盖输出(-f)多核 CPU 加速(--jobs N)PDF 压缩优化输出辅助文件:导出纯文本副文件(--sidecar)。高级控制:跳过已有文本页面强制重 OCR(--force-ocr)修复损坏 PDF元数据自定义部署方式:提供 Python 库 API、Docker 镜像、简易 Web 服务插件。二、适用人群与场景✅ 适合使用程序员/运维:构建自动化档案处理、批量扫描 PDF 流水线。办公/档案管理员:纸质扫描件数字化归档。学生/研究员:古籍、扫描教材、论文批量文字提取。私有部署需求:敏感文档本地离线处理,拒绝上传云端。❌ 不适合使用纯小白用户:无命令行基础(原生无 GUI,需安装第三方封装)。单图提取需求:仅提取单张图片文字时,直接使用 Tesseract 更轻量。移动端用户:无移动端客户端。三、免费与付费说明💰 核心程序:100% 免费开源本体:所有命令行参数、Python API 全部免费。无限制:无官方订阅、无付费套餐、无额度限制、无水印。无定价页面:官方无任何收费渠道。依赖组件:Tesseract、Ghostscript 均为开源免费。⚠️ 第三方付费警告App Store 同名客户端:一次性$4.99 授权,非作者开发。功能限制:仅封装命令行,不推荐。风险:可能涉及隐私上传风险,建议使用官方开源版。四、安装指南重要提示:必须先安装系统级依赖(Tesseract、qpdf 等),仅 pip 安装会导致功能缺失。1. Windows 用户(推荐 WSL2)在 Windows 原生上兼容性较差,建议使用 WSL(Ubuntu)。bash# WSL Ubuntu 环境 sudo apt install ocrmypdf tesseract-ocr tesseract-ocr-chi-sim 2. macOS 用户使用 Homebrew 快速安装。bashbrew install ocrmypdf tesseract tesseract-lang 3. 通用 Python 安装在系统依赖装好后,通过 pipx 安装 Python 包。bashpipx install ocrmypdf 五、使用命令示例1. 基础 OCR输出默认 PDF/A 格式。bashocrmypdf input.pdf out.pdf 2. 进阶处理(多语言 + 纠偏 + 压缩)bashocrmypdf -l chi_sim+eng --deskew --optimize 2 scan.pdf search.pdf 3. 强制重 OCR若 PDF 内已有文字层,默认会跳过。如需强制重扫(将矢量文字转为图片)。bashocrmypdf --force-ocr in.pdf out.pdf 4. 导出副文件原地覆盖输出,并生成独立 TXT 文本。bashocrmypdf --sidecar out.txt input.pdf 5. Python API 调用极简代码示例。pythonimport ocrmypdf ocrmypdf.ocr( "scan.pdf", "search.pdf", language=["chi_sim", "eng"], deskew=True ) 六、避坑指南1. 中文乱码 确保安装了中文语言包:tesseract-ocr-chi-sim。多语言识别时必须使用 -l 语言 1+语言 2 格式。2. 报错 page already has text 原生带文字 PDF 默认会被跳过。需加 --force-ocr 强制重扫,注意这会破坏矢量文字层,将其转为图片。3. Windows 兼容性问题 原生 cmd/Powershell 兼容性差,优先推荐 WSL2 或 Docker 环境。仅 pip 安装容易缺失 Ghostscript 等系统依赖。4. 分辨率误区 300 DPI 是最优平衡点。600 DPI 以上会大幅拖慢速度,且识别精度无显著提升。5. 隐私风险 确保使用 离线本地版。切勿使用第三方封装的 GUI 软件,避免文件被偷偷上传。6. 大文件内存溢出 处理千页以上扫描件时,建议加 --jobs 2 限制线程,降低并行内存占用。7. PDF/A 兼容性 若部分老旧阅读器打不开,可加 --output-type pdf 输出普通 PDF 格式。8. 文件损坏风险 使用原地覆盖(-f)时,若程序中途崩溃会损坏原文件。建议先生成新文件再手动替换。9. 复杂版面识别错位 多栏文档识别异常时,尝试加 --pagesegmode 6 调整版面分割模式。10. 安装失败 若安装报错,请检查是否安装了系统级组件(Tesseract、qpdf、unpaper)。

EasyOCR图标

EasyOCR

EasyOCR 使用指南官网地址:https://www.jaided.ai一、平台介绍Jaided AI 成立于 2020 年,主打 OCR 文字识别,核心产品分为两条线:EasyOCR:开源免费的 Python OCR 库。GitHub 拥有 29k+ 星标。支持全球开发者本地使用,并提供网页 Demo 在线测试。Cloud Document AI(企业云 OCR):提供商用云端 API 及私有化本地部署方案。面向企业的票据、证件、KYC 文字提取需求。定位:通用多语言文字识别,兼顾个人轻量试用、开发者本地集成、企业批量文档处理。二、主要功能1. EasyOCR(开源核心)语言支持:支持 80+ 种语言,包括简/繁体中文、英文、日韩、阿拉伯、西里尔文字等混合识别。场景适配:适用于屏幕截图、纸质文档、模糊街景文字、倾斜图片。输出内容:提供文字内容、坐标框、置信度;支持批量图片处理及图像预处理(去噪/旋转)。训练与运行:支持自定义训练模型,可配置 GPU/CPU 双模式运行。2. Cloud Document AI(企业付费云服务)高级功能:布局分析、表格结构化提取、表单字段识别。证件识别:Identity Reader 功能,支持身份证/护照证件自动解析(KYC 核验)。其他识别:二维码/条码同步识别、签名定位。部署方式:支持云端 API 调用、私有化部署、批量异步处理、数据标注工具。三、适用人群✅ 适配人群开发者:Python 项目本地 OCR 集成、爬虫图文提取、小程序或工具内置文字识别。学生/个人:截图转文字、扫描件提取文本、批量试卷或笔记电子化。中小企业财务:发票、收据、合同批量信息导出。金融/跨境行业:KYC 证件自动录入、客户身份材料识别。❌ 不适合人群纯无代码普通用户:企业版操作相对复杂,无傻瓜式网页工作台。超高精度印刷票据/手写体需求:此类场景专用票据 OCR 效果通常更强。四、免费 & 付费详情1. 免费资源(永久可用)EasyOCR 开源库:完全免费且可商用,支持本地离线运行,无调用限额。EasyOCR 在线 Demo:https://www.jaided.ai/easyocr/单次上传图片测试。限制:单图 2MB 上限,无批量功能,结果临时展示(刷新丢失)。2. 付费:Cloud Document AI 企业云服务定价页面:https://www.jaided.ai/pricing套餐模式:按量计费:按识别图片页数扣费,适合低频零散需求。月度订阅包:固定额度,适合每日批量文档处理。私有化部署:一次性授权 + 年费维护,数据不上传外网。支付限制:仅支持境外信用卡,无微信/支付宝国内充值通道。试用:官网可申请少量云端 API 测试额度(需注册企业邮箱)。五、使用方法(三条路线)路线 A:个人在线快速试用(无需代码)访问官网 Demo:https://www.jaided.ai/easyocr/上传图片,选择语言(如 ch_sim+en)。一键识别,复制带坐标或纯文本结果。路线 B:开发者本地集成(EasyOCR 开源)安装库:bashpip install easyocr 最简代码示例:pythonimport easyocr # 加载简中 + 英文模型 reader = easyocr.Reader(['ch_sim','en'], gpu=False) # 识别图片 res = reader.readtext("test.jpg") # 打印纯文本 for box, text, score in res: print(text) 完整教程:https://jaided.ai/easyocr/tutorial/路线 C:企业云端 API 调用官网注册企业账号,获取 API Key。调用官方 V1 识别接口,支持同步/异步批量任务。配套文档:https://jaided.ai/documentai/docs六、避坑点⚠️ 注意:国内访问相关服务请注意网络环境,以下坑点请务必知晓。网络问题(国内最大坑)官网、在线 Demo 及企业云服务器均在海外,直连常出现加载慢、上传超时。建议:开源本地库不受网络影响,优先离线部署;国内用户请准备代理环境。EasyOCR 性能短板CPU 识别大图速度极慢,批量处理建议配置 GPU。手写文字、极小字体、强光反光图片准确率会大幅下跌。首次运行需自动下载数百 MB 语言模型,离线环境需提前手动导入模型文件。免费 Demo 限制单图 2MB 上限、不支持 PDF 格式、无批量导出功能。结果仅临时展示,刷新页面后记录丢失,不适合工作流集成。企业版成本与合规云端 API 长期批量使用成本较高。涉密证件、票据数据不能上云,必须选私有化部署。付费仅支持境外信用卡,无国内充值渠道。商用版权区分EasyOCR 开源库:允许免费商用。Cloud Document AI:产出物商用需遵守订阅协议,不可超额度转发 API 能力。多语言兼容坑繁/简体中文模型不能混用。同时加载多语种会大幅占用内存、降低速度,建议按需只加载所需语言。

Umi-OCR图标

Umi-OCR

Umi-OCR 使用指南一、平台介绍Umi-OCR 是一款国产离线开源 OCR 工具,基于 PaddleOCR 引擎开发,采用 MIT 开源协议。安全隐私:全程本地运算,不上传图片,彻底杜绝云端隐私泄露风险。网络要求:断网可用,完全离线运行。系统支持:兼容 Windows/Linux x64 架构。安装方式:解压即用,无需安装,无驱动依赖。二、核心主要功能1. 截图识别自定义快捷键:支持设置全局热键,快速框选屏幕区域。多源识别:支持点击屏幕截图识别,也支持复制图片后粘贴识别。智能排版:识别后自动合并自然段,优化文本格式。2. 批量图片 OCR无限数量:拖入图片或文件夹即可处理,无数量上限。区域屏蔽:支持设置忽略区域,自动跳过水印、页眉、页脚。多格式导出:支持导出为 TXT、MD、CSV、JSONL 等多种格式。3. 批量 PDF 文档扫描件处理:针对扫描版 PDF 提取文字。PDF 优化:生成的 PDF 为双层可检索格式,方便后期编辑与搜索。4. 附加识别能力多模态解析:支持二维码解析与生成。特殊文本:内置数学公式识别、竖排文本适配功能。多语言支持:内置简繁中、英、日、韩、俄、德、法等语言模型,支持手动扩充。5. 外部集成与后处理接口调用:提供 HTTP 接口与命令行支持,可对接自动化脚本或第三方软件。文本清洗:自动合并自然段,去除多余换行,过滤干扰文字。三、适用人群✅ 推荐适用人群学生群体:课件截图、黑板照片、论文文献、公式提取。职场办公:合同/发票扫描件、截图文案、批量资料数字化。隐私敏感用户:财务单据、身份证、内部机密(需本地处理,不上传云端)。自媒体创作者:网页截图、视频字幕提取。开发者:本地 OCR 接口二次开发、自动化工具集成。❌ 不适合使用场景MacOS 用户:无官方原生客户端,需依赖虚拟机或 WSL,体验不佳。老旧硬件:无 AVX 指令集的老旧 CPU 无法启动 Paddle 引擎。移动端用户:不支持手机或平板直接运行。32 位系统:仅支持 x64 架构操作系统。四、免费/付费情况完全免费:100% 永久免费,无付费版本、无会员、无次数限制、无软件水印。开源协议:源码完全开源,个人及商用均可自由使用、二次修改及分发。无隐形消费:无定价页面,不存在付费套餐或充值渠道。模型扩展:仅可选额外下载多语言模型包,所有扩展资源均免费。五、快速使用步骤软件安装下载 Release 版本压缩包,解压至任意文件夹。直接运行 Umi-OCR.exe 即可启动。截图识别进入 设置 -> 快捷键,绑定截图热键(默认为 Win + Alt + C)。按下快捷键框选区域,软件自动输出文本,支持一键复制。批量识别切换至「批量 OCR」模式。拖入图片文件,设置「忽略区域」框选水印等干扰内容。点击开始任务,处理完成后批量导出文件。PDF 识别切换至「批量文档」模式。导入 PDF 文件,批量提取文字内容。剪贴板快捷识别从网页或微信复制图片后,软件点击「粘贴图片识别」即可完成。进阶开发开启 HTTP 接口功能。通过代码调用本地 OCR 服务,实现程序化调用。六、避坑点(高频问题与解决方案)1. 硬件兼容坑问题:老 CPU 无 AVX 指令集无法启动 Paddle 引擎;32 位系统无法运行。解决:需切换 RapidOCR 引擎;确认系统为 x64 架构。2. 多屏缩放异常问题:多显示器 Windows 缩放比例不一致,导致截图画面错位、识别失败。解决:统一所有显示器缩放比例,或使用系统自带截图工具截取后导入。3. 大图识别模糊问题:超长截图或超大图片出现识别残缺、漏字。解决:在 设置 中调高「限制图像边长」数值,或分块识别。4. 硬盘占用大问题:完整多语言模型包体积超 1GB。解决:若仅用中文,可在模型目录删除多余的语言模型包以节省空间。5. 忽略区域逻辑误区问题:忽略框仅能屏蔽固定水印,动态不规则水印无法彻底清除。解决:复杂图片建议单张手动剔除干扰区域,或使用图像预处理工具先修复。6. Mac 用户限制问题:无官方 Mac 客户端。解决:只能通过虚拟机或 WSL 运行,体验不如本地客户端。7. 杀毒误报问题:解压包易被 Windows Defender 拦截。解决:添加解压目录至杀毒软件白名单;软件无病毒,开源源码可自查。8. 离线模型更新问题:新增语种无在线自动下载功能。解决:需手动下载模型文件,并按指定路径放入目录。9. 接口安全风险问题:HTTP 接口默认本地开放。解决:切勿暴露公网 IP,避免他人调用占用本地算力;内部使用建议设置密码或限流。10. 批量任务卡顿问题:一次性导入上千张图会导致内存飙升,处理变慢。解决:建议分批次处理,避免单次内存溢出。

OpenScreen图标

OpenScreen

OpenScreen 使用指南一、平台简介OpenScreen 是一款开源的轻量级专业录屏演示工具,旨在为用户提供无水印、隐私安全的本地视频处理方案。项目地址:https://github.com/getopenscreen/openscreen官方网址:https://www.openscreen.net/技术架构:基于 Electron 跨平台开发,采用 React + PixiJS,利用本地 FFmpeg 进行视频编码,无云端上传逻辑。核心定位:Screen Studio 等付费软件的免费平替,主打 Demo 演示与教程美化录制。开源协议:MIT 协议,允许个人及商业用途,支持修改与源码分发。二、主要功能特性1. 录制能力录制范围:支持全屏录制或单窗口录制。音频采集:支持麦克风与系统声音同步采集。操作控制:提供 3 秒倒计时,支持托盘悬浮条控制暂停与停止。2. 演示特效(核心卖点)画面增强:支持自动跟随光标缩放、手动定点缩放。流畅转场:内置运动模糊效果,鼠标高亮显示。隐私保护:支持敏感区域自动模糊或打码处理。3. 后期编辑非破坏性剪辑:基于时间轴进行分段变速、裁剪。标注工具:提供文本、箭头、形状等自定义标注功能。背景设置:支持纯色、渐变或自定义壁纸背景。4. 导出设置格式支持:导出 MP4、GIF、WebM 等格式。比例选择:支持 1:1、16:9、9:16 等多尺寸比例。纯净输出:无水印、无隐藏收费、无强制广告。5. 扩展支持源码修改:支持二次编译修改源码。素材导入:支持导入外部录屏素材进行二次编辑。三、适用人群与场景✅ 推荐使用的用户程序员:用于代码 Demo 演示、Bug 复现过程记录、开源项目讲解。产品/运营:制作软件演示视频、客户交付短视频、功能介绍素材。讲师/自媒体:制作操作教程、软件测评视频、线上课程内容。自由职业者:低成本商用演示视频,替代昂贵的付费软件。❌ 不太适合的场景专业影视制作:不适合多轨道复杂剪辑或专业级调色需求。直播推流:不支持直接推流或直播场景。超长录制:长时间 4K 连续录制存在资源占用风险。云端协作:不适合需要云端存储或在线实时分享链接的团队。四、免费与付费情况完全永久免费,无任何付费套餐、订阅、内购或专业版限制。功能全开:所有功能均开放,无功能阉割,无录制时长限制。商用免费:依据 MIT 协议,个人及商业用途均免费。纯净无广告:无隐藏收费、无强制广告、无个人隐私数据采集。五、极简使用步骤1. 安装软件预编译包(推荐):访问 GitHub Releases 下载对应系统安装包。macOS:.dmgWindows:.exeLinux:AppImage包管理器安装: macOS 用户可通过 Homebrew 一键安装:bashbrew install openscreen 源码构建:bashgit clone https://github.com/getopenscreen/openscreen cd openscreen npm install npm run build 2. 权限配置(重要)macOS:授予屏幕录制、辅助功能、磁盘权限。若弹出隔离提示,在终端执行以下命令放行:bashxattr -rd com.apple.quarantine /Applications/OpenScreen.app Linux:赋予 AppImage 执行权限:chmod +x xxx.AppImage启动时建议添加 --no-sandbox 参数以防崩溃。Windows:需在系统设置中允许应用屏幕捕获,关闭杀毒软件拦截规则。3. 录制流程设置:打开软件,选择「窗口」或「全屏」录制范围,配置音频源。录制:点击 Record 按钮,通过悬浮条控制录制过程。编辑:录制结束后进入时间轴,添加缩放特效、标注、裁剪、调速或更换背景。导出:设置分辨率与比例,导出为 MP4/GIF 并保存至本地。六、常见避坑与注意事项⚠️ 版本与稳定性Beta 测试:Windows 版在暂停后可能出现鼠标错位,长时间录制建议分段录制以防内存溢出。GIF 导出:高分辨率 GIF 导出耗时较长,请保持网络畅通或定期清理磁盘空间。⚠️ 系统兼容性macOS 系统音:macOS 12 及以下版本无法直接捕获系统音,需安装 BlackHole 等虚拟声卡;新版本需手动在系统设置中开启音频权限。macOS 拦截:首次打开若被 Gatekeeper 阻止,必须执行隔离删除命令。语言界面:首次启动可能出现语言弹窗遮挡界面,建议将弹窗拖至边缘切换简体中文后关闭。⚠️ 隐私与安全本地处理:所有视频文件均在本地处理,不上传至云端。敏感信息:软件无自动敏感信息检测,涉及机密内容需手动添加模糊遮罩。⚠️ 二次开发协议声明:若修改源码后分发,务必保留 MIT 协议声明。功能限制:不支持对接云端存储或生成在线分享链接。⚠️ 功能边界缺失功能:暂无自动字幕、多轨道混音、复杂转场特效、摄像头画中画等功能,直播推流也不支持。

Xinference图标

Xinference

Xinference平台使用指南一、平台介绍全称Xorbits Inference定义开源本地/私有化大模型推理服务框架核心优势部署灵活:支持单机或集群均可部署,内置 WebUI。接口统一:对外全兼容 OpenAI 接口,便于迁移。模型统一:统一托管 LLM、多模态、语音、向量、重排模型,替代 Ollama+vLLM 多套工具。数据安全:数据完全本地不出内网,主打企业私有化 AI 底座。二、核心主要功能全品类模型托管 支持 300+ 开源模型(如通义千问、Llama、GLM、Whisper、LLaVA 等),涵盖 LLM、图文多模态、语音 ASR/TTS、Embedding、Rerank 等场景。多推理引擎加速 支持 vLLM、SGLang、llama.cpp、Transformers 等引擎。内置 AWQ、GPTQ、FP8 量化技术,具备分离式 Prefill-Decode 以提升吞吐量。OpenAI 兼容统一 API 提供 /v1/chat/completions、音频、向量等接口。原有 GPT 代码仅需修改 base_url 即可无缝迁移。分布式集群调度 支持多机异构部署(如 GPU、昇腾、M 系列苹果芯片混布),兼容 K8s 并支持弹性扩缩容。配套开发能力 提供 Web 可视化管理、函数调用 Function Calling、基础监控指标。支持 Docker 一键部署,并可无缝对接 LangChain、Dify、FlowUs 等平台。企业级商业特性 具备多租户、权限管控、私有模型仓库、SLA 保障、GDPR/HIPAA 合规认证,以及国产硬件适配。三、适用人群✅ 适合使用个人开发者/学生:适合本地跑开源模型做测试、搭建 RAG 原型。AI 研发/算法团队:作为统一推理底座,用一套 API 管理全部模型。中小企业:适合私有化知识库、客服 AI、离线业务,规避公有 API 成本与数据泄露风险。MLOps 运维:适合搭建本地推理集群,统一调度多 GPU 资源。合规行业(金融/政务):满足数据禁止出内网场景的安全需求。❌ 不适合使用无 GPU/低配设备:无 GPU 或低配轻薄本运行 7B+ 大模型时,速度极差。纯云端需求用户:只想开箱即用云端对话、无本地部署能力的普通用户。超大规模高并发:超大规模公有云高并发商用场景,建议优先选择专业云推理服务。四、免费&付费方案📚 定价官方页面国际站:https://xinference.co/pricing国内中文站:https://xinference.cn/pricing1. 开源免费版(永久免费)授权:MIT 开源,个人/小型商用均可自由部署。功能:单机部署、基础 WebUI、全部推理引擎、OpenAI API、社区文档支持。调用额度:无调用额度限制。限制:无集群支持、无权限管控、无商业售后、不支持国产 NPU 深度适配、无 SLA 保障。2. 企业单机商业版(付费授权)适用:单机生产环境。功能:权限管理、单点登录、国产芯片深度适配、7×12 技术支持、安全审计、私有模型库。限制:不支持多机分布式集群扩展。3. 企业集群商业版(付费授权)适用:大型生产环境、多机集群。功能:全功能 + 多机分布式、弹性伸缩。高可用 Supervisor、K8s Helm、专属技术顾问。SLA 保障、多租户隔离、合规审计。五、快速使用步骤1. 安装(三选一)方式一:pip 完整安装(推荐)bashpip install "xinference[all]" -i https://pypi.tuna.tsinghua.edu.cn/simple 方式二:Docker 部署bashdocker pull xprobe/xinference:latest-cu129 docker run -d -p 9997:9997 xprobe/xinference:latest-cu129 2. 启动服务本地单机(开放局域网访问)bashxinference-local --host 0.0.0.0 --port 9997 访问 WebUI:http://localhost:9997/ui3. 加载模型WebUI 操作:在 Model Hub 搜索模型 → Launch,自动下载权重。CLI 命令:bashxinference launch --model-name qwen2:7b --n-gpu 1 4. API 调用示例(兼容 OpenAI)pythonfrom openai import OpenAI client = OpenAI( base_url="http://127.0.0.1:9997/v1", api_key="dummy" # 开源版无需密钥 ) resp = client.chat.completions.create( model="qwen2:7b", messages=[{"role":"user", "content":"介绍 Xinference"}] ) print(resp.choices[0].message.content) 六、避坑点(注意事项)硬件门槛7B 模型最低建议 32G 内存。无 GPU 仅 CPU 推理速度极慢。Windows 原生支持较差,建议 WSL2 / Linux / macOS M 系列。模型下载慢国内 HuggingFace 源容易超时。建议手动配置 HF 镜像或提前本地缓存权重。资源调度缺陷多模型同时加载显存抢占严重。长文本生成会挤压 Embedding/Rerank 模型资源。建议分机部署轻重模型。分布式运维复杂集群版依赖 DeepEP 通信库,跨机型兼容性差。小规模项目优先选择单机部署。版本依赖冲突xinference[all] 安装易出现 torch/cuda 版本不匹配。建议按需安装 [vllm] / [transformers] 精简依赖。存储占用巨大模型缓存默认存在用户目录。单 7B 量化模型可达 10GB+,建议通过 XINFERENCE_HOME 环境变量自定义存储路径。安全风险开源版无权限隔离,公网暴露 9997 端口存在风险。生产环境必须加反向代理 + 鉴权。多模态生态不完善文生图、视频生成支持模型较少。专业图像生成建议搭配独立 Stable Diffusion 服务。冷启动耗时首次加载大模型预热时间长。生产环境建议常驻模型,避免频繁启停。商业付费渠道国际版订阅仅境外信用卡支付。国内企业需走线下销售签约。

GPUStack图标

GPUStack

GPUStack使用指南一、平台介绍GPUStack 是一款开源的异构 GPU 集群 + 私有大模型推理管理平台。核心定位:统一纳管 NVIDIA/AMD/Apple Silicon/昇腾/摩尔线程等异构显卡,支持一键部署 LLM/多模态/文生图/语音模型,提供 OpenAI 兼容 API,是本地私有化 AI 推理的理想底座。部署方式:可替代单独部署 vLLM、llama.cpp、SD 服务等,支持 Linux/macOS/Windows(WSL2) 单机及多机集群。基础功能:内置调度、监控、权限管理、负载均衡及故障自愈机制。开源属性:100% 开源免费,支持私有化部署。资源链接:官网:https://gpustack.ai开源仓库:https://github.com/gpustack/gpustack二、主要功能1. 异构算力统一纳管支持多品牌显卡及多服务器合并为单集群。具备自动分配显存/算力能力,支持分布式推理。2. 全品类模型一键部署模型类型:涵盖 LLM/VLM/Embedding/Rerank/文生图/STT/TTS。下载便捷:直连 Hugging Face/ModelScope 自动下载,内置 GGUF/FP16 量化模板。3. 多推理引擎兼容支持 vLLM、llama-box(llama.cpp)、MindIE、SD.cpp 共存与切换。用户可根据需求调节吞吐率或低延迟模式。4. OpenAI 标准 API兼容 Chat Completions、图像生成接口。可无缝对接 Dify、LangChain、Agnes AI 或本地客户端。5. 运维管控能力提供 GPU 实时监控与用量统计。管理 API 密钥、用户权限、Token 限流及请求配额。支持高可用故障转移功能。6. 内置模型市场 Catalog预调好主流开源模型参数,无需手动填写显存或上下文配置,开箱即用。三、适用人群✅ 适合使用个人开发者/AI 爱好者:本地单机显卡跑私有大模型。算法团队:构建私有化 RAG、Agent、本地知识库底座。中小企业:自建离线 AI 服务,有效规避公有 API 数据泄露风险。算力运维人员:管理多服务器异构 GPU 统一集群。国产化需求方:实现昇腾/摩尔线程国产 NPU 的统一调度。❌ 不适合使用纯小白用户:缺乏 Linux 或 Docker 基础,部署有一定门槛。无硬件资源用户:无本地 GPU 或云显卡资源。C 端交互需求者:追求开箱即用的网页对话工具(平台侧重推理底层,无完善的 C 端交互界面)。四、免费 & 付费定价1. 开源核心:永久完全免费适用范围:所有基础集群、模型部署、API、监控功能无限制。限制说明:无节点/显卡数量锁死,本地私有化部署无按量扣费。2. 商业付费:企业增值服务产品形态:官方企业版,针对企业场景提供专属服务。服务包含:专属技术支持、私有化定制。SLA 保障、国产芯片深度适配。企业权限审计、离线交付包。获取方式:定价页面:https://gpustack.ai/pricing模式:按节点/服务器年度订阅,支持上门部署、7×24 工单。定制:需联系销售获取定制报价。3. 特别说明目前无云端 SaaS 版,仅支持本地私有化部署。无网页在线试用平台,必须自备显卡硬件。五、快速使用步骤方式 1:Docker 一键部署(推荐)环境准备:安装 Docker + NVIDIA Container Toolkit 显卡驱动。执行安装:运行官方安装脚本 curl -sfL https://get.gpustack.ai | sh。访问控制台:浏览器访问 http://本机 IP:80,默认账号 admin / 密码 GPUStack@123。构建集群:新建集群,添加本地 Worker 节点(系统自动生成接入命令供其他服务器使用)。部署模型:点击 Deploy Model → 选择 HF/ModelScope → 选量化规格 → 启动。获取 API:复制 API 地址 + 密钥,接入任意 OpenAI 兼容客户端。方式 2:Windows 部署前提条件:必须使用 WSL2 + Docker Engine。注意:不支持原生 Docker Desktop,否则会导致显卡直通异常。驱动要求:主机安装 NVIDIA 驱动,WSL 内部无需安装 CUDA Toolkit。调用 JSON 示例(兼容 OpenAI)接口地址:http://127.0.0.1:80/v1json{ "model": "qwen3-7b-instruct", "messages": [ { "role": "user", "content": "介绍 GPUStack" } ], "temperature": 0.7 } 六、避坑重点显存估算坑 vLLM 默认占用 90% 显存,多模型易冲突。计算公式:模型权重 GB × 1.2 + 2GB。后果:显存不足会持续 Pending 无法启动。国内模型下载慢解决方法:部署前配置 HF 镜像环境变量 HF_ENDPOINT=https://hf-mirror.com。否则:下载超时失败。Windows 原生不兼容严禁:不要直接 Windows 安装。必须:使用 WSL2,Docker Desktop 会导致显卡直通异常。多节点网络坑跨服务器:需开放 80 端口,内部通信端口需放行。防火墙:局域网访问 WSL 需开启 Mirrored 网络模式。密钥安全风险:API Key 仅控制台可见一次,泄露会被滥用占用显卡资源。建议:按团队分配独立 Token 配额。版本升级风险架构:大版本(如 v1→v2)可能涉及架构重构。操作:升级前导出模型配置备份,生产环境不建议自动更新。国产芯片适配建议:昇腾/摩尔线程优先使用对应专用驱动。注意:通用 N 卡引擎在这些芯片上性能下降明显。无在线云端现状:无法网页在线试用,必须自备显卡硬件,无云算力租赁服务。免费无售后开源版:无官方技术支持,报错只能查 GitHub Issues。建议:企业稳定场景建议购买商业服务以获取工单支持。

LM Studio图标

LM Studio

LM Studio 使用指南一、平台介绍LM Studio(lmstudio.ai)是一款功能强大的本地离线大模型桌面 GUI 工具,全面支持 Windows、macOS 和 Linux 全平台。核心定位:可视化管理 GGUF 开源大模型,替代 Ollama 纯命令行操作。数据隐私:支持全程本地运行,不联网上传数据,拒绝云端计费与 Token 消耗。技术栈:内置兼容 OpenAI/Anthropic 本地 API 服务,支持 RAG 文档问答及远程实例连接(LM Link)。适用场景:隐私优先、离线免费体验、无云端依赖的本地 AI 工作流。二、核心主要功能1. 模型市场一键检索下载:支持 Llama3、Qwen、DeepSeek、Mistral 等主流开源模型。量化格式:专注于 GGUF 量化模型,支持手动导入本地 GGUF 文件。版本选择:提供不同量化版本(如 Q4_K_M),平衡速度与效果。2. 可视化对话图形化窗口:提供直观的用户聊天界面,支持流式输出。参数调节:可调整 Temperature(温度)、上下文长度(Context Window)、GPU 分层卸载(GPU Layers Offload)等推理参数。3. 本地 RAG(检索增强生成)私有文档问答:支持上传 PDF、TXT、Markdown 等格式。本地知识库:构建本地私有文档问答系统,文件数据不出本地。4. 兼容 API 服务本地接口:一键启动 OpenAI 格式本地接口,地址默认为 http://localhost:1234/v1。生态对接:可直接对接任何支持 OpenAI 协议的客户端、脚本或代码库。5. 远程算力连接LM Link:支持局域网或公网连接另一台设备的 LM Studio 算力。资源共享:将远程模型加载到当前会话,共享远端模型资源。6. 命令行工具 (lms)无 GUI 部署:支持无图形界面服务器部署。自动化脚本:支持脚本批量加载模型、自动化推理任务。7. 模型量化工具内置量化:提供模型压缩与量化工具,降低内存与显存占用。三、适用人群✅ 适合用户用户类型核心需求匹配理由隐私需求用户处理合同、源码、涉密文档数据全程本地化,拒绝上传外网AI 新手不想敲命令行图形化界面跑本地大模型,门槛低独立开发者本地调试 AI 应用低成本 API 原型开发,无需云调用学生/爱好者离线免费体验无调用额度限制,资源免费小型技术团队单人私有化 AI 工作台本地部署,灵活控制环境❌ 不适合用户用户类型限制原因低配电脑无 16G 内存/独立显卡(7B 基础模型最低需 10G 内存)大规模集群无原生团队权限管理,不适合企业多人协作云端依赖者不愿占用本地硬盘(模型单文件几 GB~几十 GB)四、免费&付费定价(最新)1. 个人/职场标准版(永久全免费)功能完整:无功能阉割、无模型数量上限、无水印、不限使用时长。商业授权:个人及公司内部商用均可免费使用,无需额外购买授权。功能包含:包含全部 GUI、本地 API、RAG、LM Link、lms 命令行全部功能。2. Enterprise 企业版(付费定制)面向群体:大型企业级需求。核心优势:集中模型管控、SSO 登录、私有模型仓库、管理员权限、专属技术支持。获取方式:无公开定价,需联系官方销售询价。官网定价/企业咨询入口:https://lmstudio.ai/enterprise五、极简使用步骤下载安装:访问官网下载对应系统客户端,启动后切换至简体中文界面。下载模型:在 Model 市场搜索模型,优先选择 Q4_K_M 量化版本(平衡速度/效果)。加载模型:下载完成后点击加载,设置 GPU 卸载层数(有 N 卡/Apple 硅尽量开满)。开始对话:进入 Chat 页面直接对话;如需 API,点击 Developer 标签启动 Local Inference Server。调用 API:接口地址:http://127.0.0.1:1234/v1请求兼容:OpenAI 请求 JSON 格式。API 示例 JSON:json{ "model": "qwen3-7b-q4_k_m", "messages": [ {"role": "user", "content": "写一段本地 API 调用说明"} ], "temperature": 0.7 } 本地 RAG:点击 Chat with Docs,上传本地文件后绑定模型进行问答。六、避坑点📡 下载网络坑问题:国内直连 Hugging Face 模型市场极慢或失败。对策:建议手动去魔搭(ModelScope)或 Hugging Face 下载 GGUF 文件后,使用“导入”功能本地上传。🖥️ 硬件性能坑内存配置:8G 内存仅能跑 3B 极小模型。推荐配置:16G 内存推荐 7B Q4 量化,32G 以上可尝试 14B/34B 模型。显存优化:不开启 GPU 分层卸载,CPU 推理速度极慢且卡顿,务必在界面开启 GPU 层数。📦 模型格式坑格式限制:软件仅支持 GGUF 格式。GPTQ、Safetensors 等格式无法直接加载。解决:如需使用其他格式,需先转换为 GGUF(可使用 llama.cpp 或类似工具转换)。🌐 API 连接坑端口占用:防火墙或代理可能占用 1234 端口。影响:导致本地服务无法访问。解决:关闭占用程序、关闭防火墙或修改 API 端口。💾 磁盘占用坑空间消耗:单 14B 模型即占用 10GB+,多模型极易占满硬盘。维护:建议定期删除不用的模型文件,或使用 LM Link 共享模型而非重复下载。🔒 隐私误区软件安全:软件本身不上传对话记录。版权风险:第三方模型权重需自行核对商用版权,注意模型协议(如非商用协议)。🔗 远程连接坑LM Link 公网:公网连接需手动放行端口,无加密措施易泄露。建议:涉密场景请仅限局域网使用 LM Link。🏢 企业部署限制免费版:无多人权限、无日志审计。合规需求:公司合规场景需购买 Enterprise 版。🔄 更新配置坑版本更新:大版本更新偶尔会重置模型加载配置(如 GPU 层数)。建议:更新前请记录当前的推理参数设置。

vLLM图标

vLLM

vLLM使用指南一、平台介绍vLLM 是由伯克利 LMSYS 开源的高性能大模型推理与服务引擎,访问官网 vllm.ai。其核心主打 PagedAttention 分页注意力 技术,大幅降低了 KV 缓存的显存占用。相比原生 Transformers,其吞吐量可提升 10~15 倍。vLLM 主要分为两种形态:开源本地部署版免费开源,无授权费。适用于本地环境、私有云自建推理服务。成本仅为用户自有的 GPU/云服务器硬件开销。vLLM Cloud 托管云服务官方提供的托管 GPU 在线 API。按需付费或订阅模式。核心优势:兼容 OpenAI 标准接口。支持连续批处理(Continuous Batching)。极低显存浪费。适配几乎所有主流开源大模型。二、主要功能超高吞吐推理 基于 PagedAttention 与连续批处理,单 GPU 可承载更多并发对话,显著降低单 Token 成本。支持量化(AWQ/GPTQ/SqueezeLLM)以节省显存。OpenAI 兼容 API 服务 一键启动标准 /v1/chat/completions 接口。现有 OpenAI 代码无需大幅修改即可迁移,且内置 Swagger 调试页面。全模型生态支持 兼容 Llama、Qwen、DeepSeek、Gemma 等主流架构。支持多模态(LLaVA)、MoE 混合专家模型、代码模型以及 LoRA 动态加载。分布式扩容 支持单卡/多卡张量并行,以及 Ray 多机分布式部署。具备自动前缀缓存功能,大幅提升重复上下文的处理速度。多模态原生 原生支持图文 LLaVA、音频输入及百万 Token 级别的长上下文窗口。可观测指标 提供吞吐、延迟、KV 缓存利用率、排队长度等 metrics,支持对接 Prometheus 监控系统。容器化一键部署 官方提供 Docker 镜像,支持 CPU、CUDA、ROCm 及 Apple Silicon 等多种硬件环境。三、适用人群✅ 适合AI 开发者与算法工程师:需要自建私有大模型服务。中小团队/创业公司:日处理千万级 Token,希望降低第三方 API 费用。私有化部署需求:要求数据不出本地或企业内网的企业。开源模型微调与 RAG:作为本地知识库推理底座。多模态与高并发场景:需要低延迟、高并发对话的产品。❌ 不适合资源受限者:无 GPU 资源且无运维能力的纯小白用户。低调用量场景:日调用量低于 10 万 Token,自建 GPU 成本高于商用 API。零代码用户:完全不想运维,只想开箱即用的 C 端用户(需自行开发前端)。四、免费&付费、定价页面地址1. 开源本地版(永久免费)协议:MIT 协议,无授权费。限制:无并发、Token、时长限制,数据完全私有。成本:仅硬件(GPU/云服务器)开销。2. vLLM Cloud 托管云(付费按量/订阅)定价页面:https://vllm.ai/pricing收费模式按量付费(Pay-as-you-go):按输入/输出 Token 计费,单价视模型不同。预留实例订阅:按月包 GPU 算力,适合高并发场景,单价更低。附加收费:跨区流量、超大显存(如 H100)、专属运维 SLA。参考成本(以官网为准)7B 量化模型:约 $0.05~0.12 / 百万 token。70B 大模型:约 $0.3~0.8 / 百万 token。自建建议:日处理千万 Token 以上时,自建 GPU 更划算。五、快速使用教程路线 1:本地开源部署(免费)环境准备需 Python 3.10+ 及 NVIDIA GPU(支持 CUDA)。命令示例:uv pip install vllm启动服务 启动兼容 OpenAI 的服务,监听端口 8000:bashvllm serve Qwen/Qwen2.5-7B-Instruct --host 0.0.0.0 --port 8000 调用示例 使用标准 OpenAI JSON 请求格式:json{ "model": "Qwen/Qwen2.5-7B-Instruct", "messages": [ {"role": "user", "content": "介绍 vLLM"} ], "temperature": 0.7, "stream": true } 访问调试文档地址:http://localhost:8000/docs路线 2:vLLM Cloud 托管云注册账号:前往官网注册并充值。配置控制台:选择模型与 GPU 规格,获取 API Key 与 Base URL。接入调用:在客户端(如 Python SDK)中直接替换 base_url 与 api_key 即可调用,无需管理底层 GPU。六、避坑点(核心干货)显存硬门槛7B 模型 FP16 精度需 ≥24GB 显存。70B 模型建议配备 80GB A100/H100。无量化直接运行容易 OOM,务必开启 AWQ/GPTQ 量化。国内网络两大坑模型下载:HuggingFace 直连超时,建议配置镜像 HF_ENDPOINT=https://hf-mirror.com。Cloud 延迟:vLLM Cloud 为海外节点,直连延迟高,国内业务建议优先采用本地部署。免费开源≠零成本低调用量场景(如日<100 万 Token)下,云 GPU 时租费用可能高于 OpenRouter 等按量 API。日 Token 量建议门槛较高,需计算 ROI。批量并发限流坑默认 max-num-seqs 有限制。超高并发需调大该参数,否则会出现请求排队、首 token 延迟飙升。多卡分布式踩坑多机部署需配置 Ray + NCCL,裸跑易通信报错。单机多卡需添加 --tensor-parallel-size N 参数。KV 缓存内存泄漏超长上下文或频繁唯一 Prompt 可能击穿缓存。建议设置 max-model-len 截断异常输入。Cloud 托管隐性费用预留实例按月付费,闲置仍扣费。超大带宽出网流量可能单独计费,预算需预留。无原生 Web 聊天界面vLLM 仅提供 API 后端。前端、鉴权、会话存储需自行开发,不适合零代码直接给业务使用。商用版权风险Llama 等模型需单独申请 Meta 商用授权。vLLM 仅为推理引擎,不提供模型本身的商用许可。