分类导航

发现更多优质 AI 工具

全部 编程代码 创作写作 视频音频 图像视觉 学习辅导 办公效率 设计创意 大模型 提示词 Skills 自动化 知识库 开源&免费 副业
海螺视频图标

海螺视频

海螺 AI 使用指南一、平台概览MiniMax(稀宇科技)自研国产 AI 短视频生成平台核心模型:基于 Hailuo 2.3 视频模型主打功能:文生视频 (T2V) / 图生视频 (I2V)核心优势:人物动作与面部表情流畅度极佳,支持 15 种专业运镜访问方式:网页端 + APP 端,国内直连稳定官方网址:https://hailuoai.com定价页面:https://hailuoai.com/video/price定位:面向短视频创作者、营销推广、教育人群,提供零门槛 AI 成片服务。二、核心功能解析1. 🎬 文生视频 (Text-to-Video)时长:生成 6–10 秒 24fps 短视频运镜支持:提供 15 种专业运镜(推、拉、摇、航拍等)画风选择:支持电影、写实、水墨、CG 等数十种风格提示词限制:单段提示词上限 2000 字符2. 🖼️ 图生视频 (Image-to-Video)驱动方式:上传图片驱动画面动态化主体参考:支持锁定人物五官,防止形象崩坏首尾固定:可首尾图固定生成过渡片段3. ✂️ 配套成片工具脚本生成:AI 自动分镜脚本配音系统:30+ 种 AI 音色可选字幕处理:一键生成字幕素材库:百万版权 BGM/素材库画幅支持:9:16 / 16:9 / 1:1 多画幅适配4. 🤖 Media Agent 智能剪辑自动拼接:多段素材自动拼接后期处理:自动转场、调色一站式出片:完成完整短视频5. 📡 API 商用接口适用对象:企业批量生成对接能力:系统深度对接权限解锁:Pro 会员及以上开放三、适用人群画像人群分类典型应用场景自媒体/博主抖音、小红书、B 站素材快速产出市场/电商运营产品短片、宣传广告、种草素材制作教育/讲师科普动画、课程演示、知识可视化短片设计师/影视分镜预演、概念短片创作中小企业内部培训、活动宣传物料制作⚠️ 不适用场景:超长视频(>10 秒)、高精度影视工业级成片需求。四、免费与付费方案 (贝壳积分体系)🆓 免费版(无需充值)初始积分:新用户一次性赠送 200 贝壳日常补给:每日登录发放免费积分生成限额:每日可生成 3–5 条短视频限制说明:视频分辨率最高 720P视频带有平台水印生成内容不可商用进入普通生成队列(速度较慢)积分有效期 3 天,过期不存无 API 接口调用权限💎 付费套餐(人民币定价)1. 充值贝壳(按需充值,长期有效)500 贝壳:¥351000 贝壳:¥705000 贝壳:¥3502. 月度会员基础会员价格:¥68/月权益:500 贝壳、去水印、720P、普通队列标准会员价格:¥248/月权益:2000 贝壳、1080P、优先生成、基础 API尊享会员价格:¥1399/月权益:高额度贝壳、极速队列、企业 API、专属客服3. 年费优惠规则基础年卡:¥649标准年卡:享 85 折优惠特别说明:当月未用完的贝壳不结转至次月五、极简使用流程登录注册:打开官网 https://hailuoai.com,使用手机号验证码登录。选择模式:首页点击「AI 创作」,选择文生视频或图生视频。设置参数:输入提示词(文字描述)或上传参考图设置时长、画幅、运镜、画风生成视频:点击生成(消耗贝壳),等待 10–60 秒出片。后期处理:预览、添加配音、字幕、背景音乐。下载保存:完成后下载至本地。六、重要注意事项与避坑指南1. 积分与退款规则扣费机制:仅当正常成片时扣积分;生成失败、审核拦截会自动退回贝壳。退款政策:充值贝壳、会员一经到账,无质量问题不予退款。2. 版权与商用授权免费视频:带平台水印,禁止商业投放。付费视频:仅付费去水印版本拥有商用授权。3. 内容审核红线严禁生成:暴力、色情、侵权、政治敏感内容。违规后果:直接封号,且不予退款。4. 制作限制时长上限:单段视频最高 10 秒。长内容需分段生成后自行拼接。人物一致性:纯文生视频多人易面部崩坏;建议固定角色优先使用「图生视频 + 主体参考」。5. 存储与网络网络访问:国内访问稳定,但高清视频下载较耗流量。云端存储:云端不永久存储成片,建议生成后立刻下载。6. 会员权益细节有效期:月度会员贝壳当月清零,无法累积。充值建议:长期高频使用建议直接充值贝壳包,性价比更高。API 权限:仅标准/尊享会员开放 API 调用,免费及基础会员无此权限。7. 提示词技巧建议同时写入:画面细节 + 运镜 + 画风 + 分辨率。优化提示词可大幅提升成片效果。

TRIPO图标

TRIPO

Tripo3D 实用指南一、平台概况Tripo AI 是一款海外领先的 AI 3D 生成平台。其核心自研模型为 TripoSF 3.1,具备强大的 文生 3D 与 图生 3D 能力。生成效率:10 秒左右即可产出带标准拓扑、PBR 材质、自动 UV 的游戏级模型。产品线划分:Tripo Studio(网页端):面向可视化创作。Tripo OpenAPI(开发者端):面向批量调用。注意:二者积分体系不互通。导出支持:支持 GLB、FBX、OBJ、USDZ、STL 等多种格式,完美适配 Unity、Unreal、Blender、3D 打印及 AR 开发。二、核心功能亮点双模式生成文生 3D:直接输入提示词,快速生成道具、角色或场景。图生 3D:支持单图或多视图上传转 3D,兼容透明底原画。材质与拓扑优化提供标准版与超清 4K 两种 PBR 纹理选项。支持自动轻量化拓扑,可自定义三角面上限。AI 后期编辑(需付费解锁)一键智能分割模型。局部纹理重绘。自动骨骼绑定与动作生成。工作流与导出多格式模型导出。支持引擎插件调用。提供 API 批量生产接口。实时预览工具支持四视角实时查看。可切换白膜/材质模式。支持模型尺寸缩放查看。三、适用人群分析✅ 推荐使用独立游戏美术及小型工作室(用于快速制作角色、道具资产)。3D 打印爱好者及手办创作者(利用 STL/obj 导出)。AR/VR 产品设计、虚拟主播建模需求者。短视频/动画创作者(用于原画转 3D 的轻量化需求)。开发者(调用 OpenAPI 搭建自有的 AI 3D 生成工具)。❌ 不推荐使用高精度影视资产制作(细节程度弱于传统专业建模软件)。国内无稳定网络环境的用户(加载慢、上传易失败)。完全零预算且要求商用的项目(免费版禁止商用)。四、免费与付费提示:网页端订阅与 API 定价是两套独立的计费体系。 网页端:积分按月重置。 API 端:开发者独立计费,积分单独充值。1)网页端 Tripo Studio网页端订阅页面:https://www.tripo3d.ai/zh/pricing💡 免费版 (Basic)费用:免费 ($0/月),无需绑定信用卡。积分:每月赠送 300 积分(单并发任务)。功能限制:仅支持单图生成或基础文生 3D。禁止商用,生成模型需遵循 CC BY 4.0 开源协议。无自动绑骨、无超清纹理、无多视图生成。导出格式受限,历史作品仅保存 1 天。🚀 Professional (专业版)费用:月付 $19.9 / 年付 $11.94/月(享 8 折优惠)。积分:每月 3000 积分。并发:支持 10 个并发任务。权益:私有模型、完整商用授权、解锁绑骨功能、超清纹理。📊 Advanced (进阶版)费用:月付 $49.9 / 年付 $29.94/月。积分:每月 8000 积分。并发:支持 15 个并发任务。权益:提供 30 天历史记录保存。🏢 Premium (团队版)费用:月付 $139.9 / 年付 $83.94/月。积分:每月 25000 积分。并发:支持 20 个并发任务。权益:永久保存历史记录。2)Tripo OpenAPI(开发者)定价页面:https://platform.tripo3d.ai新手福利:注册即送 2000 免费积分。充值汇率:$1.00 = 100 积分。扣费标准参考:文生草稿:20 积分。文生精修:30 积分。图生模式:同价。绑骨/高清贴图:额外扣除积分。队列限制:草稿队列 10 个,精修队列 5 个。多视图生成:消耗积分较高。五、网页端使用步骤注册登录:访问官网,点击右上角“开始使用”,通过邮箱注册并验证登录。进入工作台:在 3D 工作界面中,选择生成模式(单张图片 / 文本)。注:多视图生成功能仅在付费版本中可用。输入素材:上传图片:建议 PNG/JPG 格式,大小 ≤5MB,纯色或透明底最佳。填写提示词:包含主体描述、材质要求、风格定位及 PBR 关键词。参数设置:选择模型版本(TripoSF 3.1)。纹理选择(标准 / 超清)。开启 PBR 材质。限制三角面数上限。生成预览:点击生成按钮,等待 10–60 秒,完成实时预览。编辑与导出:付费用户可进行重绘、分割、自动绑骨等编辑。导出为 GLB、FBX 等格式,或直接集成至引擎。六、避坑指南与注意事项⚠️ 网络稳定性服务器在海外,国内直连存在加载慢、上传失败风险。生成任务可能因网络波动导致队列超时,建议优化网络环境。⚠️ 积分体系隔离网页端(Studio)与 API 端的积分完全不互通,切勿混淆消费。充值不通用,需按需分别购买。⚠️ 商用许可红线免费版禁止商用,仅限个人练习。商用必须订阅 Pro 及以上版本,违规可能导致账号被封或作品下架。⚠️ 图片素材要求原图需正面完整,透明背景或纯色背景效果最佳。侧脸、遮挡过多的图片会导致模型背部畸形。多视图生成功能仅限付费解锁。⚠️ 积分重置机制网页端积分每月清零,不累计。生成失败或重试依然消耗积分。⚠️ 功能阉割说明免费版无自动绑骨、无多视角、无私有模型。导出格式受限,历史记录仅保留 1 天,过期即删。⚠️ 支付方式限制付费仅支持境外信用卡。无微信/支付宝支持,国内用户充值较繁琐。⚠️ 模型精度局限人体手指、复杂机械结构等部位容易出现穿模。不适合电影级高精度资产,建议生成后导入 Blender 进行二次修复。⚠️ API 并发限制免费 API 队列极少,批量生成极易排队或失败。商用批量生产建议充值积分。⚠️ 资产备份习惯云端模型有存储时限,重要资产务必导出至本地保存。避免订阅过期导致历史记录丢失无法找回。

Together AI图标

Together AI

Together.ai 使用指南一、平台概览官方网站:https://www.together.ai 官方文档:https://docs.together.ai API 网关:https://api.together.xyz/v1平台定位Together.ai 是一个开源大模型云推理 API 平台。主打方向:Llama3、Mistral、Qwen、DeepSeek 等 200+ 开源模型 高速推理。核心优势:兼容 OpenAI 调用协议(openai-compatible)。免自建 GPU 成本。支持推理 / 微调 / 批量任务 / 专属部署。推理速度优于普通云厂商,单价更低。二、核心功能1. Serverless 对话推理支持能力:文本对话、Function Calling、JSON 模式、流式输出、Embedding 向量。灵活性:一键切换百种开源模型。2. 批量异步推理场景:大批量文本离线处理。优势:价格比实时推理低 50%,支持 30B Token 单任务。3. LoRA 全量微调支持模型:Llama / Mistral / Qwen 等。计费:按训练 Token 计费,轻量化微调。4. 专属部署 (Dedicated Endpoints)特性:独享 GPU、低延迟 SLA、隔离环境。适用:适合生产商用场景。5. GPU 裸机集群配置:H100 / A100 按需租用。用途:模型预训练、大规模实验。6. 在线 Playground 调试工具:网页端快速测试模型参数。产出:直接生成 curl / Python 调用代码。三、适用人群✅ 适合使用开发者 / AI 创业者:需要低成本替代 OpenAI,追求私有化可控的开源模型。RAG / Agent / 代码生成项目:需要稳定的推理 API 接口。算法研究员:快速测试多开源模型、进行小规模微调实验。中小团队:不想运维 GPU,需要按量付费的弹性算力。❌ 不适合使用纯普通用户:无代码能力,无独立对话客户端(需自行配置 OpenWebUI 等)。国内合规商用:无国内节点,无法备案,网络不稳定。极低延迟强实时 C 端产品:免费/按量账户限流严重,延迟不可控。四、免费 & 付费定价1. 免费政策注册福利:新用户注册赠送 $5 免费额度。使用方式:无需绑卡,可用于推理、微调。限制:额度用完需充值才能继续调用,无永久免费 Token 池。2. 付费模式采用预存点数 (Credits) 模式,点数无有效期。服务类型计费标准 / 特点Serverless 推理按输入/输出百万 Token 计价小模型$0.05 ~ $0.2 / M tokens大模型$0.8 ~ $2.5 / M tokens批量推理实时推理价格的 50%(5 折)微调训练 Token 单独计费专属 GPU/裸机按小时包机,需联系销售议价💰 充值说明:最低 $5 起充,仅支持境外信用卡,无微信/支付宝。 🔗 官方定价页面:https://www.together.ai/pricing五、快速使用步骤注册账号:官网邮箱注册,无需海外手机号。获取密钥:控制台进入 API Keys,生成密钥并保存(建议多生成几个)。代码调用:仅修改 OpenAI 的 base_url 即可兼容,代码示例如下:pythonfrom together import Together client = Together(api_key="你的 API_KEY") resp = client.chat.completions.create( model="meta-llama/Llama-3.3-8B-Instruct-Turbo", messages=[ {"role": "system", "content": "你是一位简洁的助手"}, {"role": "user", "content": "介绍 toher.ai"} ] ) print(resp.choices[0].message.content) from together import Together client = Together(api_key="你的 API_KEY") resp = client.chat.completions.create( model="meta-llama/Llama-3.3-8B-Instruct-Turbo", messages=[ {"role": "system", "content": "你是一位简洁的助手"}, {"role": "user", "content": "介绍 toher.ai"} ] ) print(resp.choices[0].message.content) 调试测试:使用网页 Playground 调试参数,复制生成的 curl 或 Python 代码。生产升级:高并发场景建议升级专属 Endpoint (Dedicated Endpoints) 以解除限流。六、避坑指南⚠️ 网络环境风险国内网络:海外服务器,直连经常超时。合规性:无国内节点,无法备案,商用需注意合规风险。⚠️ 限流与额度免费账户:RPM 速率极低,免费/小额充值账户调用循环极易报 429。断服务机制:预存模式,余额归零 API 立刻封禁,无欠费缓冲。生产监控:生产环境务必自行监控用量,避免余额归零。⚠️ 成本与隐藏费用上下文与输出:超大上下文、频繁长输出会快速消耗点数。模型差异:批量任务存储、大模型单价远高于小模型,需仔细计算 Token 成本。⚠️ 账号风控IP 管理:大陆 IP 频繁切换、共享 Key 易封号。密钥管理:不要共用 API 密钥,建议设置 IP 白名单。⚠️ 版权与支付模型版权:Llama 系列需自行获取 Meta 许可,商用需合规授权,平台不提供版权担保。支付渠道:仅支持境外信用卡,充值、退款流程繁琐,无本土化支付渠道。⚠️ 客户端限制工具依赖:仅 API+ 简易 Playground,普通用户无法直接对话,必须搭配 OpenWebUI/OneAPI 等工具。

Runpod图标

Runpod

RunPod 使用指南一、平台介绍RunPod 是海外专为 AI 场景设计的 GPU 云平台,核心优势在于按需租用显卡容器,支持秒级启动 Docker 环境。核心产品线:Community Cloud:社区云,主打低价抢占式资源,存在回收风险。Secure Cloud:安全云,独享稳定实例,适合长时训练,价格稍高。Serverless:无服务器推理,自动弹性扩缩容,按请求计费。资源覆盖:支持 30+ 种显卡型号,全球 30+ 个部署区域。对标竞品:主要对标 AWS/GCP GPU 实例,但价格通常更低。核心场景:专为大模型(LLM)训练、微调、推理、Stable Diffusion AI 绘图等设计。计费亮点:按秒计费,无出站流量费,不用不扣费。二、主要功能1. Pods 长时 GPU 容器环境预装:提供 PyTorch / TensorFlow / LLaMA / SD 等一键模板。连接方式:支持 Jupyter Notebook、SSH 远程连接、端口映射。存储持久化:支持挂载持久化存储(卷),数据不丢失。实例选择:可切换社区机(低价)与独享机(稳定)。2. Serverless 无服务器推理弹性计算:自动扩缩容,闲置时计费归零。API 服务:对外提供 API 接口,适配 LLM 与文生图批量服务。冷启动:响应极快,最低仅需 2 秒。3. 集群 Clusters多卡互联:支持多卡 NVLink 互联。适用场景:适合超大模型分布式训练及企业批量任务。4. 配套工具管理:提供 API / SDK 用于程序化管理实例。监控:内置用量监控、预算告警、自动关机功能。协作:支持团队协作权限分配、自定义 Docker 镜像。三、适用人群分析✅ 适合人群AI 开发者与学生:LLM 微调、Stable Diffusion 绘图、本地硬件跑不动时租用。个人/小团队:搭建私有化 AI API、提供 7×24 小时推理服务。MLOps 从业者:批量推理、分布式训练、寻找低成本替代公有云 GPU 方案。❌ 不适合人群国内合规业务:无国内节点,直连网络存在不稳定性。纯小白用户:无 Linux / Docker / 命令行基础,操作门槛高于可视化 AI 工具。大带宽需求者:存储单独计费,若高频文件传输,成本可能偏高。四、免费 & 付费方案1. 免费政策说明注册权益:注册账号免费开通控制台,查看价格。新户福利:首充满 $10,随机赠送 $5 ~ $500 平台余额(一次性,仅限新用户)。注意:无永久免费 GPU 时长,无免费算力额度,仅赠送抵扣金。2. 付费模式详解Pods 容器计费Community 抢占机:单价极低,但资源随时可能被平台回收,训练需保存断点。Secure 独享机:稳定不中断,单价较高,适合长时间运行任务。计费规则:算力:按实际使用秒数计费。存储:$0.10/GB/月(持久化磁盘),删除 Pod 后停止计费,单纯关机不释放存储。Serverless 推理计费Flex 模式:闲置自动停机,仅运行时扣费(推荐)。Active 模式:常驻实例,随时调用。优惠套餐Savings Plan:预存 3 或 6 个月享受折扣。预留集群:1–12 个月预留集群大幅降价。🔗 官方定价页面(实时更新)总定价页Pod 文档定价Serverless 定价文档五、快速使用步骤注册登录:访问 runpod.io 使用邮箱注册,完成验证。绑定支付:必须添加境外信用卡(Visa/Mastercard/Amex)以解锁 GPU 租用权限。部署 Pods(训练/绘图):进入左侧菜单 Pods → Deploy Pod。选择预制模板或上传自定义 Docker 镜像。选择显卡型号、部署区域、磁盘大小。开启 Jupyter 或 SSH 端口。启动容器,通过网页或 SSH 连接操作。关键设置:务必配置 Auto Shutdown 自动停机,防止超额扣费。部署 Serverless API:进入左侧菜单 Serverless → New Endpoint。填入推理镜像或选择官方模板。设置扩缩容规则、GPU 规格。生成公开 API 地址,直接 POST 调用 JSON。配套配置:进入 Settings 配置 SSH 密钥、API Key,用于代码批量管理。六、避坑重点(高频踩坑指南)1. 网络硬伤问题:国内用户直连加载慢、Jupyter 页面容易掉线、大模型下载极易超时。建议:无国内服务器节点,必须优化网络环境(如配置节点加速或代理),刚需用户请慎重。2. 抢占机中断风险风险:Community Cloud 实例随时可能被平台回收,训练无断点保存会直接丢失进度。建议:长时间训练任务,优先选择 Secure 独享机。3. 扣费隐形坑磁盘计费:磁盘是持续计费的,删除 Pod 才会停止存储扣费。关机不释放:仅仅关闭 Pod 不释放存储卷,关机后仍需支付磁盘费。忘记关机:忘记关机持续跑 GPU,几小时即可产生高额账单。对策:务必开启 Auto Shutdown 自动停机功能。4. 支付限制硬性限制:仅支持境外信用卡,不支持微信/支付宝。虚拟卡:部分虚拟卡可能触发风控导致无法绑定,建议准备多张备用卡。5. 新手门槛技术依赖:平台高度依赖 Linux 和 Docker,可视化操作少。操作要求:不会 SSH、不会命令行(YAML/JSON 配置)极易卡壳。6. 存储成本注意:大模型数据集如果长期挂载,费用较高。建议:用完及时清理无用卷,仅保留必要数据集。7. API 密钥安全风险:API Key 一旦泄露,会被他人占用你的 GPU 算力。建议:禁止将密钥明文上传至公共代码仓库(如 GitHub)。8. 无国内售后现状:工单沟通全英文,故障排查响应慢。注意:无本土化技术支持,需具备独立排查能力。

Vast.ai图标

Vast.ai

Vast.ai 使用指南一、平台介绍Vast.ai 是一个分布式 GPU 算力交易市场。核心模式:撮合个人、机房闲置显卡出租与用户按需租用。主打优势:主打低价 AI 训练/推理 GPU,拥有 2 万 + 显卡、68 种 GPU 型号、40+ 机房。价格远低于 AWS、CoreWeave 等商用云。付费策略:无免费额度/免费试用,纯预付费按量计费。角色分类:租客:租显卡跑 AI。主机:出租自有显卡赚佣金(账号需分开)。二、主要功能Vast.ai 提供了全方位的 GPU 云算力支持:GPU Marketplace 筛选:可按显存、GPU 型号、价格、内存、带宽、机房、是否可抢占等维度筛选机器。预制 Docker 模板:提供 PyTorch、TensorFlow、Oobabooga、ComfyUI、vLLM 推理等开箱即用镜像。多连接方式:支持 SSH、Jupyter、WebUI 直连实例,支持自定义启动命令。Serverless 推理端点:支持一键部署 LLM/图生图 API,具备自动扩缩容能力。程序化管理:提供 Python SDK、CLI、完整 REST API,支持批量创建/销毁实例。团队与权限管理:包含团队权限、存储挂载、带宽自定义、主机出租后台等功能。三种租赁模式:按需(On-demand):稳定,不回收。抢占(Interruptible):便宜,随时回收。预留(Reserved):长租享折扣。三、适用人群✅ 适合使用AI 个人开发者、学生:适合 LLM 微调、Stable Diffusion 绘图、模型测试。小团队/独立算法:适合短期训练、批量实验、临时推理服务。算力预算有限者:不要求 7×24 稳定生产环境。闲置显卡变现者:自有闲置显卡,想出租赚佣金的主机用户。❌ 不适合使用企业正式生产:不适合涉密数据、要求高 SLA 可用性的场景。特定网络要求:不适合需要国内低延迟、内网合规部署的场景。零基础小白:不适合完全不懂 SSH/命令行、纯白鼠用户。四、免费 & 付费定价💰 免费政策无永久免费、无免费试用。注册即 0 余额,必须预充值才能创建实例。最低充值金额:5 美元。📝 计费规则计费粒度:秒级计费(不四舍五入)。显卡租金:分抢占(便宜 50%+,随时回收)/ 按需(稳定不回收),价格随市场浮动。磁盘费:只要实例存在就扣费,停机不减免。带宽费:进出流量单独计价,不同机器带宽单价差异大。预留长租:长期锁定机器可享折扣。🌐 实时定价与参考请随时访问实时定价页面查看最新价格:https://vast.ai/pricing主流显卡参考区间(抢占低价):RTX 3090:$0.13+ /小时RTX 4090:$0.28+ /小时RTX 5090:$0.37+ /小时H100 80G:$1.73+ /小时H200:$3.5+ /小时💳 支付方式支持 Visa / Mastercard 信用卡。支持加密货币(BitPay / Crypto.com)。不支持:支付宝、微信。五、完整使用步骤(租客版)步骤 1:注册账号 注册邮箱账号并完成验证。步骤 2:充值余额 进入 Billing 页面,Add Credit 充值(建议 10 美元起步)。步骤 3:上传 SSH 公钥 在 Keys 页面上传本地 SSH 公钥(SSH 连接必备)。步骤 4:选择镜像 在 Templates 选择预制镜像(如 Oobabooga/ComfyUI/PyTorch)。步骤 5:筛选 GPU 进入 Search 页面,按显存、价格、抢占/按需、磁盘大小、带宽筛选机器。步骤 6:配置与启动配置磁盘容量(注意:磁盘创建后不可扩容)。点击启动实例。步骤 7:连接实例 等待 3–5 分钟初始化完成,点击 OPEN 进入 Jupyter/WebUI。步骤 8:销毁资源 使用完毕后,必须手动销毁实例。仅停机仍会持续扣取存储费用。六、核心避坑指南⚠️ 网络国内痛点连接速度:海外服务器,直连加载慢、Jupyter 打不开、模型下载超时,需提前优化网络。带宽差异:机房带宽参差不齐,低价机器上行带宽极低,传输大模型极慢。💸 计费大坑暂停≠免费:实例仅暂停(暂停状态)依然会扣费,不用必须 Destroy 销毁实例。抢占风险:抢占机随时被主机回收,训练可能中断,重要任务选 On-demand。流量收费:流量单独收费,大批量下载模型会产生高额账单。余额预警:余额不足实例直接停机,未保存数据丢失,建议开启余额提醒。🛑 实例限制磁盘限制:空间创建后无法扩容,请务必预估模型大小预留充足空间。证书问题:Jupyter 浏览器证书报错(macOS 常见),需安装平台证书,否则直接拦截。环境稳定性:低价家用主机机房环境不稳定,死机、重启概率高于专业机房。🔒 安全 & 合规数据安全:散户主机无企业级安全隔离,严禁上传敏感/商业涉密数据。凭证安全:API Key、SSH 私钥勿公开泄露,他人可消耗账户余额。合规风险:平台不支持国内合规资质,企业商用存在版权、数据合规风险。🛠 其他注意事项客服支持:无客服工单快速通道,故障主要靠 Discord 社区求助。充值流程:支付仅境外卡,充值、退款流程相对繁琐。管理工具:无移动端 APP,只能通过网页或 CLI 管理实例。

WaveSpeedAI图标

WaveSpeedAI

WaveSpeedAI 使用指南一、平台介绍WaveSpeedAI(wavespeed.ai/zh-CN)是一个位于新加坡的多模态 AI 推理聚合平台。核心定位:提供一站式统一 API 服务,聚合 1000+ 主流文生图、视频、语音、数字人及 3D 模型(如 FLUX、可灵、Seedance、Veo、Suno 等)。技术优势:自研加速 GPU 集群,提供低延迟推理服务。使用体验:配备网页 Playground 零代码调试工具,支持按量计费,无强制订阅。服务对象:面向创作者、独立开发者及企业用户。二、核心功能1. 图像生成基础能力:文生图、图生图、超分辨率、扩图、换背景。人像优化:支持 Nano Banana 人像模型。高级功能:支持 LoRA 模型的加载与训练。2. 视频生成核心能力:文生视频、图生视频。进阶效果:长视频分段、电影级运镜、4K 输出。数字人:支持 AI 数字人唇形同步(Talking Head)。3. 音频能力声音合成:AI 配音、多语种音色选择。音乐生成:Suno 音乐生成。其他:音效生成。4. 模型训练无代码操作:提供无代码 LoRA 微调功能。训练方式:直接上传图片包即可训练专属人物或风格模型。5. 统一 API兼容性:兼容 OpenAI 格式。集成支持:一套密钥调用全品类模型,支持回调与批量任务。6. 配套工具开发支持:提供网页在线画布、Python/JS SDK、CLI 工具、ComfyUI 插件。管理:支持任务历史记录查询。7. 企业能力服务保障:专属 GPU 资源、99.99% SLA 保障。商务支持:批量折扣、私有部署、发票对公结算。三、适用人群✅ 适合使用独立开发者 / AI 工具创业者:快速集成图文视频能力,避免对接多家模型厂商。短视频 / 电商设计师:批量生成商品图、营销短片、虚拟主播素材,快速出稿。自媒体 / 短剧团队:低成本制作 AI 成片、数字人解说、配音一体化。AI 研究 / 算法爱好者:横向对比各类 SOTA 模型,以低成本测试效果。中小企业 / 广告公司:搭建内部 AI 内容生产流水线。❌ 不适合使用纯国内内网业务(平台为海外服务器)。无境外支付渠道的用户(需境外信用卡/PayPal)。追求完全免费重度生产(免费额度极低)的用户。四、免费 & 付费详情1. 免费额度注册赠送:新用户注册即送 $1 免费余额。使用限制:无需绑卡即可使用;仅基础轻量模型可用。消耗说明:高端视频/人像模型消耗余额更快。续用方式:额度用完需充值才能继续使用。2. 付费模式计费方式:按量计费,无月租。扣费规则:按单次生成扣费,价格随模型、分辨率、视频时长浮动(每个模型页面均标注单价)。账户等级:通过累计充值升级,可提升并发/限流上限:青铜(默认)白银(累计 $100)黄金(累计 $1000)至尊(累计 $10000)支付方式:支持 Visa/Mastercard、PayPal、企业电汇、加密货币。企业方案:提供大额批量折扣、专属客服、SLA 保障及对公发票。官方定价页(实时最新):https://wavespeed.ai/zh-CN/pricing五、使用步骤方式 1:网页零代码创作(普通用户)登录:打开官网,右上角点击 Sign In,支持 Google 或 GitHub 登录。浏览:首页浏览模型库,选择图像/视频/数字人模型进入 Playground。设置:填写提示词、上传参考图、调节分辨率/时长/风格参数。生成:点击 Run 生成,在 Run History 查看并下载成品。充值:余额不足时前往充值页面充值美元余额。方式 2:API 代码调用(开发者)获取密钥:登录后台 → API Keys,创建并保存密钥(首次完整显示)。接口地址:基础接口为 https://api.wavespeed.ai/api/v3。请求方式:参考 SDK/文档编写请求,统一鉴权 Header 为 Authorization: Bearer 密钥。任务机制:支持同步/异步任务,长视频/大图需轮询接口获取最终结果。最简 API 请求 JSON 示例(文生图):json{ "model_id": "flux/flux-2-max", "inputs": { "prompt": "赛博朋克城市夜景,8k 高清", "negative_prompt": "模糊、低画质、畸形", "width": 1024, "height": 1024, "steps": 28 } } { "model_id": "flux/flux-2-max", "inputs": { "prompt": "赛博朋克城市夜景,8k 高清", "negative_prompt": "模糊、低画质、畸形", "width": 1024, "height": 1024, "steps": 28 } } 六、避坑重点1. 网络限制平台为海外服务器,国内直连易导致加载慢、任务超时或图片加载失败。建议刚需用户优化网络环境。2. 扣费规则用户参数错误或违规(如 NSFW)触发失败,仍可能扣费。平台服务器故障导致失败的情况,会自动退款。3. 免费额度限制$1 试用余额仅能少量测试高端模型,正式批量生产必须充值。4. LoRA 训练坑预估时长可能不准,极易超时。仅支持 safetensors 格式模型,从 Civitai 下载需自行转换格式。5. 并发限流青铜账户并发较低,批量生成会频繁排队。大额充值升级等级后,可提升并发上限。6. 支付门槛平台不支持微信/支付宝。国内个人充值依赖境外信用卡或 PayPal。企业对公结算仅支持电汇。7. 版权风险各模型的商用授权条款独立,平台不统一兜底。商用前务必核对对应模型的版权条款。8. 视频异步机制长视频任务为异步处理,接口不会即时返回结果,必须循环轮询获取状态。9. 数据留存任务历史仅保存一段时间,重要素材务必及时本地下载备份。

OCRmyPDF图标

OCRmyPDF

OCRmyPDF 实用指南核心定位:开源、安全、高效的命令行 PDF OCR 工具,Python 开发,底层基于 Tesseract OCR、Ghostscript、qpdf。📜 开源协议:MPL-2.0(可商用,修改源码需公开)一、主要功能OCRmyPDF 不仅仅是简单的文字识别,它专注于“增强 PDF":生成可检索 PDF/A:默认输出存档标准 PDF/A,也可切换为普通 PDF。图像智能预处理:自动纠偏(--deskew)页面旋转校正(--rotate-pages)降噪与对比度增强多语言混合识别:支持中英文混扫(-l chi_sim+eng)及百种语言。性能优化:批量/单文件处理原地覆盖输出(-f)多核 CPU 加速(--jobs N)PDF 压缩优化输出辅助文件:导出纯文本副文件(--sidecar)。高级控制:跳过已有文本页面强制重 OCR(--force-ocr)修复损坏 PDF元数据自定义部署方式:提供 Python 库 API、Docker 镜像、简易 Web 服务插件。二、适用人群与场景✅ 适合使用程序员/运维:构建自动化档案处理、批量扫描 PDF 流水线。办公/档案管理员:纸质扫描件数字化归档。学生/研究员:古籍、扫描教材、论文批量文字提取。私有部署需求:敏感文档本地离线处理,拒绝上传云端。❌ 不适合使用纯小白用户:无命令行基础(原生无 GUI,需安装第三方封装)。单图提取需求:仅提取单张图片文字时,直接使用 Tesseract 更轻量。移动端用户:无移动端客户端。三、免费与付费说明💰 核心程序:100% 免费开源本体:所有命令行参数、Python API 全部免费。无限制:无官方订阅、无付费套餐、无额度限制、无水印。无定价页面:官方无任何收费渠道。依赖组件:Tesseract、Ghostscript 均为开源免费。⚠️ 第三方付费警告App Store 同名客户端:一次性$4.99 授权,非作者开发。功能限制:仅封装命令行,不推荐。风险:可能涉及隐私上传风险,建议使用官方开源版。四、安装指南重要提示:必须先安装系统级依赖(Tesseract、qpdf 等),仅 pip 安装会导致功能缺失。1. Windows 用户(推荐 WSL2)在 Windows 原生上兼容性较差,建议使用 WSL(Ubuntu)。bash# WSL Ubuntu 环境 sudo apt install ocrmypdf tesseract-ocr tesseract-ocr-chi-sim 2. macOS 用户使用 Homebrew 快速安装。bashbrew install ocrmypdf tesseract tesseract-lang 3. 通用 Python 安装在系统依赖装好后,通过 pipx 安装 Python 包。bashpipx install ocrmypdf 五、使用命令示例1. 基础 OCR输出默认 PDF/A 格式。bashocrmypdf input.pdf out.pdf 2. 进阶处理(多语言 + 纠偏 + 压缩)bashocrmypdf -l chi_sim+eng --deskew --optimize 2 scan.pdf search.pdf 3. 强制重 OCR若 PDF 内已有文字层,默认会跳过。如需强制重扫(将矢量文字转为图片)。bashocrmypdf --force-ocr in.pdf out.pdf 4. 导出副文件原地覆盖输出,并生成独立 TXT 文本。bashocrmypdf --sidecar out.txt input.pdf 5. Python API 调用极简代码示例。pythonimport ocrmypdf ocrmypdf.ocr( "scan.pdf", "search.pdf", language=["chi_sim", "eng"], deskew=True ) 六、避坑指南1. 中文乱码 确保安装了中文语言包:tesseract-ocr-chi-sim。多语言识别时必须使用 -l 语言 1+语言 2 格式。2. 报错 page already has text 原生带文字 PDF 默认会被跳过。需加 --force-ocr 强制重扫,注意这会破坏矢量文字层,将其转为图片。3. Windows 兼容性问题 原生 cmd/Powershell 兼容性差,优先推荐 WSL2 或 Docker 环境。仅 pip 安装容易缺失 Ghostscript 等系统依赖。4. 分辨率误区 300 DPI 是最优平衡点。600 DPI 以上会大幅拖慢速度,且识别精度无显著提升。5. 隐私风险 确保使用 离线本地版。切勿使用第三方封装的 GUI 软件,避免文件被偷偷上传。6. 大文件内存溢出 处理千页以上扫描件时,建议加 --jobs 2 限制线程,降低并行内存占用。7. PDF/A 兼容性 若部分老旧阅读器打不开,可加 --output-type pdf 输出普通 PDF 格式。8. 文件损坏风险 使用原地覆盖(-f)时,若程序中途崩溃会损坏原文件。建议先生成新文件再手动替换。9. 复杂版面识别错位 多栏文档识别异常时,尝试加 --pagesegmode 6 调整版面分割模式。10. 安装失败 若安装报错,请检查是否安装了系统级组件(Tesseract、qpdf、unpaper)。

EasyOCR图标

EasyOCR

EasyOCR 使用指南官网地址:https://www.jaided.ai一、平台介绍Jaided AI 成立于 2020 年,主打 OCR 文字识别,核心产品分为两条线:EasyOCR:开源免费的 Python OCR 库。GitHub 拥有 29k+ 星标。支持全球开发者本地使用,并提供网页 Demo 在线测试。Cloud Document AI(企业云 OCR):提供商用云端 API 及私有化本地部署方案。面向企业的票据、证件、KYC 文字提取需求。定位:通用多语言文字识别,兼顾个人轻量试用、开发者本地集成、企业批量文档处理。二、主要功能1. EasyOCR(开源核心)语言支持:支持 80+ 种语言,包括简/繁体中文、英文、日韩、阿拉伯、西里尔文字等混合识别。场景适配:适用于屏幕截图、纸质文档、模糊街景文字、倾斜图片。输出内容:提供文字内容、坐标框、置信度;支持批量图片处理及图像预处理(去噪/旋转)。训练与运行:支持自定义训练模型,可配置 GPU/CPU 双模式运行。2. Cloud Document AI(企业付费云服务)高级功能:布局分析、表格结构化提取、表单字段识别。证件识别:Identity Reader 功能,支持身份证/护照证件自动解析(KYC 核验)。其他识别:二维码/条码同步识别、签名定位。部署方式:支持云端 API 调用、私有化部署、批量异步处理、数据标注工具。三、适用人群✅ 适配人群开发者:Python 项目本地 OCR 集成、爬虫图文提取、小程序或工具内置文字识别。学生/个人:截图转文字、扫描件提取文本、批量试卷或笔记电子化。中小企业财务:发票、收据、合同批量信息导出。金融/跨境行业:KYC 证件自动录入、客户身份材料识别。❌ 不适合人群纯无代码普通用户:企业版操作相对复杂,无傻瓜式网页工作台。超高精度印刷票据/手写体需求:此类场景专用票据 OCR 效果通常更强。四、免费 & 付费详情1. 免费资源(永久可用)EasyOCR 开源库:完全免费且可商用,支持本地离线运行,无调用限额。EasyOCR 在线 Demo:https://www.jaided.ai/easyocr/单次上传图片测试。限制:单图 2MB 上限,无批量功能,结果临时展示(刷新丢失)。2. 付费:Cloud Document AI 企业云服务定价页面:https://www.jaided.ai/pricing套餐模式:按量计费:按识别图片页数扣费,适合低频零散需求。月度订阅包:固定额度,适合每日批量文档处理。私有化部署:一次性授权 + 年费维护,数据不上传外网。支付限制:仅支持境外信用卡,无微信/支付宝国内充值通道。试用:官网可申请少量云端 API 测试额度(需注册企业邮箱)。五、使用方法(三条路线)路线 A:个人在线快速试用(无需代码)访问官网 Demo:https://www.jaided.ai/easyocr/上传图片,选择语言(如 ch_sim+en)。一键识别,复制带坐标或纯文本结果。路线 B:开发者本地集成(EasyOCR 开源)安装库:bashpip install easyocr 最简代码示例:pythonimport easyocr # 加载简中 + 英文模型 reader = easyocr.Reader(['ch_sim','en'], gpu=False) # 识别图片 res = reader.readtext("test.jpg") # 打印纯文本 for box, text, score in res: print(text) 完整教程:https://jaided.ai/easyocr/tutorial/路线 C:企业云端 API 调用官网注册企业账号,获取 API Key。调用官方 V1 识别接口,支持同步/异步批量任务。配套文档:https://jaided.ai/documentai/docs六、避坑点⚠️ 注意:国内访问相关服务请注意网络环境,以下坑点请务必知晓。网络问题(国内最大坑)官网、在线 Demo 及企业云服务器均在海外,直连常出现加载慢、上传超时。建议:开源本地库不受网络影响,优先离线部署;国内用户请准备代理环境。EasyOCR 性能短板CPU 识别大图速度极慢,批量处理建议配置 GPU。手写文字、极小字体、强光反光图片准确率会大幅下跌。首次运行需自动下载数百 MB 语言模型,离线环境需提前手动导入模型文件。免费 Demo 限制单图 2MB 上限、不支持 PDF 格式、无批量导出功能。结果仅临时展示,刷新页面后记录丢失,不适合工作流集成。企业版成本与合规云端 API 长期批量使用成本较高。涉密证件、票据数据不能上云,必须选私有化部署。付费仅支持境外信用卡,无国内充值渠道。商用版权区分EasyOCR 开源库:允许免费商用。Cloud Document AI:产出物商用需遵守订阅协议,不可超额度转发 API 能力。多语言兼容坑繁/简体中文模型不能混用。同时加载多语种会大幅占用内存、降低速度,建议按需只加载所需语言。

Umi-OCR图标

Umi-OCR

Umi-OCR 使用指南一、平台介绍Umi-OCR 是一款国产离线开源 OCR 工具,基于 PaddleOCR 引擎开发,采用 MIT 开源协议。安全隐私:全程本地运算,不上传图片,彻底杜绝云端隐私泄露风险。网络要求:断网可用,完全离线运行。系统支持:兼容 Windows/Linux x64 架构。安装方式:解压即用,无需安装,无驱动依赖。二、核心主要功能1. 截图识别自定义快捷键:支持设置全局热键,快速框选屏幕区域。多源识别:支持点击屏幕截图识别,也支持复制图片后粘贴识别。智能排版:识别后自动合并自然段,优化文本格式。2. 批量图片 OCR无限数量:拖入图片或文件夹即可处理,无数量上限。区域屏蔽:支持设置忽略区域,自动跳过水印、页眉、页脚。多格式导出:支持导出为 TXT、MD、CSV、JSONL 等多种格式。3. 批量 PDF 文档扫描件处理:针对扫描版 PDF 提取文字。PDF 优化:生成的 PDF 为双层可检索格式,方便后期编辑与搜索。4. 附加识别能力多模态解析:支持二维码解析与生成。特殊文本:内置数学公式识别、竖排文本适配功能。多语言支持:内置简繁中、英、日、韩、俄、德、法等语言模型,支持手动扩充。5. 外部集成与后处理接口调用:提供 HTTP 接口与命令行支持,可对接自动化脚本或第三方软件。文本清洗:自动合并自然段,去除多余换行,过滤干扰文字。三、适用人群✅ 推荐适用人群学生群体:课件截图、黑板照片、论文文献、公式提取。职场办公:合同/发票扫描件、截图文案、批量资料数字化。隐私敏感用户:财务单据、身份证、内部机密(需本地处理,不上传云端)。自媒体创作者:网页截图、视频字幕提取。开发者:本地 OCR 接口二次开发、自动化工具集成。❌ 不适合使用场景MacOS 用户:无官方原生客户端,需依赖虚拟机或 WSL,体验不佳。老旧硬件:无 AVX 指令集的老旧 CPU 无法启动 Paddle 引擎。移动端用户:不支持手机或平板直接运行。32 位系统:仅支持 x64 架构操作系统。四、免费/付费情况完全免费:100% 永久免费,无付费版本、无会员、无次数限制、无软件水印。开源协议:源码完全开源,个人及商用均可自由使用、二次修改及分发。无隐形消费:无定价页面,不存在付费套餐或充值渠道。模型扩展:仅可选额外下载多语言模型包,所有扩展资源均免费。五、快速使用步骤软件安装下载 Release 版本压缩包,解压至任意文件夹。直接运行 Umi-OCR.exe 即可启动。截图识别进入 设置 -> 快捷键,绑定截图热键(默认为 Win + Alt + C)。按下快捷键框选区域,软件自动输出文本,支持一键复制。批量识别切换至「批量 OCR」模式。拖入图片文件,设置「忽略区域」框选水印等干扰内容。点击开始任务,处理完成后批量导出文件。PDF 识别切换至「批量文档」模式。导入 PDF 文件,批量提取文字内容。剪贴板快捷识别从网页或微信复制图片后,软件点击「粘贴图片识别」即可完成。进阶开发开启 HTTP 接口功能。通过代码调用本地 OCR 服务,实现程序化调用。六、避坑点(高频问题与解决方案)1. 硬件兼容坑问题:老 CPU 无 AVX 指令集无法启动 Paddle 引擎;32 位系统无法运行。解决:需切换 RapidOCR 引擎;确认系统为 x64 架构。2. 多屏缩放异常问题:多显示器 Windows 缩放比例不一致,导致截图画面错位、识别失败。解决:统一所有显示器缩放比例,或使用系统自带截图工具截取后导入。3. 大图识别模糊问题:超长截图或超大图片出现识别残缺、漏字。解决:在 设置 中调高「限制图像边长」数值,或分块识别。4. 硬盘占用大问题:完整多语言模型包体积超 1GB。解决:若仅用中文,可在模型目录删除多余的语言模型包以节省空间。5. 忽略区域逻辑误区问题:忽略框仅能屏蔽固定水印,动态不规则水印无法彻底清除。解决:复杂图片建议单张手动剔除干扰区域,或使用图像预处理工具先修复。6. Mac 用户限制问题:无官方 Mac 客户端。解决:只能通过虚拟机或 WSL 运行,体验不如本地客户端。7. 杀毒误报问题:解压包易被 Windows Defender 拦截。解决:添加解压目录至杀毒软件白名单;软件无病毒,开源源码可自查。8. 离线模型更新问题:新增语种无在线自动下载功能。解决:需手动下载模型文件,并按指定路径放入目录。9. 接口安全风险问题:HTTP 接口默认本地开放。解决:切勿暴露公网 IP,避免他人调用占用本地算力;内部使用建议设置密码或限流。10. 批量任务卡顿问题:一次性导入上千张图会导致内存飙升,处理变慢。解决:建议分批次处理,避免单次内存溢出。

PaddleOCR图标

PaddleOCR

AI Studio PaddleOCR 使用指南📚 简介:本文档旨在帮助用户全面了解百度 AI Studio 平台上的 PaddleOCR 工具,涵盖平台定位、核心功能、适用场景、费用说明、使用步骤及避坑指南,助您快速上手云端 OCR 训练与识别。一、平台介绍1. 核心构成PaddleOCR:百度飞桨开源 OCR 算法套件,遵循 Apache2.0 协议,完全开源且免费。AI Studio:百度云端在线算力与代码运行平台。环境优势:内置 PaddleOCR 全套环境,无需本地配置。运行模式:支持在线推理、模型微调、API 调用、可视化图片上传识别。2. 平台定位首选方案:国内免费中文 OCR 首选的云端实训平台。一站式服务:提供从图片/PDF 文字识别、定制模型训练到线上接口调用的完整流程。网络优势:国内网络访问无障碍,延迟低,速度快。3. 生态配套在线识别页:提供前端无代码识别体验。Notebook 环境:支持代码开发与模型训练。API 服务:开放接口供程序调用。案例库:提供行业微调案例库及完整教程。二、主要功能1. 网页端零代码识别操作方式:直接拖拽上传 JPG/PNG/PDF/TIFF 文件。核心能力:自动版面分析、文字提取、表格还原。后期处理:支持在线校对,并支持导出为 TXT / Markdown / JSON 格式。2. Notebook 代码全流程能力基础推理:涵盖通用中英文、手写体、票据、表格等多种场景。模型微调:支持上传自定义数据集,训练专属模型(如车牌、证件、小票、古籍等)。数据工具:内置文字合成工具、标注工具及数据集预处理功能。模型导出:支持导出 Paddle 推理模型及 ONNX 格式,适配本地或移动端部署。3. 开放 API/MCP 远程调用获取 Token:复制个人 Access Token 即可使用。批量服务:服务端支持批量识别 PDF/图片,适合程序自动化处理。返回结构:提供包含文字、坐标、置信度的结构化 JSON 数据。4. 配套资源库预训练模型:预置 PP-OCRv4、PaddleOCR-VL 多模态文档解析模型。学习资源:提供免费数据集、完整教程及可直接 Fork 运行的案例项目。三、适用人群与场景✅ 适合人群学生与算法新手:零成本学习 OCR 技术、深度学习模型训练。个人办公用户:日常扫描 PDF、证件、票据的文字提取需求。中小开发者:快速验证 OCR 需求、实现批量识别、进行私有化模型训练。中小企业:内部文档数字化、票据识别场景,低成本验证业务方案。❌ 不适合场景高并发商用生产:免费 API 每日额度有限,高流量业务需切换至百度智能云付费 OCR。离线无网环境:AI Studio 依赖云端算力,若需离线使用,必须本地部署 PaddleOCR。四、免费 & 付费详情1. AI Studio 云端算力(Notebook 运行)免费规则:每日发放 8 点 GPU 算力(对应 V100 16G),1 算力=1 小时。有效期:24 小时。CPU 环境:永久不限时。额外获取:签到、做任务、参赛可兑换额外算力卡。存储空间:固定 100G 免费。付费扩容:算力不足时可购买付费算力卡。定价页:https://aistudio.baidu.com/aistudio/pay2. PaddleOCR 网页在线识别(前端体验页)识别次数:登录账号后 无限次 免费识别。未登录状态:每日提供 3 次 试用,无收费项目。网址:https://aistudio.baidu.com/paddleocr3. AI Studio 开放 API 调用免费额度:单模型每日 3000 页 PDF/图片识别。单次限制:单次最多处理 100 页。超量处理:超出额度将返回 429 限流错误。商用扩容:需跳转 百度智能云文字识别 按量计费。4. 开源代码包(本地 pip 安装)费用:永久完全免费。限制:无任何调用额度、商用限制。五、快速使用步骤方式 1:零代码网页识别(最快上手)打开网址:https://aistudio.baidu.com/paddleocr。使用百度账号登录。上传图片或 PDF 文件,系统自动执行版面解析与文字识别。在线修改识别错误后,导出为 JSON/TXT/Markdown 格式。方式 2:Notebook 代码训练/推理(开发模式)进入 AI Studio 首页,创建新项目,选择 Python Notebook。运行以下代码拉取 PaddleOCR 并安装依赖:python!git clone https://gitee.com/paddlepaddle/PaddleOCR.git %cd PaddleOCR !pip install -r requirements.txt from paddleocr import PaddleOCR # 初始化模型,开启角度分类,选择中文语言包 ocr = PaddleOCR(use_angle_cls=True, lang="ch") # 进行图片识别 res = ocr.ocr("test.jpg", cls=True) !git clone https://gitee.com/paddlepaddle/PaddleOCR.git %cd PaddleOCR !pip install -r requirements.txt from paddleocr import PaddleOCR # 初始化模型,开启角度分类,选择中文语言包 ocr = PaddleOCR(use_angle_cls=True, lang="ch") # 进行图片识别 res = ocr.ocr("test.jpg", cls=True) 上传自有数据集,执行微调训练脚本,最后导出模型权重。方式 3:API 批量调用(自动化)在控制台找到并复制个人 Access Token。在程序中调用官方接口,将图片转为 Base64 编码传参。接收包含结构化文字、坐标、置信度的 JSON 响应。六、避坑点与注意事项⚠️ 算力时效管理每日发放的算力 24 小时清零。建议:优先消耗快过期的算力;大模型训练建议集中当日算力一次性跑完,不要拆分多天。⚠️ API 额度限制免费每日上限 3000 页。批量处理大批量文件容易触发 429 限流。建议:正式商用业务务必切换到百度智能云付费 OCR 服务。⚠️ 文件大小与存储PDF 限制:网页单 PDF 上限 500 页。图片限制:单图大小不超过 20MB。超大文件处理:建议本地分割后分块上传。存储上限:总存储空间 100G。数据集、模型占用过高会导致无法上传新文件,请定期清理无用图片和权重包。⚠️ 网络与环境问题拉取代码:国内网络偶尔超时,建议切换 百度镜像源。GPU 问题:若遇到 GPU 内核卡死,尝试重启内核即可恢复。⚠️ 微调门槛与商用授权数据标注:自定义数据集需严格规范标注格式,标注错误会导致识别精度暴跌。新手建议优先使用预训练模型推理。授权区分:AI Studio 云端 API 仅用于学习验证;正式商用必须购买百度智能云 OCR 服务;本地开源 PaddleOCR 无商用限制。⚠️ 移动端部署限制AI Studio 仅负责训练和导出模型。注意:无法直接打包 APP,需自行搭配 Paddle Lite 进行移动端部署。附:API 返回极简 JSON 示例json{ "code": 0, "msg": "success", "data": [ { "text_box": [[10,20],[300,20],[300,50],[10,50]], "text": "百度 AI Studio PaddleOCR", "score": 0.987 } ] } { "code": 0, "msg": "success", "data": [ { "text_box": [[10,20],[300,20],[300,50],[10,50]], "text": "百度 AI Studio PaddleOCR", "score": 0.987 } ] }

YOLO图标

YOLO

Ultralytics YOLO 使用指南一、平台介绍1. 文档站定位 Ultralytics 官方中文技术手册,网址为 docs.ultralytics.com/zh。它是 YOLO 系列(v5/v8/v11/YOLO26)全版本的本地代码、云端 Platform 操作、API、部署及许可证规范的完整参考。2. 底层核心架构本地开源框架:Ultralytics YOLO 开源 Python 计算机视觉框架。云端 SaaS 平台:配套 Ultralytics Platform 云端训练、标注、部署服务。场景覆盖:支持本地离线训练 + 云端平台双场景,提供代码示例、参数说明、故障排查及导出教程。二、主要功能1. 开源框架能力(本地代码)视觉任务:覆盖目标检测、实例分割、姿态估计、OBB 旋转框、图像分类 5 大任务。模型尺寸:提供 n/s/m/l/x 多尺寸轻量化预训练模型,支持速度与精度的自由取舍。训练流程:支持一键训练/验证/预测/导出,兼容自定义数据集与 yaml 配置。模型导出:支持 19 种导出格式(TFLite、TensorRT、ONNX、CoreML、OpenVINO 等),完美适配边缘与移动端设备。2. 云端 Ultralytics Platform文档站对该平台功能提供全覆盖指引。AI 辅助标注:集成 SAM3 自动标注技术,支持框/多边形标注。云端训练:提供 H100/B200/5090 等高端 GPU,支持实时指标监控。全球部署:支持全球 43 区域一键云端部署与推理监控。团队管理:具备团队协作、数据集版本管理及 REST API 调用功能。3. 文档站配套功能完整查阅:提供中文 API、命令行、配置参数的完整文档查阅。硬件教程:包含树莓派、安卓、服务器等硬件的部署教程。合规指引:提供许可证区分、商用授权申请指引及常见报错解决方案。三、适用人群✅ 适合人群学生/算法研究者:进行目标检测实验、毕业设计或开源项目开发。视觉开发者:应用于工业检测、安防监控、自动驾驶、机器人识别等领域。中小技术团队:快速落地轻量化视觉方案,支持零代码云端训练。嵌入式工程师:处理模型量化、边缘设备部署相关工作。❌ 不适合人群零 Python 基础用户:若无编程基础且仅想获取开箱即用的商用成品系统。内网隔离单位:无法访问海外云端服务的政企单位(需考虑网络连通性)。四、免费与付费方案1. 开源代码(本地离线)协议:永久免费,遵循 AGPL-3.0 开源协议。核心限制:若用于闭源商用产品或硬件嵌入,必须公开全部项目代码;否则需购买企业商业授权。2. Ultralytics Platform 云端 SaaS 定价定价页面参考:https://www.ultralytics.com/zh/pricing🟢 Free 免费版($0/月)注册福利:赠送$5云训练额度;企业邮箱验证可升级$25。资源限制:100GB 存储、3 并发训练、3 云端部署、100 个模型。服务支持:社区技术支持。🟠 Pro 专业版($29/席位/月)资源升级:500GB 存储、10 并发训练、5 人团队协作、优先客服。额外福利:每月$30 云算力额度。优惠:年付$290 可省 17%。🔵 Enterprise 企业版(定制报价)资源无限:无限存储/训练/部署额度。高级功能:SSO 登录、专属技术支持。核心权益:提供企业商用授权(规避 AGPL 开源强制要求)、本地部署方案。3. 企业商业授权(单独付费)申请页面:https://ultralytix.com/license作用说明:针对商用产品、硬件内置、SaaS 服务等场景,无需开源代码;支持按需定制报价。五、快速使用流程方式 1:本地离线训练(无需登录云端)安装环境:参照文档站教程执行 pip install ultralytics。极简代码训练:pythonfrom ultralytics import YOLO model = YOLO("yolo26n.yaml") model.train(data="coco128.yaml", epochs=100) from ultralytics import YOLO model = YOLO("yolo26n.yaml") model.train(data="coco128.yaml", epochs=100) 模型操作:使用 model.predict() 进行推理,使用 model.export(format="tensorrt") 进行导出。方式 2:云端 Platform(文档站 quickstart 指引)账号准备:在官网注册账号,验证邮箱领取初始算力额度。云端训练:上传数据集 → 使用 AI 标注 → 选择预训练模型启动云端 GPU 训练。模型获取:在浏览器中测试模型效果,支持一键云端部署或下载权重至本地使用。六、避坑指南⚠️ 许可证大坑(最高优先级) AGPL-3.0 协议的传染性极强。若在闭源商用、硬件内置或对外 API 服务场景下不公开源码,存在严重的开源合规纠纷。建议:涉及上述场景,必须购买 Enterprise 企业授权 或进行源码开源。国内网络问题云端平台、预训练权重、文档图片需直连海外,国内下载/加载易慢或超时。建议:本地训练前,建议提前离线下载所需权重文件。免费额度消耗H100/B200 等高端 GPU 计算资源扣费高。建议:实验阶段优先选择低配 GPU 以节省额度。数据集格式报错必须严格遵循 YOLO 格式(txt 标注)。要求:数据集路径不能包含中文或空格,建议使用标准校验脚本进行验证。边缘导出兼容低版本 TensorRT/TFLite 可能不兼容新版 YOLO。建议:查阅文档中的“部署章节”进行版本匹配清单核对。云端并发限制免费版仅支持 3 个并行训练任务。建议:批量实验或运行多项目时,建议升级至 Pro 版以避免排队。本地显存溢出若遇显存不足,可尝试小模型参数:imgsz:缩小分辨率。amp=False:关闭混合精度。建议:查阅文档显存优化章节调整相关参数。云端数据安全风险涉密工业数据集不建议上传海外云端。建议:涉及敏感数据时,优先采用本地离线训练方案。

OpenScreen图标

OpenScreen

OpenScreen 使用指南一、平台简介OpenScreen 是一款开源的轻量级专业录屏演示工具,旨在为用户提供无水印、隐私安全的本地视频处理方案。项目地址:https://github.com/getopenscreen/openscreen官方网址:https://www.openscreen.net/技术架构:基于 Electron 跨平台开发,采用 React + PixiJS,利用本地 FFmpeg 进行视频编码,无云端上传逻辑。核心定位:Screen Studio 等付费软件的免费平替,主打 Demo 演示与教程美化录制。开源协议:MIT 协议,允许个人及商业用途,支持修改与源码分发。二、主要功能特性1. 录制能力录制范围:支持全屏录制或单窗口录制。音频采集:支持麦克风与系统声音同步采集。操作控制:提供 3 秒倒计时,支持托盘悬浮条控制暂停与停止。2. 演示特效(核心卖点)画面增强:支持自动跟随光标缩放、手动定点缩放。流畅转场:内置运动模糊效果,鼠标高亮显示。隐私保护:支持敏感区域自动模糊或打码处理。3. 后期编辑非破坏性剪辑:基于时间轴进行分段变速、裁剪。标注工具:提供文本、箭头、形状等自定义标注功能。背景设置:支持纯色、渐变或自定义壁纸背景。4. 导出设置格式支持:导出 MP4、GIF、WebM 等格式。比例选择:支持 1:1、16:9、9:16 等多尺寸比例。纯净输出:无水印、无隐藏收费、无强制广告。5. 扩展支持源码修改:支持二次编译修改源码。素材导入:支持导入外部录屏素材进行二次编辑。三、适用人群与场景✅ 推荐使用的用户程序员:用于代码 Demo 演示、Bug 复现过程记录、开源项目讲解。产品/运营:制作软件演示视频、客户交付短视频、功能介绍素材。讲师/自媒体:制作操作教程、软件测评视频、线上课程内容。自由职业者:低成本商用演示视频,替代昂贵的付费软件。❌ 不太适合的场景专业影视制作:不适合多轨道复杂剪辑或专业级调色需求。直播推流:不支持直接推流或直播场景。超长录制:长时间 4K 连续录制存在资源占用风险。云端协作:不适合需要云端存储或在线实时分享链接的团队。四、免费与付费情况完全永久免费,无任何付费套餐、订阅、内购或专业版限制。功能全开:所有功能均开放,无功能阉割,无录制时长限制。商用免费:依据 MIT 协议,个人及商业用途均免费。纯净无广告:无隐藏收费、无强制广告、无个人隐私数据采集。五、极简使用步骤1. 安装软件预编译包(推荐):访问 GitHub Releases 下载对应系统安装包。macOS:.dmgWindows:.exeLinux:AppImage包管理器安装: macOS 用户可通过 Homebrew 一键安装:bashbrew install openscreen 源码构建:bashgit clone https://github.com/getopenscreen/openscreen cd openscreen npm install npm run build 2. 权限配置(重要)macOS:授予屏幕录制、辅助功能、磁盘权限。若弹出隔离提示,在终端执行以下命令放行:bashxattr -rd com.apple.quarantine /Applications/OpenScreen.app Linux:赋予 AppImage 执行权限:chmod +x xxx.AppImage启动时建议添加 --no-sandbox 参数以防崩溃。Windows:需在系统设置中允许应用屏幕捕获,关闭杀毒软件拦截规则。3. 录制流程设置:打开软件,选择「窗口」或「全屏」录制范围,配置音频源。录制:点击 Record 按钮,通过悬浮条控制录制过程。编辑:录制结束后进入时间轴,添加缩放特效、标注、裁剪、调速或更换背景。导出:设置分辨率与比例,导出为 MP4/GIF 并保存至本地。六、常见避坑与注意事项⚠️ 版本与稳定性Beta 测试:Windows 版在暂停后可能出现鼠标错位,长时间录制建议分段录制以防内存溢出。GIF 导出:高分辨率 GIF 导出耗时较长,请保持网络畅通或定期清理磁盘空间。⚠️ 系统兼容性macOS 系统音:macOS 12 及以下版本无法直接捕获系统音,需安装 BlackHole 等虚拟声卡;新版本需手动在系统设置中开启音频权限。macOS 拦截:首次打开若被 Gatekeeper 阻止,必须执行隔离删除命令。语言界面:首次启动可能出现语言弹窗遮挡界面,建议将弹窗拖至边缘切换简体中文后关闭。⚠️ 隐私与安全本地处理:所有视频文件均在本地处理,不上传至云端。敏感信息:软件无自动敏感信息检测,涉及机密内容需手动添加模糊遮罩。⚠️ 二次开发协议声明:若修改源码后分发,务必保留 MIT 协议声明。功能限制:不支持对接云端存储或生成在线分享链接。⚠️ 功能边界缺失功能:暂无自动字幕、多轨道混音、复杂转场特效、摄像头画中画等功能,直播推流也不支持。