分类导航
发现更多优质 AI 工具
Onsolo
OnSolo 使用指南🟢 平台介绍腾讯推出面向个人创作者的 AI 影视短剧创作平台。原名为 WorkSolo,Slogan:a Crew of One。将剧本、角色、场景、分镜、视频生成整合为一条流水线;支持个人即可完成短剧、动画、互动影游成片。是工业级 WorkRally 的轻量化个人版本,无复杂团队资产管理模块。🟡 主要功能Start a story(故事模式):输入提示词或上传剧本,AI 解析剧本,自动提取角色、场景,生成角色资产、分镜、批量生成短剧视频片段。FMV Game:制作 AI 互动影游,包含分支剧情,玩家选择推进故事。Meme Play:轻量短视频、玩梗短片快速创作。Canvas自由画布:自由编排画面、镜头,自定义镜头参数,手工编排分镜。内置 AI:剧本结构化、角色统一人设、多视角素材生成、分镜自动生成、AI 视频生成、进度可视化。🟠 适用人群与场景✅适合短剧创作者、短视频创作者、动画爱好者、独立编剧、想快速做互动小故事的个人、学生创作。❌不适合大型专业影视工业化生产、多人重度团队协作(无团队版)、需要本地导出原始工程文件者。💰免费&付费情况当前处于公测内测阶段,官方定价页面:https://onsolo.ai/pricing。免费版:注册即送一定额度生成点数,可体验全部4种创作模式;生成消耗点数,点数耗尽停止生成。存在分辨率、单条视频时长限制、生成排队优先级低的情况。付费套餐:点数订阅制,充值点数,提升视频分辨率、更长时长、更高生成优先级、更大批量生成能力。注意:公测期套餐会变动,以官网 pricing 页面为准。🛠️如何使用步骤访问 onsolo.ai,使用腾讯账号登录。4种入口选择:Start a story / FMV Game / Meme Play / Canvas。Start‑a‑story流程: 1)粘贴剧本或写故事提示词;AI 解析剧本,确认角色、场景。 2)AI 批量生成角色素材、场景图。 3)审核自动生成的分镜,可手动修改镜头。 4)消耗点数批量生成视频片段。 5)在线剪辑拼接,导出成片。Canvas模式:空白画布,手动添加镜头、角色、场景,逐段生成视频。导出:导出成片视频到本地。⚠️注意事项与限制点数消耗:剧本解析消耗低,视频生成消耗点数最高,批量生成分镜会快速耗点。角色一致性:AI 生成人物会有变脸,需要反复调整角色参考图,无法做到**100%**完全统一。生成排队:免费用户高峰排队久,付费优先;长视频生成耗时高。版权管理:商用前务必阅读平台版权条款。AI 生成内容仅限个人创作,商用需要遵守平台协议。内容审核:生成内容会经过内容安全审核,暴力、低俗、违规内容直接拦截。导出限制:只能导出最终成片,不能导出中间原始工程文件。网络环境:国内访问正常,无需特殊网络;浏览器建议 Chrome。公测阶段功能会迭代,部分能力不稳定。
Upscayl
Upscayl 使用指南平台介绍产品定位:完全基于本地运行或云端使用的免费/付费AI图片超分辨率提升工具。核心模型:主要基于Real‑ESRGAN系列模型,能够有效修复图片模糊与噪点。版本分类:分为本地桌面版(开源免费)和Upscayl Cloud云端网页版。本地版:离线运行,数据不上传服务器,隐私保护强。Cloud版:浏览器直接使用,无需安装,依赖平台服务器算力与API接口。系统支持:全面兼容 Windows、macOS、Linux 操作系统。主要功能AI图片放大增强:支持2‑16倍自由设定放大倍数;针对老照片模糊、压缩噪点及二次元素材进行深度降噪修复。多模型库选择:提供通用照片、动漫插画、数字艺术以及人脸增强等专用算法,满足不同材质处理需求。文件夹批量处理:支持导入整个图片文件夹并一键执行放大任务,大幅提升工作流效率。Double Upscayl(二次超分):允许对已放大的结果进行再次放大处理,以获取更高像素分辨率。输出格式自定义:支持 PNG、JPG、WebP 等常见格式切换,并可调节图片压缩质量以适应不同场景。Cloud云端独有功能:仅限网页版使用;提供跨设备同步、大分辨率生成及API接口调用服务(如人脸增强)。适用人群建议✅ 适合使用的群体与场景专业创意工作者:包括设计师、摄影师及素材库管理者。内容创作者:动漫爱好者、老照片修复需求者、二次创作用户。隐私敏感型用户:本地版完全离线,数据不上传第三方服务器。硬件受限环境:若电脑配置较低或无独立显卡的用户可优先选择云端版体验。❌ 不适合使用的群体与场景非图片处理需求者:如无需放大视频、仅做简单缩放用户(工具不支持**。视频**。)。)商业高精度生产:专业级印刷要求及追求极致无损画质的大规模生产流程需谨慎评估效果。免费&付费情况说明桌面本地版信息授权性质:开源软件,永久免费使用。功能限制:无广告、无水印、不限处理次数。网络要求:下载后完全离线运行,不受国内网络波动影响。Upscayl Cloud(云端网页版)信息初始权益:注册赠送10个积分用于免费试用体验核心功能。付费订阅:采用积分制计费模式,提供按月或按年付费订阅服务;详见:https://upscayl.org/pricing。支付限制:无中国国内微信支付/支付宝渠道,仅支持境外信用卡在线付款。如何使用指南桌面本地版(推荐首选)流程步骤下载安装:访问官网下载对应操作系统的安装包并安装完成。导入素材:点击界面打开图标或拖拽图片及文件夹至窗口内。选择模型:建议照片使用通用模型,动漫插画类需切换为数字艺术/二次元专用模型。设定倍数:日常处理优先 2‑4倍。注意8‑16倍放大对显卡硬件压力极大,易卡顿或失真。配置输出:指定图片保存路径(Output Folder),确保存储空间充足。执行任务:点击按钮开始 Upscayl 运算过程。获取结果:处理完成后直接前往设置好的输出目录查看下载高清大图。Cloud云端版使用流程步骤注册登录:打开官网页面,进入Upscayl Cloud并创建账号/登录现有账户。上传调整:在浏览器中上传图片至队列,选择AI模型种类及放大倍数。消耗执行:积分自动扣除后等待云端服务器处理,完成后即可下载成品图片。注意事项(避坑指南)硬件性能要求:独立GPU。本地版运行速度极快;若无独显仅用CPU会导致处理极度缓慢或大文件卡死。无显卡用户优先使用Cloud版本本。**隐私数据保护:本地版图片完全存储在本地硬盘,不上传外网;云端服务会将图片传输至服务商服务器。建议包含敏感个人隐私的素材(如证件照、私密家庭影像)切勿上传云端。算法放大原理限制:AI 不是魔法。过度追求高倍率(8倍以上)容易产生伪影细节和画面扭曲失真。日常建议使用4倍以内以保证质量与速度的平衡。模型匹配原则:通用照片模型不可用于动漫插画,反之亦然;选错模型会导致画风崩坏或画质下降。网络环境考量:国内访问官网较慢且不稳定。建议下载本地客户端完成安装后断网使用云端版以外的功能;Cloud网页端在国内可能存在加载失败风险。订阅账户管理:积分系统有有效期,若取消付费订阅服务,剩余的未使用积分可能会被收回。不支持退费或兑换。输出格式规范:如需透明背景请选用PNG格式保存;选择JPG会引入二次压缩损失画质,需降低图片质量。开源协议声明:AGPL‑3.0 许可证。个人下载及非商业使用完全自由合规;若进行代码修改并再次分发传播,则必须遵循该协议的开源条款(公开源码)。
Spec Kit
GitHub Spec-Kit 使用指南一、平台介绍核心理念 *将开发模式从“先写代码再补文档”翻转为“规范即执行”。*通过逐步生成可评审的文档(宪法、需求规范、技术方案、任务清单),为 AI Agent 提供稳定的契约。项目性质 开源工具包,包含 specify CLI 命令行工具 + Agent Prompt 模板 + 脚本库。开源协议 MIT License(完全开源)。二、主要功能项目脚手架(Specify CLI) 一键生成规范驱动开发所需的目录结构、提示词及配置文件。阶段化斜杠指令(Slash Commands)/speckit.constitution:定义项目的全局不可违背准则,包括代码规范、架构约束、测试要求等。/speckit.specify:专注于“业务要做什么(What/Why)”,生成高层需求规范 spec.md,不掺杂技术细节。/speckit.clarify:主动提问以检查需求中的二义性、模糊点及边缘场景并补充完善。/speckit.plan:专注于“技术怎么做(How)”,制定技术选型、数据模型与架构方案 plan.md。/speckit.tasks:将方案拆解为带依赖关系、可并行执行的确定性任务清单 tasks.md。/speckit.analyze:交叉检查 Consistency,确保规范、方案、任务之间的一致性。/speckit.implement:驱动 Agent 按任务列表分步、小步快跑地编写代码。广泛的 Agent 生态集成 支持 GitHub Copilot、Claude Code、Cursor、Gemini CLI、Windsurf 等 30+ 款主流 AI 编码 Agent。三、适用人群AI 辅助开发者 / 独立开发者:希望用 AI 写大中型项目,但不想让 AI 乱改代码或迷失方向。软件架构师 / 技术 Leader:需要制定代码约束与架构规范(Constitution),控制 AI 输出质量。研发团队 / Product Manager:希望在写代码前快速评审需求规格 spec.md,确保产品与工程对齐。四、免费与付费情况Spec-Kit 本身费用:完全免费且开源。没有官方的付费商业版或订阅模式。第三方成本说明:使用 Spec-Kit 需要配合 AI Coding Agent 或 LLM API(如 GitHub Copilot 订阅、Claude API、OpenAI API 等),这部分按对应厂商的定价付费。相关网址链接:Spec-Kit 官方 GitHub 仓库:github.com/github/spec-kitGitHub Copilot 定价页面(若搭配 Copilot 使用):github.com/pricing五、如何使用(标准工作流)安装 CLI需要先安装 Python 的极速包管理器 uv。随后在项目根目录运行以下命令以集成 Copilot 或 Cursor:bash# 通过 uv 安装 specify-cli uv tool install specify-cli --from git+https://github.com/github/spec-kit.git # 初始化项目并指定集成方式(此处示例为 copilot) specify init my-project --integration copilot cd my-project 执行标准七步法在 Agent Chat 中按顺序使用斜杠指令:/speckit.constitution:生成 constitution.md,录入项目不可逾越的规则。/speckit.specify <需求描述>:用自然语言描述需求,生成 spec.md(What/Why)。/speckit.clarify:让 AI 审查 spec.md,回答其提出的补全问题并完善细节。/speckit.plan:给出技术偏好(如“使用 Go + PostgreSQL"),生成 plan.md(How)。/speckit.tasks:生成分步骤的任务列表 tasks.md。/speckit.analyze:运行一致性检查,确保任务和方案无冲突。/speckit.implement:让 AI 逐条完成 tasks.md 中的编码任务。六、注意事项严禁越级编码 在没有审核通过 spec.md 和 plan.md 之前,不要直接跳到 /speckit.implement 进行生成代码操作。任务颗粒度控制 如果 tasks.md 中某个任务过于庞大,应当让 Agent 继续拆细,否则 AI 容易在单次生成中产生遗漏或逻辑断层。文档即版本控制 所有生成的 spec.md、plan.md 和 tasks.md 建议提交到 Git 仓库,作为项目演进的历史上下文进行保留与追踪。验证需要闭环 Spec-Kit 负责到“代码生成完成”为止,它不包含运行时测试能力。对于 UI 或端到端验证(E2E),建议配合 Playwright、Shiplight 等测试框架形成质量闭环。
GenOffice
GenOffice 平台介绍与使用指南一、平台介绍GenOffice 是由 Genspark(由景鲲等创立)推出的 AI 时代原生本地办公套件。该套件支持 Windows 与 Mac 客户端。定位:作为平替传统本地 Office(如 Microsoft 365、WPS)的解决方案,提供 开源、免费、无广告 的办公软件服务。核心理念:将本地 Word/Excel/PPT 文档编辑器与 Genspark 的 Agent/SecondBrain 记忆层进行整合。旨在让 AI 深度融入日常文档写作排版、表格数据分析以及演示文稿制作场景中,减少用户重复性工作负担。二、主要功能模块AI Docs(文档与排版):支持对混乱文本进行处理,例如从 PDF 转换来的论文或长报告进行智能结构化排版、标题划分、表格还原以及格式批量修正。AI Slides(演示文稿):结合大语言模型能力与既有 PPT 模板资源,能够快速生成可编辑的幻灯片内容(建议搭配特定模板使用效果更佳)。AI Sheets(电子表格):支持基于自然语言提问进行数据分析、数据整理以及表格公式的自动生成。SecondBrain(记忆层):具备自动记录并关联用户工作上下文的功能,能够保存用户的表达习惯与历史模板,避免每次编写新文档都需要从零交代背景信息。开源 API 拓展:开放模型调用接口,允许自由切换或接入不同的 AI 大模型服务(如 DeepSeek、Ollama 本地部署模型等)。三、适用人群建议科研/学术/学生群体:适合需要对论文、文献资料进行 PDF 文本提炼处理、快速格式恢复与自动化排版的用户。白领与职场内容工作者:适用于频繁撰写工作总结、策划案、修改合同以及制作 PPT 汇报的办公人员。开发者与技术极客:看重开源属性,希望通过自行配置 API Key 或本地模型来降低 AI 使用成本的技术用户。纯净办公追求者:包括厌倦传统办公软件广告弹窗与高昂订阅费的个人用户使用场景。四、免费与付费情况软件本体费用:完全免费、开源、无广告。客户端支持直接下载本地安装,无需支付基础授权费。AI 算力/积分消耗模式:若官方服务默认调用 Genspark 云端 AI 服务时,将按照积分(Credits)进行计费;利用其开源特性配置自备 API Key(如 DeepSeek、Moonshot 等或 Ollama 本地模型),则可实现大幅降低甚至免除模型调用成本。最新定价查询方式:用户可通过官方定价页面随时查看积分套餐与最新资费动态,具体链接为 https://genoffice.ai/zh-cn/pricing(登录后可在 Pricing 或账户计费页面获取最新动态信息)。五、使用步骤快速入门下载安装客户端:首先需前往官网下载对应 Windows 版或 macOS 版本的本地应用程序并完成安装。配置 AI 引擎环境:用户有两种选择,分别是登录 Genspark 账号直接使用赠送的官方积分(快捷方式),或在设置中接入第三方 API Key 及本地 Ollama 服务以降低依赖成本(极客方式)。执行日常办公协作任务:复制杂乱文本至 GenOffice 并选择"AI 排版”功能输入规范,或先导入带有样式规范的 PPT 模板文件再导入选用文案附件提示 AI“参照模板风格生成 PPT"。六、注意事项与风险提示产品版本阶段:目前产品处于早期(Alpha 阶段),快速迭代中,对于极其复杂的 Word 样式或特种 PPT 格式可能存在兼容性瑕疵,建议重要文档做好备份处理。PPT 生成操作建议:直接使用“一句话生成 PPT"容易出现版式不佳或风格生硬的问题;最佳实践是采取“给定排版模板 + 规定 Prompt”的组合方式以获得最好产出效果。积分消耗管理:注意云端积分的实时消耗情况,若直接使用云端高阶模型进行数万字排版或长文分析,积分消耗较快,建议优先在设置中配置性价比高的第三方模型 API Key 以规避成本问题。
Graft
Graft:开源 AI 编程助手上下文增强与加速工具是由 Nanonets 推出的开源 AI 编程助手(Coding Agent)上下文增强与加速工具。1. 平台介绍Graft 是一款专注于增强 AI 编程助手(如 Claude Code、Cursor、Codex、Gemini 等)对代码库理解能力的本地化 CLI 工具。传统方案通常依赖向量检索(RAG)或将整个代码库作为巨大上下文塞给 LLM,导致 Token 消耗巨大且模型经常“迷路”或跳过工具调用。Graft通过在本地将代码库提炼为一套互相链接的 Markdown 节点图(Markdown Context Graph),并结合 Hook 机制在交互时自动将精准的架构与上下文注入给 AI,从而实现:更快、更省、更准的 AI 辅助编程。2. 主要功能Graft 提供了以下核心能力以优化开发体验:代码库结构化图谱构建:基于 Tree-sitter 进行本地确定性解析,将代码库按照模块、API 及系统概念抽离为清晰的 Plain English 关联节点图(Markdown node graph)。自动化 Hooks 注入:无需依赖 Agent 主动调用外部 MCP 工具,Graft 会通过 Agent Hook(如 .claude/ 钩子)在每次 Prompt 时自动拉取匹配的代码节点,无感嵌入上下文。显著降低 Token 与耗时:Token 节省:平均节省约 42% 的上下文 Token。工具调用减少:减少约 46% 的 Tool-call 次数。响应加速:大幅缩短墙上时间(Wall-clock time),加速 32%~60%。准确率提升:在 SWE-bench Verified 测试中,解决率相比冷启动从 54% 提升至 66%。3. 适用人群AI 编程工具深度依赖者:日常频繁使用 Claude Code、Cursor、Gemini 等 Agent 进行代码重构与开发的工程师。大型/复杂代码库开发者:面对大型项目、Monorepos 或是接手不熟悉代码库,需要 AI 迅速理解全局依赖关系的架构师与开发者。成本与速度敏感型团队:希望在使用 LLM 辅助编码时大幅削减 API Token 账单并获得快速响应的个人或团队。4. 免费付费情况与定价说明Graft 本身完全开源且免费提供,具体计费逻辑如下:基础代码结构提取(graft build):纯本地 Tree-sitter 解析,不调用任何 LLM,不消耗任何费用。深度摘要提炼(graft build --deep):会调用您配置的 LLM API Key(如 Anthropic、OpenAI、OpenRouter 等)生成高层级概念节点,费用直接按您对应的 API 供应商标准扣除。官方资源链接:Graft 开源仓库与免费声明页面:https://github.com/nanonets/graft5. 如何使用步骤 1:全局安装 CLI在终端中运行以下命令进行安装:bashnpm install -g @nanonets/graft 步骤 2:在项目目录初始化并绑定 Agent进入您的代码库目录并运行:bashgraft init 命令提示:自动提示选择需要绑定的 AI 编程代理(如 Claude Code)。配置写入:自动在本地生成 graft/ 节点图,并将 Statusline 及 Hooks 配置写入 Agent 目录(例如 .claude/)。步骤 3:正常使用 AI 编程助手配置完成后,直接像平常一样启动您的 AI 助手(例如运行 claude),Graft 会在后台跟随会话并在每次提问时自动注入精准的代码上下文节点。常用命令备忘列表生成/更新图谱:使用 graft build(带深度总结可加参数 --deep,需提前设置环境变量)。可视化检查图谱:运行 graft viz 查看生成的结构。检索与定位:使用 graft grep <关键词> 或 graft map。6. 注意事项在使用 Graft 之前请务必确认以下事项,以确保团队协作和隐私安全:Git 忽略项配置:运行 graft init 会自动将 graft/ 文件夹添加到 .gitignore 中(图谱属于本地可再生的缓存,类似 node_modules)。协作流程:团队协作时只需提交 .claude/ 钩子配置;其他成员拉取代码后运行一次 graft build 即可。API 密钥与模型环境变量:如果使用深度摘要功能(--deep),需确保配置好相应的环境如 GRAFT_PROVIDER、GRAFT_API_KEY、GRAFT_MODEL 等。隐私与安全性保障:Graft 本身零遥测(No Telemetry)、无分析数据上报。所有的网络请求仅限于您主动配置并调用的 LLM API 端点,保护本地代码安全。
Audiblez
Audiblez 开源自动有声书生成工具一、平台介绍与定位核心定位:Audiblez 是一个轻量化、离线运行的电子书转有声书本地工具。其主要功能在于帮助用户在不依赖云端服务的状态下完成从文本到语音的转换。技术核心模型:基于开源超轻量级 TTS(文本转语音)模型 Kokoro-82M。该模型参数量仅为 8000 万,具备体积小巧、发音自然流畅以及推理速度极快的显著特点。项目来源信息:由开发者 Claudio Santini(Github ID: santinic)开发并维护。开源地址为 santinic/audiblez。二、主要功能清单章节自动处理与打包能力:读取 .epub 格式电子书文件内容。系统会自动将书籍按章节拆分生成音频,最后利用 ffmpeg 工具将所有音频合并为标准格式的 .m4b(支持播放器识别)。多语言音色广泛覆盖:内置了数十种男女声音色选项。支持美式英语、英式英语、中文普通话、日语等语种。具体包含如中文的 zf_xiaoxiao、zm_yunxi 等多种人声选择。交互式章节挑选功能:命令行使用 --pick 参数启动交互模式。用户可以手动勾选仅需转换的特定章节,避免整书生成的资源浪费与时间消耗。语速个性化调节支持:提供灵活的速度控制选项。支持从 0.5x(慢读)到 2.0x(快听) 的范围调整需求,适应不同阅读场景。双形态操作界面设计:既提供命令行 CLI 接口供批量自动化处理。同时也提供了图形界面(GUI),方便不熟悉终端代码的普通用户直观操作使用。多硬件加速兼容性策略:支持 CPU 推理与 NVIDIA GPU CUDA 加速。可根据设备配置选择纯软件运行或显卡全速运算模式。三、适用人群群体分析有声书爱好者读者群:希望将大量下载的 EPUB 格式电子书转换为音频文件。主要用于收藏后的离线收听需求,提升个人媒体库的可听性。隐私敏感与零成本用户:对在线 AI(如 ElevenLabs)的订阅费用及流量使用有所顾虑。追求完全本地化、全离线处理流程且无需支付任何费用的人群。外语语言学习者辅助者:利用多语种自然音色制作双语材料。主要用于英语学习或法语等其他小语种的听力训练与练习。开发者与 Homelab 玩家群:希望在个人 NAS、Google Colab 或本地服务器上部署脚本。希望实现批量自动化生成有声书的运维人员与技术用户群体。四、免费付费情况说明完全开源协议授权性质:项目采用 MIT 开源协议,底层模型使用 Apache-2.0 协议。代码与资源对公众开放,无任何闭源或隐藏费用成分。零成本本地运行机制:不依赖任何云端 API 接口。所有的计算都在你自己的设备(如电脑 GPU)上运行,不存在官方付费方案或非官方的收费页面。信息获取渠道说明:所有最新技术与维护均以 GitHub 项目主页为准。地址指向 https://github.com/santinic/audiblez,确保信息的即时性与准确性。五、核心使用方法与安装指令前置依赖环境配置要求:Audiblez 运行需要系统中预装以下组件:python3(基础语言)、用于音频打包的 ffmpeg 和语音合成分词器 espeak-ng。系统特定安装包命令示例:[macOS] Homebrew 环境安装步骤:bashbrew install ffmpeg espeak-ng pip install audiblez [Ubuntu / Debian] APT 包管理器工具安装:bashsudo apt install ffmpeg espeak-ng pip install audiblez [Windows] Python 虚拟环境标准流程(建议): **注意在 Windows 系统优先使用虚拟环境,避免污染全局库。**依次执行以下 cmd / PowerShell 指令:构建目录并创建激活脚本。cmdmkdir audiblez && cd audiblez python -m venv venv .\venv\Scripts\activate.ps1 pip install audiblez pillow wxpython 功能执行与参数化转换命令:**[默认全书转换操作] 基础用法示例:**使用 -v 后填写音色代号,如美式英语 af_sky。请替换文件名为你的具体 EPUB 名称。bashaudiblez your_book.epub -v af_sky **[调节语速播报指令] 加速播放设置:**添加 -s 参数设定速率,例如 1.5倍速(范围支持 0.5x-2.0x)。bashaudiblez your_book.epub -v af_sky -s 1.5 **[交互式章节选择指令] 仅转换选定内容:**使用 --pick 参数启动交互界面。系统会列出所有章节供你手动勾选需要生成的部分。bashaudiblez your_book.epub --pick 性能优化与硬件加速配置:**[CPU/GPU/CUDA 开关] GPU 加速模式:**若设备装有 NVIDIA 显卡,使用 --cuda 参数显式开启。这能显著提升大书的生成速度(例如 Google Colab T4 环境下 16 万字仅需约 5 分钟)。bashaudiblez your_book.epub --cuda **[图形界面入口指令] GUI 可视化操作:**不习惯命令行时,可直接输入以下命令启动桌面端窗口。该模式适合进行章节选择与参数配置的直观管理。bashaudiblez-ui 六、注意事项与性能说明文件格式兼容性限制:目前原生支持仅针对 .epub 格式电子书。如果是 PDF、TXT 或 AZW3,需预先使用 Calibre 等工具转换为标准 EPUB。CPU/GPU 速度预期对比:**在免费 GPU(如 Google Colab T4)**环境下处理效率更高;而在纯 CPU(如 M2 Mac)上推理同一内容可能需要长达约1小时。建议长文优先开启 GPU。依赖项缺失风险预警:如果电脑中未成功安装 ffmpeg,程序生成完单章的 .wav 声音文件后无法打包成最终的 .m4b 格式音频包。务必检查 ffmpeg 是否在系统环境变量路径下可被调用。Apple Silicon (M1/M2/M3) 优化状态说明:底层主要依赖 PyTorch CPU/CUDA架构,尚未完全原生适配 Apple MLX 框架加速。Mac M 系列用户运行速度受限,长文本处理建议借用 Google Colab 等云端算力执行。
Langextract
google/langextract 使用指南google/langextract 是 Google 开源的 Python 库,旨在利用**大语言模型(LLM)**从非结构化文本中提取结构化信息。该工具专门解决传统大模型提取时容易丢失原文本位置定位(Grounding)的问题。以下为干货整理的使用指南:一、平台与项目介绍GitHub 仓库:google/langextract核心定位:基于 LLM 的文本结构化提取工具,支持精准的文本回溯(Source Grounding)与可视化显示。主要优势:结合长文本切片(Chunking)、并行提取(Parallel Processing)与多轮回溯校验(Multi-pass),有效解决长文本信息漏提以及大模型提取信息时“无法定位出处”的痛点。二、主要功能干货精准原文定位(Source Grounding):提取出的字段不仅有结果,还会标注该信息在原文中的字符起始位置(char_interval),方便核验准确性与来源依据。长文本高效处理:自动切分整本小说或长篇医学报告等复杂文档,支持多线程并行(max_workers)与多轮提取(extraction_passes),从而提高整体召回率。少样本驱动(Few-Shot Driven):无需微调模型,只需提供 1~2 个高质量的示例(ExampleData),即可约束并引导输出结构符合预期。交互式 HTML 可视化:可直接生成交互式 HTML 页面,在原文中将提取出的实体用高亮颜色绘制出来,直观展示提取关系与上下文位置。多模型适配:原生支持 Google Gemini 系列,同时兼容 OpenAI 模型以及基于 Ollama 的本地开源大模型(如 Llama 3、Qwen 等)。三、适用人群NLP / AI 工程师:需要快速从海量非结构化文本中提炼符合 Schema 的数据。医疗与科研人员:提取电子病历(EMR)、放射科报告或文献中的关键指标,且对模型审计依据有严格要求的场景。数据分析师 / 业务人员:处理长文档(如合同、法律条文、财务报表)并进行可视化分析的业务场景。四、免费与付费情况开源代码费用:100% 免费。采用 Apache-2.0 开源协议,可自由下载和商用源代码。API / 模型调用成本说明:取决于所选用的底层大模型服务商标准计费模式。✅ 免费方案:使用 Ollama 部署本地模型(需自备算力),或使用 Gemini API 的 Free Tier(但有 TPM/RPM 限流)。💳 付费方案:选择云端商业 API(如 Gemini 商业版、OpenAI API)或 Google Cloud Vertex AI,按对应厂商 Token / API 计费标准产生费用。参考定价链接:Google Gemini API / AI Studio:https://ai.google.dev/pricingGoogle Cloud Vertex AI:https://cloud.google.com/vertex-ai/generative-ai/pricingOpenAI 定价标准:https://openai.com/api/pricing/五、快速使用步骤安装库与环境配置bashpip install langextract # Windows/Linux/Mac export GEMINI_API_KEY="your-gemini-api-key" Python 核心调用逻辑(Prompt & Examples)pythonimport langextract as lx import textwrap # 1. 定义提取指令(Prompt):使用 Exact Text,保持格式一致 prompt = textwrap.dedent(""" Extract characters, emotions, and relationships. Use exact text for extractions. """) # 2. 提供少样本示例(引导模型对齐输出结构 & Grounding) examples = [ lx.data.ExampleData( text="ROMEO. But soft! What light through yonder window breaks? It is the east, and Juliet is the sun.", extractions=[ # Extraction 字段必须与原文完全一致,禁止改写! lx.data.Extraction( extraction_class="character", extraction_text="ROMEO", attributes={"emotional_state": "wonder"} ), lx.data.Extraction( extraction_class="relationship", extraction_text="Juliet is the sun", attributes={"type": "metaphor"} ), ] ) ] # 3. 运行提取任务:输入文本与模型 ID input_text = "Lady Juliet gazed longingly at the stars, her heart aching for Romeo" model_id = "gemini-1.5-flash" # 推荐默认使用较新版本或指定具体型号 result = lx.extract( text_or_documents=input_text, prompt_description=prompt, examples=examples, model_id=model_id, ) # 4. 保存结果与生成交互式可视化 HTML lx.io.save_annotated_documents([result], output_name="results.jsonl") html_content = lx.visualize("results.jsonl") with open("visualization.html", "w", encoding="utf-8") as f: if isinstance(html_content, str): f.write(html_content) else: f.write(html_content.data) # 处理返回的数据对象情况 数据导出与查看:运行完成后,检查生成的 results.jsonl 文件包含提取结果及其字符区间信息。打开生成的 HTML 页面即可看到高亮后的原文效果。六、注意事项必须使用原文(Exact Text):在少样本示例中,extraction_text 字段严禁改写或同义替换。LLM 会尝试匹配字符区间,若与原文不符,LangExtract 将报错 Prompt alignment 警告并导致位置定位失效。Grounding 过滤机制(处理幻觉):LLM 偶尔会出现提取内容未出现在原文中的情况(Hallucination)。LangExtract 会将无法定位的项标记为 char_interval = None,建议在后处理阶段进行过滤:python# 示例代码片段:筛选有效字符区间的结果 valid_extractions = [e for e in result.extractions if e.char_interval] result_filtered = lx.ExtractionData(text=input_text, extractions=valid_extractions) # 假设数据结构需重新封装以符合下游需求 长文本并发与 API 限流(Rate Limit):若设置较大 max_workers 或多轮提取,切片后会瞬间产生大量并发请求。使用免费 API Free Tier 时极易触发 TPM/RPM 频率限制。高并发生产环境建议切换至付费层级或使用 Vertex AI Batch API 以提升稳定性。
Crawl4ai
Crawl4AI1. 平台介绍Crawl4AI 是一个完全 开源、具备 高性能 且对 LLM(大语言模型) 极度友好的 Web 爬虫与数据提取工具库。它的核心使命是将任意网页快速转化为干净、高质量的 Markdown 文本或结构化 JSON,以便直接供以下场景使用:RAG(检索增强生成)系统AI Agent 构建LLM 训练及上下文补充2. 主要功能该库提供了多种核心能力以支持复杂的数据采集需求:LLM 友好输出能够自动将 HTML 转化为包含图片、链接和元数据的精简/高质量 Markdown(Fit Markdown),确保内容可直接被大模型理解。智能与自适应爬取支持 Adaptive Crawling,基于信息获取采取消耗算法,当抓取到足够回答目标的信息后会自动停止,提高效率并减少资源浪费。多样化结构化提取策略无 LLM 策略: 利用 CSS/XPath、正则匹配进行基础清洗;或采用 Clustering(聚类)及分块算法处理数据。基于 LLM 策略: 调用 OpenAI、Anthropic 或本地部署的 LLM,输出严格符合 Schema 的结构化 JSON 数据。高阶浏览器操控能力动态交互支持: 能够执行点击、滚动、等待操作以及运行 JavaScript。会话与反爬管理: 支持 Cookie/Session 重用、代理(Proxy)轮换,并集成 Undetected Browser / Anti-Bot 模式以绕过常见检测机制。动态内容处理: 自动解决懒加载(Lazy Loading)及无限滚动页面获取问题。极速并发性能基于 Python asyncio 异步架构构建,支持单机高并发、多 URL 调度任务以及本地缓存机制,确保大规模爬取时的效率与稳定性。3. 适用人群本库主要服务于以下三类技术人员:AI & LLM 开发者致力于构建 RAG(检索增强生成)知识库、AI Agent 系统或为 LLM 模型补充高质量上下文数据的工程师。数据科学家与分析师需要批量获取大量高质量结构化数据进行文本挖掘、情感分析或其他机器学习任务的专业人员。自动化与爬虫工程师需应对复杂动态页面(SPA)、单页应用及高级反爬机制的开发者与维护者。4. 免费与付费情况关于软件授权及服务模式,目前安排如下:开源核心版本(完全免费)基于 Apache 2.0 协议彻底开源。无数据量限制、无任何隐藏付费项目。支持用户自建 Docker 环境进行私有化部署。托管/云端版本(即将推出)官方正在推出名为 Crawl4AI Cloud API 的托管服务。目前该服务模式处于封闭内测阶段,具体功能随进度逐步开放。5. 如何使用① 安装依赖环境请在终端中执行以下命令进行基础环境的初始化配置:bashpip install crawl4ai crawl4ai-setup # 自动下载并安装 Playwright 所需的 Chromium 等浏览器二进制文件 ② 编写爬取代码示例(异步模式)请确保在事件循环中运行,以下是标准的基础调用流程:引入库与定义函数创建爬虫实例并执行输出结果文本pythonimport asyncio from crawl4ai import AsyncWebCrawler async def main(): async with AsyncWebCrawler() as crawler: # 执行爬取请求 result = await crawler.arun(url="https://example.com") # 输出转换好的 Markdown 文本(供 LLM 直接使用) print(result.markdown) if __name__ == "__main__": asyncio.run(main()) 6. 注意事项为确保爬取任务顺利进行,请务必关注以下几点:异步架构要求核心方法如 arun() 均为异步函数(asyncio.coroutine),必须在 Python 的 asyncio 事件循环中调用,否则将报错或无法执行。浏览器依赖管理首次运行前必须通过 crawl4ai-setup 命令初始化 Playwright 环境,确保下载 Chromium 等必要的浏览器二进制文件至本地路径。性能调优策略(并发与缓存)在批量爬取任务中,建议合理配置 arun_many() 及 Cache Mode 参数。利用机制避免对同一 URL 重复抓取,防止因请求频率过高导致被目标网站暂时封禁或触发风控。反爬与合规性对于极高防御等级的目标站(如需要验证码验证),需开启 Proxy / Undetected Browser 模式尝试突破防护层。严格遵循目标网站的 robots.txt 协议及数据抓取规范,确保合法合规使用数据进行开发与研究。
PPT Master
PPT-MASTER 使用指南1. 平台介绍项目定位:一个运行在 AI Agent(如 Claude Code)中的开源工作流技能。它能将任意文档(PDF、DOCX、网页等)或话题,自动转化为原生可编辑的 PowerPoint (.pptx) 演示文稿。核心优势:生成的不是扁平图片或单张文本框,而是包含 PowerPoint 原生 Shape、数据驱动图表与表格、转场动画、母版/版式继承以及演讲者备注配音;工作流及文件生成完全在用户本地机器执行,数据不留存第三方平台;兼容任何支持 Agent 技能的 AI 交互环境(Claude、GPT、Gemini、Kimi 等均可驱动)。2. 主要功能文档/话题一键生成:输入提炼素材或直接提问,AI 自动梳理逻辑链条、规划版面并输出 .pptx。数据驱动的图表与矢量元素:生成包含真实数据的 PPT 图表、表格,以及带控制句柄的原生矢量图形和连接线。模板提取与套用:可从参考演示文稿中提取品牌风格与版式布局,或将新内容填入现有的 .pptx 模板中。转场、动画与语音配音:支持一键配置原生 Slide 转场、元素动画,并可将演讲者备注转换为语音朗读(Audio Narration)。多风格视觉生成:内置极简瑞士排版、杂志风、数据新闻风、玻璃拟态 (Glassmorphism)、Memphis 流行风等多种视觉设计模板。3. 适用人群职场人士 / 商务汇报者:需要快速将长篇 Word、PDF 报告或会议大纲提炼成高颜值 PPT。开发者 / 技术人员:习惯使用 AI 命令行/IDE 工具(如 Claude Code),希望通过自然语言直接生成可编辑文档。研究员 / 学者 / 创作者:需要将论文、行业研究报告快速转化为结构清晰的演示文稿。4. 免费与付费情况完全免费开源:项目采用 MIT 开源协议,软件本体 100% 免费,无需支付任何 PPT 生成平台月费或订阅费;由于软件本身免费开源,项目没有官方付费定价页面。使用成本分析:唯一的成本是用户调用大语言模型(如 Kimi、Claude、OpenAI 等)及图片生成 API 的费用;实际花费取决于你所使用的 AI 模型厂商的 API 计费标准。5. 如何使用(快速上手)准备环境:安装 Python 3.x 环境,以及支持 Agent 技能的 AI 工具(如 Claude Code、Cursor 等)。配置 Key:在 AI 工具中配置好你的大模型 API Key。推荐具备大上下文与强推理能力的模型(如 Kimi K3 或 Claude),以及图像生成 API。加载技能并交互:将 ppt-master 技能引入你的 Agent 环境;在对话框中发送指令,例如:“将这份报告 [附带 PDF] 生成一份 10 页的商业汇报 PPT"。导出与微调:生成结束后,在本地打开导出的 .pptx 文件,直接在 PowerPoint 中进行细节调整与演示。6. 注意事项工具定位认知:PPT Master 提供的是工作流框架(Harness),生成质量的上限制取决于底座 AI 模型;建议配合大上下文、强推理的大模型(如 Kimi K3、Claude)以获得最佳逻辑与排版效果。人工微调预留:AI 能完成 80%~90% 的结构规划、内容提炼与基础美化工作,但最终的视觉对齐和细节微调仍需人工简单把关;PPT Master 并非许愿池,需理解其能力边界。
Drawio
Draw.io 平台使用指南一、平台介绍draw.io(亦称 diagrams.net)是一款基于开源协议的安全第一专业图表绘制工具。该工具无需注册账号即可直接使用,支持跨平台运行(Web 端、桌面客户端、VS Code 插件等)。其核心优势在于数据隐私保护——软件不存留用户图表数据,所有文件均直接保存在用户本地或自带的云端存储中。二、主要功能丰富的图形库预置:包含流程图、UML、网络架构图(AWS/GCP/Azure/Kubernetes)、ER 实体关系图、思维导图及线框图等数百种专业模版与图形素材,支持快速调用。多端存储与无缝集成能力:同步至:Google Drive、OneDrive、Dropbox、GitHub/GitLab 或本地硬盘;VS Code 扩展:直接在代码编辑器内编辑图表文件;内容嵌入:支持 HTML、Notion、Confluence 及 Jira 等平台。灵活的导入与导出支持:导入方面:兼容 Visio (.vsdx)、Lucidchart、Gliffy 等外部格式图表文件;导出方面:可生成 PNG、JPEG、SVG、PDF,以及保存带编辑数据的专用 XML 格式。实时协作与高级编辑器:结合云盘实现团队多人协同编辑;提供手绘/草图风格(Sketch style)、暗黑模式及自定义 CSS 样式调整功能。三、适用人群软件工程师 / 架构师:用于绘制 UML 类图、系统架构图、部署图、时序图及网络拓扑图等复杂结构。产品经理 / 设计师:适用于业务流程图设计、原型线框图(Wireframe)制作及用户旅程图的规划。项目经理 / 运维人员:便于创建甘特图管理进度,以及组织架构图与网络设备连接图的展示。学生与科研人员:支持论文流程图梳理、逻辑思维导图的构建等学术场景应用。四、免费与付费情况个人/Web/桌面版方案:100% 永久免费。该版本无功能限制、无导出水印,且无需登录注册即可使用。企业级集成方案(收费):仅在通过 Atlassian 云端生态(Confluence & Jira)内调用官方原生 App 时使用此服务时产生费用,通常按团队人数按月或按年收取许可费。查看最新官方定价页面:https://www.drawio.com/pricing五、如何使用选择启动平台:访问网页版 app.diagrams.net,或下载 draw.io Desktop 桌面客户端。配置存储位置:启动工具时需确认文件保存路径,可选择本地硬盘(Device)、Google Drive 或其他云盘同步。创建新图表:打开空白画布以从零开始设计,或直接选用系统提供的现成模板进行二次修改。绘图与编辑操作:左侧面板:搜索或选择所需图块,拖拽至中央区域;中间画布:拖拉连接线建立关系,双击元素输入文本内容;右侧属性栏:调整选中元素的背景色、线条粗细、字体样式及排版布局。保存与导出文件:通过菜单 File -> Save 将源文件保存在当前目录,或通过 File -> Export as 直接生成图片/PDF 等最终格式。六、注意事项数据本地化存储:网页端不托管用户自动上传的临时草稿。清空浏览器缓存会导致未保存内容丢失,建议开启工具的自动保存功能或优先使用桌面版以确保数据安全。版本控制策略推荐 GitHub:当与 Git/GitHub 配合工作时,建议选择导出 .drawio.svg(可编辑矢量图)或 .drawio.png,后者可直接作为图片展示且保留导入后全量可编辑特性。扩展图形库方法:若左侧默认图库缺少特定图标(如某些 IT 云厂商 Logo),请点击左下角按钮开启更多资源:+ More Shapes。
DrawDB
drawDB 浏览器端开源数据库 ER 图设计工具drawDB**(Draw Database)**是一个基于浏览器的开源数据库实体关系(ER)图可视化设计与 SQL 生成工具。该工具无需注册账号、无需配置复杂后端,完全在浏览器端运行,极大地简化了数据库建模与文档化的流程。一、平台属性与安全机制基本定位:drawDB 是一款基于浏览器的开源项目(协议为 AGPL-3.0),前端框架采用 React 构建。核心优势:免登录即用、零后端依赖,数据全部保存在本地浏览器 (IndexedDB/LocalStorage) 或支持导出私有文件保存与分享。安全性保障:极高。数据库架构(Schema)完全在客户端本地渲染和处理,不会上传至第三方服务器;支持通过 Docker 进行私有化部署以隔离环境。二、核心功能模块可视化表设计与关系绘制:支持拖拽建模创建数据表及字段属性(主键/自增),鼠标操作即可连线建立外键约束并配置联动规则(如 ON DELETE CASCADE)。SQL 双向转换能力:一键导出对应数据库的 DDL(建表语句);或将已有的 SQL 脚本导入,自动反向推演生成可交互的关系图表。支持主流方言(MySQL/PostgreSQL 等)。架构管理与可视化增强:允许使用不同颜色区块对数据表进行分组 (Subject Areas),并在画布上添加富文本便签用于业务逻辑标注。多格式导入与导出支持:图形结果可导出为 PNG、SVG(便于放入文档/PPT);设计源文件可保存/加载 JSON 或 DBML 格式以便协作分享。三、适用人群定位后端及全栈开发者:快速设计新项目数据库架构,直接获取并执行对应数据库的建表 SQL 脚本。DBA 与系统架构师:梳理复杂业务关系网络,对现有遗留系统进行反向工程绘制以完善文档化管理。学生与教育人员:在学习或教学中直观理解主外键关联及数据库模型设计原理。技术文档撰写人与产品经理:快速生成清晰的架构图示并插入项目 Wiki、产品说明书等交付物中。四、版本性质与获取渠道费用说明:完全免费且无任何功能限制。工具本身没有付费订阅方案,唯一“费用”仅发生在选择自建服务器(VPS/Docker)时的硬件成本上。官方主页/项目地址:使用入口网址为 https://www.drawdb.app;GitHub 开源仓库位于 drawdb-io/drawdb。五、核心操作流程指南新建架构与设计起点:打开官网点击 "Build for Free",在顶部栏选择目标数据库类型(如 MySQL/PostgreSQL)以适配专属数据类型。绘制表结构及关联关系:使用工具栏 + Table 按钮创建新表并设置字段属性;按住某外键节点拖拽至目标主键即可完成连线与约束配置。导入现有 SQL 脚本生成图:点击顶部栏 Import SQL,粘贴已有数据库导出的建表语句,系统自动解析渲染为图表关系网(部分复杂对象除外)。保存成果并导出数据文件:设计完成后通过 Export 按钮选择导出方式;包括直接复制执行的 SQL、放入文档的高清图片 PNG/SVG、或用于恢复修改的 JSON 源文件。六、注意事项与风险提示本地存储数据风险:架构图默认保存在浏览器缓存(IndexedDB)中,清理缓存或切换浏览可能导致丢失。建议重要设计务必点击 Export -> Save as JSON 下载本地副本。反向解析局限性说明:SQL 导入功能主要支持标准 DDL;若脚本包含大量复杂触发器、存储过程或非标准方言函数可能会导致图形生成失败。多人协作模式建议:平台目前侧重个人设计,如需团队同步使用 JSON 文件结合 Git 版本控制或自建私有化部署服务进行网络共享与数据隔离。
WrenAI
Wren AI:GenBI 与上下文引擎平台1. 核心定位Wren AI 是一个开源的 GenBI(生成式商业智能) 与 上下文引擎平台。它致力于解决传统 Text-to-SQL 工具缺乏业务语义定义和企业治理规则的问题,在 AI Agent 与企业数据库之间构建透明、可控的“业务上下文层”。2. 架构模式Wren AI 采用 Open-Core(开源核心) 架构模式:底层开源核心:包含上下文引擎、MDL(建模定义语言)、Text-to-SQL 管道、MCP 服务及 CLI。该层托管于 GitHub,遵循 Apache-2.0 协议代码公开可审计,可直接集成进各种 AI Coding 工具与 Agent。上层商业平台:基于开源引擎构建,提供可视化 GenBI UI、仪表盘、Agentic 交互模式、团队权限管理、行列级数据安全防护以及云端/私有化托管服务。3. 主要功能特性MDL 语义建模:将业务指标、实体关系和计算公式定义为代码并存入 Git 仓库,避免 LLM 在生成 SQL 时因缺少业务上下文而出现幻觉。自然语言转图表(Text-to-SQL & Chart):支持将自然语言问题准确转化为具备语法与语义校验的 SQL,并自动生成可视化图表与分析报表。原生 MCP 支持与 Agent 集成:提供 MCP Server 接口,可与 Cursor、Claude Code、Cline 等 AI Agent 工具原生对接。多数据源支持:原生对接 20+ 主流数据库与数据仓库(如 PostgreSQL、Snowflake、BigQuery、ClickHouse、Redshift、Databricks 等),实现原地查询,确保 Data stays in place。干跑验证与错误修复:生成 SQL 后在后端先行校验并自愈,降低执行失败率。4. 适用人群划分数据工程师 / AI Agent 开发者:希望在 Agent 项目中引入准确的数据查询能力,使用 CLI/MCP 构建自然语言分析工作流。数据分析师 / BI 团队:减少重复的 SQL 编写工作,统一团队业务指标定义(MDL),快速响应业务部门的灵活查询需求。企业管理与业务人员:通过自然语言直接与数据库交互,自助式获取报表与图表,无需依赖数据团队排期。5. 版本类型与费用方案Wren AI 划分为开源版与商业托管版,具体配置如下:Open Source(开源版):包含核心上下文引擎、MDL 建模、MCP 服务、CLI 工具及 20+ 数据库连接器(不含默认图形界面 UI)。费用标准为免费。Essential Cloud:在开源引擎功能基础上,增加 Web UI 界面、仪表盘、GenBI 应用模式及托管运行能力。费用约为 $179/月(按年计费)。Enterprise Cloud:包含 Essential 版所有功能,并提供强化安全控制、高级审计与权限管理以及更多 API 调用额度。费用约为 $559/月(按年计费)。Enterprise Plus(私有化部署):可部署于企业 VPC 或物理隔离环境(Air-gapped),提供行列级数据安全防护及专属 SLA 与支持方案,价格按并发与需求定制。6. 使用指南方式一:开发者命令行 / AI Agent 模式(免费开源)安装 CLI:运行命令 pip install wrenai 以完成核心组件的安装。配置 Agent Skill:在环境中执行 npx skills add Canner/WrenAI,将 Wren 能力注入到 AI Tools。引导初始化:向 Agent 提示 Use Wren to set up my database,系统将按交互式步骤连接数据库并生成 MDL 建模文件。方式二:云端 Web UI 模式(Teams & 企业)账号注册:访问 Wren AI Cloud 官网进行账号创建与登录。数据源连接:输入数据库连接串,确保数据保留在原库不迁移。AI 自动建模:引导 AI 扫描 Data Schema,辅助定义 MDL 业务指标文件。交互式查询:在 Web 界面中通过自然语言对话发起查询、生成仪表盘并分享给团队。7. 注意事项与最佳实践开源版无默认 UI:开源引擎定位为 AI Agent 的底层上下文层(支持 CLI/MCP),若需可视化 Dashboard,请使用 Cloud 版本或自建适配。MDL 语义至关重要:单纯依赖 LLM 猜 Schema 容易出错,使用 Wren AI 前须认真梳理关键业务指标与关联关系,规范的 MDL 能显著提升 Text-to-SQL 准确率。数据隐私保护:查询过程仅将 Schema/MDL 上下文发送给大模型,原始数据仍在本地仓库执行;若对安全敏感建议私有化部署并搭配企业私有 LLM API。