IndexTTS 值不值得用?Mac 实测一周,3 个官方没告诉你的坑
B站开源零样本音色克隆,一段参考音频就能克隆音色。我在 Apple Silicon 上实测了一周:免费、离线、数据不出本地,但部署折腾、Mac 上比官标慢 40 倍,且官方反复推荐的 use_emo_text 我实测开了反而更不自然。附 RVC / GPT-SoVITS / Fish Audio / MiniMax / ElevenLabs 替代对比。
B站开源零样本音色克隆,一段参考音频就能克隆音色。我在 Apple Silicon 上实测了一周:免费、离线、数据不出本地,但部署折腾、Mac 上比官标慢 40 倍,且官方反复推荐的 use_emo_text 我实测开了反而更不自然。附 RVC / GPT-SoVITS / Fish Audio / MiniMax / ElevenLabs 替代对比。
「lanshu-create-ai-presenter-video」是一个面向 Codex 的开源数字人视频技能(MIT,Python,913⭐):给它主题/文案和一张授权人物图,它自动组织文案、配音、人物生成、口型校准、字幕、关键词动效、剪辑、渲染和质检,一条龙产出带实时字幕+封面的成片,且源码不绑定任何厂商/模型。适合做知识口播、产品讲解、课程/培训口播的创作者。注意它是给 Agent 用的技能、不是独立 App;开源的是编排,配音/人物生成的模型能力本地没有仍需付费;人物图须获授权且为清晰成年人。
「输入一句话就出大片」是 AI 视频最大的幻觉。我实测了 MiniMax H3 文生视频 API:能自己拼出成片,但真实工作量是「分镜 → 逐镜头生成 → 抽帧质检 → 精剪拼接」的工程活,且动作时机不可控、跨镜头风格会漂移。附可灵 / 即梦 / Runway 对比,告诉你怎么选最省心。
作为内容创作者,我把 16 个高频工具装进一个本地工作台「轻作」。这篇是创始人视角的诚实复盘:它真正解决了什么、有哪些只有我用了才知道的坑(AI 选题/知识库仅限本机、全网热榜其实接不全、清浏览器数据会丢选题清单)、以及它到底适合谁。附在线演示版与本地运行方式。
我把一套几百款热门克隆音色包下载用了。先说结论:数量不等于质量。真正稳定的是按「角色/气质」而非「情绪」分的那几款,而且一个亲手处理干净的参考音频,比几百款现成卡包更有用。附正确找音色的做法 + 适合谁/不适合谁。
Firecrawl 开源的文档转换神器:Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV、PDF 一键转成 GitHub 风格 Markdown。纯 Rust、本地运行、免费开源,实测单文档仅 4.4ms,比 LibreOffice 快 200 多倍,还自带 Agent Skill 让任何 AI 助手能读 office 文档。
CopilotKit 开源的 AI 同事平台:每个 Agent 拥有一台独立容器电脑(自带浏览器、文件、工具),所有动作先决策后执行、全程留痕,MIT 协议 + 「缺策略即禁止」的网关边界。自带 AG-UI 接口,可接入任何 Agent,自托管部署。
Cursor 不仅是 AI 代码编辑器,现已加入 Coding Agent、Cloud Agents 和 Origin 代码托管。支持 GitHub 同步,让开发者在同一环境完成编码、审查与协作。
Dayflow 是一款 macOS 自动工作日志工具,通过 AI 分析屏幕活动,生成时间线、Standup 和周报,支持本地模型,注重隐私。
holaOS 是开源桌面工作区,统一管理项目记忆、文件与 MCP 工具,使 Claude Code、Codex 等 Agent 共享环境,减少重复配置,支持 BYOK 与 Ollama。
AiMaMi 是一款开源桌面应用,专为 Codex 用户提供账号额度、会话历史、MCP/Skills 及第三方模型路由的集中管理,通过图形界面简化本地配置操作。
Speech To Markdown 是一款本地优先的语音转 Markdown 工具,Mac 版用 Whisper 和 Agent Mode,iOS 版依赖苹果端侧 AI,功能与配置各有不同。
CodexThemes 是一个为 OpenAI Codex 桌面端打造的第三方主题社区,通过 Agent Skills 实现主题的自动查找、下载、安装与切换,用户只需复制提示词即可。
考搭子是一款开源AI备考工具,帮你把课件、笔记、PDF等资料统一整理,自动生成复习计划、模拟题和记忆卡片,支持BYOK模式,灵活控制成本。
Everywhere 是一款屏幕上下文感知的桌面 AI 助手,能直接在当前窗口呼出,理解你正在看的内容,减少复制粘贴与窗口切换,支持多模型与本地部署。
Qwerty Learner将打字背词、盲打练习与离线AI口语对话结合,支持370+词库,本地数据处理,适合多种学习场景。
OpenBidKit 易标是一款开源桌面 AI 标书工具,整合招标文件解析、企业知识库、初稿生成与废标检查,支持本地模型,兼顾数据安全与效率。
Can I Run AI 是一款在线硬件检测工具,通过浏览器读取电脑配置,评估能否流畅运行本地大模型,并给出运行等级和量化建议,帮你避免下载后跑不动的尴尬。
MioSub 是开源跨平台字幕工具,整合转录、翻译、对齐与压制,支持 YouTube/B站链接与音频文件,适合长视频字幕流程,需自备翻译 API Key。
AirTranslate 是一款 macOS 开源工具,可直接捕获系统音频进行转写和翻译,并以悬浮字幕呈现,适合观看外语视频或参加跨国会议的用户。
Violin 是开源 AI 视频翻译工具,支持 33 种语言,通过 CLI 或 Web 界面实现全流程自动化,让用户自由选择模型与API,控制成本。
OpenCyvis 是一款基于 Android 的开源 AI 代理,通过虚拟显示器在后台执行任务,支持多模型选择,但需要系统级集成,门槛较高。
deep-printfilm 是一款本地可视化工作台,旨在整合 AI 短剧制作中的剧本、角色、关键帧与视频片段,解决流程碎片化与角色不一致问题。
无需后端,纯前端工具在浏览器内自动切分长音频,对接讯飞 API 识别,合并输出文本。适合自备 API 凭证、追求成本控制的用户。
CyberVerse 是一个开源框架,将 LLM、语音与 WebRTC 融合,让你通过一张照片生成数字人,实现实时视频通话。本文解析其架构、部署门槛及适用人群。
这不是一个简单的提示词合集,而是一套结构化的 Prompt 协议框架,教你将画面拆解为变量,适合开发者、自动化玩家和设计初学者。
VisionCull Pro 是一款本地 AI 选片工具,专为摄影师初筛废片设计。它通过 OpenCV 和 MediaPipe 检测清晰度与人脸闭眼,非破坏性复制合格照片,保护原始图库。适合大批量拍摄且注重隐私的摄影师。
OtterHub 利用 Cloudflare Pages 和 Telegram Bot API,实现无需服务器维护的私人文件存储,支持大文件分片上传、视频流播,适合轻量级自用。
Track Policy将分散的法案、数据中心项目与新闻整合于交互地图,助您快速把握区域监管风向,适合出海与算力调研。
SpokenType 不止于语音转文字,还能自动清理口语、整理表达,支持翻译、上下文回复与自定义技能,提供本地/云端双模式。本文实测其核心能力,帮你判断是否值得入手。
GEOFlow 是一款开源内容生产系统,面向 GEO 和 SEO 场景,提供素材管理、任务调度、审核流及前台展示,适合搭建自动化内容站。
Input 0 是一款开源 macOS 语音输入工具,将语音转录在本地完成,并支持接入自定义 LLM 润色文本,适合对数据隐私敏感的用户。
飞搜FeiSou聚合全网公开飞书文档,支持跨库检索、知识库聚合与Markdown导出,并提供API/Skill供AI助手调用,但免费版每日仅6次查询。
一位开发者用 Claude Code 两天搭建了巴菲特股东信知识库,将几十年信件转化为概念、公司、人物相互关联的网络,支持知识图谱检索,是 AI 工作流的绝佳案例。
Open MedKit 是一款基于 Docker 的开源系统,支持自然语言录入、MCP 接入和 Webhook 推送,将库存管理与 AI 工作流结合,适合自部署爱好者。
AI 编程订阅费用看似相近,实则差异巨大。本文从额度刷新、调用上限、中文 Token 消耗等维度,深入对比 Cursor、Copilot 及国产方案,助你精准决策。
Text2Voice基于Edge TTS,提供免登录的在线文本转语音服务,可快速生成MP3,适合短视频、外语学习等轻度场景。
用5美元打造私人 AI 助手?MimiClaw 开源项目让 ESP32-S3 运行 Claude,支持 Telegram,低成本、私有化,适合硬核极客。
基于Faster-Whisper和yt-dlp,支持30+平台,提供高精度转录、智能优化及多语言摘要,适合内容创作者与教育场景。
Hard Usernames是一款免费无注册的AI用户名生成器,输入兴趣即可秒出多个风格化用户名,适配各类主流平台,助你快速锁定理想ID。
py-xiaozhi是一个基于Python的AI语音客户端,让你无需专用硬件即可在电脑上体验实时对话、语音交互和智能家居控制,支持多协议与多模态功能。
Vibe Draw是一款基于AI的2D草图转3D模型工具,支持草图美化、一键生成3D模型并编辑,可导出glTF格式,适用于设计师、开发者和创意爱好者。
腾讯混元T1深度思考模型发布,MMLU-PRO得分87.2,推理效率提升100%,成本大幅降低,已在腾讯元宝上线。
这款免费AI卡通生成器支持文生图与图生图,能将照片或创意秒变迪士尼、动漫、3D等风格,提供20+艺术风格,批量处理,4K输出,隐私保护,零门槛操作。
AI Fortune Teller结合传统命理与AI技术,提供免费在线八字测算,覆盖事业、爱情、财运等维度,生成个性化运势报告,助你洞察人生方向。
叮当好记利用AI技术,将音视频内容高效转为结构化文字,支持多平台解析、翻译、总结及导出,适用于学习与办公场景。
Gemini Search是一款免费开源的AI搜索引擎,采用Gemini 2.0 Flash模型和实时网络搜索,提供引用、追问等功能,界面简洁现代。
Gemini Teacher 是一款基于 Gemini AI 的英语口语练习工具,支持实时语音识别、发音评估、语法纠正和情景对话,提供针对性指导,需 Python 3.11+ 环境。
Meta推出的Imagine with Meta AI,基于Emu模型,输入文字即可生成图像。每轮生成四张1280x1280图片,带水印,需Meta账户,类似DALL-E 3和Midjourney。
Boardmix博思白板集AI生成PPT、思维导图、代码等多功能于一体,支持多格式导入导出,适合产品、设计、教育等场景,但需注册且有试用限制。