音频与音乐

音频与音乐产品

精选音频与音乐领域的优秀初创产品与工具,涵盖 AI 配音与语音合成、文字转语音、语音克隆、AI 音乐生成与作曲、播客制作、人声分离与音频降噪。在初创.work 发现好用的声音创作产品。

共找到 113 个产品
筛选和排序 →
KITS AI

KITS AI

KITS AI 是面向音频工作者的编辑处理和人声转换工具。

KITS AI 在音乐制作工作流程中提供AI人声处理工具,从人声音高校正、人声隔离丶音频乐器轨道分离以及 AI 母带工具最终处理您的作品。 克隆你自己的唱歌和说话模型,或通过社区AI语音库,最低成本使用知名歌手本人亲自克隆和授权的声音模型完成你的作品。 将工作流程的每一步都提高 10 倍,让你能够减少在语音编辑工作中花费的时间,将更多时间用于灵感创作。
Elevenlabs

Elevenlabs

市面上最逼真的 AI 语音,为社交媒体、广告、电影等生成高质量的画外音。

可以说 70+ 种语言,多语言文本转语音模型与有助于国际受众建立联系。 具有丰富情感,响应文本中的情感线索,并调整其交付以适应即时内容和更广泛的上下文。 克隆你自己的声音模型,或选择语音库内的数千个高品质语音,也可使用自定义创建从头开始创建新的 AI 语音。 无论您是制作有声读物、视频还是交互式内容,都可以找到完美的声音来将您的愿景变为现实。
NoemaLab 创作实验室【Beta】

NoemaLab 创作实验室【Beta】

致力于如何让音乐创作者在 AI 辅助下,仍然保持对音乐作品的控制权与表达意图。

你的想法 —— 旋律、情绪、画面 —— 都是真实的创作素材。 但它们在变成作品之前,往往还只是一种「感知」。 我们提供专业的各种 AI 音乐工具:音乐理解、音乐生成、AI 音乐检测、Prompt 提示词打分等。 Noema Lab 不是「AI 音乐一键生成」的平台。 我们专注于这个最关键的环节:帮你把模糊的感知,转化为 AI 能理解的精准指令。
ListenLeap

ListenLeap

通过播客提升英语听力的在线学习平台。

ListenLeap: 用播客重塑你的英语学习体验,从“听懂”到“脱口而出”只需一步! 为什么选择ListenLeap? “碎片时间学英语”从未如此高效! 【学生党】雅思听力8分的秘密武器,跟读+精听,双管齐下。 【职场人】商务会议、邮件报告、行业术语,用播客助力职业晋升之路。 【宝妈&儿童】睡前故事、趣味儿歌,让孩子在“沉浸式英语环境”中自然学会地道发音。 【自律达人】通勤、健身、做饭……随时随地“磨耳朵”,杜绝时间浪费与无效努力。 核心功能:科学设计,直击学习痛点 资源为王:你的专属英语播音站 【10,000+全球精选播客资源】覆盖新闻、商务、文化、考试、亲子、生活、历史等20+垂直领域,BBC、TED、NPR、AEE等知名播客每日同步更新,iTunes、Spotify热门播客资源全面收录。 【智能分类+人工精选】可靠的难度智能评分系统、广泛的应用覆盖场景,精准筛选,匹配你的学习目标。 【自定义你的播客宇宙】精选列表不够?支持自选播客,覆盖全网资源,无论是小众频道还是热门节目,一键收藏,打造你的专属学习库! 播放黑科技:从“被动听”到“主动学” 【播放联动】 · 双语对照:中英字幕配合无痛听懂播客,长按生词即时翻译,附带解析+发音示范; · AI智能字幕:调用当下最先进的AI大语言模型,提供通顺流畅的翻译文本,结合后台人工审核校对,实现丝滑双语切换; · 盲听模式:一键遮挡字幕,专注听力提升; · 单词提示:高亮标注重点词,自选雅思、托福等难度; · 单句循环:反复精听难句,彻底攻克“连读弱读”。 【学习进度记忆】断点续播+跨设备同步,通勤听一半?回家用网页版继续! 【倍速播放】0.5x慢速拆解复杂对话,2.0x快速适应母语者语速。 AI教练全程陪练:比家教更懂你 【跟读评分系统】AI即时评分并实时分析发音准确度、流利度、语调。 【智能AI讲解】即时划词,AI讲解全覆盖,不再受教材资料提供的知识点限制。 【深度追问功能】想知道更多?在AI讲解下继续追问,从语法结构到文化背景,打破砂锅问到底! 【智能笔记】高亮重点内容,一键生成详细的笔记卡片,支持保存AI讲解并同步至网页端整理。 资料自由:学练一体,效果翻倍 【离线音频】支持缓存播客音频,断网环境也能继续学习。 【文稿下载】导出PDF字幕稿至本地,可打印纸质版,随时随地阅览跟读。 【独家资料包】经典播客配备配套录音稿对照与知识讲解练习PDF,助力高效练习。 成长可视化:坚持更容易 【学习记录】每日英语听力记录,打卡解锁图表,累计时长生成学习曲线图,成就感拉满。 【多端同步】手机记录碎片学习,网页版大屏深度复习,进度无缝衔接。 ListenLeap网页版:多端英语学习中枢 【大屏沉浸式学习】更大的屏幕,更清晰的界面,更方便的操作,高清字幕+多窗口笔记,适合精听训练、资料整理。 【跨设备无缝切换】手机听过的播客,电脑端继续做练习,学习永不中断。 立即体验:listenleap.com
RapFlow AI

RapFlow AI

输入歌词或描述创作你的专属说唱。

灵韵音乐是一款基于 AI 大模型与音乐生成技术打造的智能音乐创作平台,面向 普通用户、内容创作者及音乐爱好者,让“不会写歌的人,也能轻松创作完整作品”。 从一句灵感开始,到完整歌曲生成,只需几步。 🌟 产品定位 低门槛 · 高效率 · 可商业化的 AI 音乐创作工具 不需要专业乐理 不需要作词作曲经验 不需要音乐制作软件 人人都能成为“音乐创作者”。 🚀 核心功能亮点 🎵 1. AI 智能歌词创作 支持 主题 / 风格 / 语言 / 情绪 多维度定制 自动生成结构完整、押韵自然的专业歌词 适合流行、民谣、电子、说唱等多种风格 一次生成,多次优化,灵感不断 示例: “写一首关于友情的流行歌曲,温暖治愈风格” 🎶 2. 歌词一键生成歌曲 基于 Suno API,将歌词直接转化为完整歌曲 自动生成旋律、编曲和演唱 输出可播放音频,真正“听得见”的作品 支持歌曲生成状态查询,稳定可靠 👤 3. 多端用户体系 Web 端完整功能支持 微信小程序快速登录 用户数据统一管理,作品云端保存 支持昵称、头像等个性化信息 💎 4. 积分系统(商业化基础) 注册即送 100 积分 生成歌词 / 歌曲按次消耗 支持积分流水记录,规则清晰透明 为后续 充值 / 会员 / 套餐 扩展预留空间 ❤️ 5. 作品管理与收藏 查看「我的歌词」「我的歌曲」 歌曲收藏功能,打造个人音乐库 支持播放次数统计,增强创作成就感 🎯 典型使用场景 🎤 内容创作者 / 自媒体 B 站、抖音、快手原创背景音乐 视频配乐、主题曲快速生成 提升内容独特性,避免版权风险 🎮 游戏 / 应用开发者 游戏背景音乐、角色主题曲 剧情配乐快速生成 降低外包作曲成本 🎁 情感 & 社交场景 定制生日歌、纪念日歌曲 情侣 / 友情 / 家庭主题音乐 让情感表达更有“声音温度” 🎧 音乐爱好者 / 初学者 不懂乐理也能创作完整歌曲 灵感验证工具,快速试听效果 辅助专业音乐人进行创作尝试 ❓ 常见问题 FAQ Q1:生成的歌曲可以商用吗? 取决于所使用的 AI 模型和音乐生成服务的授权协议。平台建议用户在商业使用前确认相关版权条款。 Q2:不会写提示词也能用吗? 可以。系统支持简单自然语言描述,例如: “写一首失恋但不悲伤的歌” Q3:生成失败会扣积分吗? 不会。只有在生成成功后才会扣除对应积分,失败任务可重新尝试。 Q4:可以多语言生成吗? 支持中文、英文等多语言歌词生成,具体取决于模型配置。 Q5:后续会支持哪些功能? 歌曲风格更细分 AI 翻唱 / 改编 歌词二次润色 积分充值与会员体系 作品分享与社区 📈 适合的产品发展方向 AI 音乐 SaaS 平台 小程序 + Web 双端变现 内容创作工具型产品 创作者经济 / AIGC 赛道
YouNavi

YouNavi

专注于对话分析与洞察场景的 Agent 产品。

YouNavi 是一个专注于对话分析场景的 Agent 产品,通过一键整合高密度对话上下文(会议、访谈、独白、播客等,支持本地录音,导入主流会议软件、主流录音硬件等),采用 Agentic 架构进行长程任务推理分析,发掘言外之意、锁定关键信息。 为创业者、OPC、管理者、投资人、咨询顾问、销售顾问、HR、教师、采访者等高频沟通人群提供录音转写、洞察分析、深度研究与决策建议,并完成一切衍生的案头工作成果,让每一场会议、访谈、沟通都沉淀为可执行的洞察。 【产品功能】 全渠道上下文无感采集: 会议软件同步:自动同步腾讯会议、飞书、钉钉等在线会议平台的会议内容,,打通分散的对话上下文。 录音硬件接入:支持 Plaud、安克飞书录音豆、钉钉A1录音卡、TicNote、得到GetSeed录音卡、讯飞录音笔等智能录音硬件的数据同步,以及手机录音和电脑本地文件夹的自动监测与上传。 常见录音工具:支持通义听悟、千问APP录音同步,iPhone、AppleWatch录音则可以通过iCloud同步至Mac后,通过“苹果语音备忘录”同步至YouNavi。 系统录音:支持 Mac/PC 客户端桌面后台录音功能,能够不限时长记录麦克风和系统音频,并免费转写文本。 本地文件夹同步:支持按照层级结构同步任意一个/多个本地文件夹的全部文件,实现跟您本地文件系统的无感互通。 CLI调用:支持飞书、钉钉、企业微信、腾讯会议等的官方CLI调用,实现对应平台日历日程、文档、表格、聊天、群聊等信息的接入。 未来支持更多的信息同步:更多在线文档、IM、邮箱、播客、直播等。 数据本地存储确保隐私安全:数据同步过程、处理过程和存储都在本地执行,确保私密对话的安全性。 Agentic 索引与检索: 采用 Agent 驱动的方式,在海量私域上下文(会议录音、文档等)中精准定位对当前问题最有帮助的背景信息,并结合公网信息与专家库,在准确度和分析深度上远超 RAG 方案。 复杂长周期上下文的深度分析: 上下文串联:不同于市面上常见的 “单次会议总结”,YouNavi 能跨越时间维度(如数月),将多次讨论、随笔和文件关联起来,分析某个项目或想法的演进过程,识别长期对话中呈现的趋势、矛盾点以及思维模式的变化。 水下信息挖掘与洞察:挖掘会议或访谈中各方未达成一致的隐性冲突或独特观点,分析参与者的情绪波动曲线,识别沟通中的认知盲区和思维惯性,提供类似 “军师” 视角的深度解读。 支持特定场景(如早期投资分析、创业者支持、咨询场景、战略分析场景、用户访谈与产品分析、候选人分析、销售商机分析等):挖掘投资人质疑点、战略决策演变逻辑、候选人前后矛盾等能够直接辅助关键决策的深层信息。 交付与长期记忆: 结构化输出:生成会议复盘、工作周报、用户调研报告、咨询建议报告、共识地图、IC 投决会 Memo 等专业文档。 记录和学习用户决策习惯的长期记忆: 主动学习用户的判断偏好,使未来的建议更加贴合用户。 支持专业输出Skill:支持一键导入已有Skill,并支持各类知识工作场景的专业内置Skill,您也可以直接定制您需要的skill,将沟通录音一键变成符合您个性化需求的任何形态内容,如洞察报告、PPT、网页、图片等等。 移动端支持使用微信/飞书扫码绑定、通过微信/飞书/钉钉 IM来跟Navi对话 【典型场景】 会议、沟通、播客内容的个性化总结、备忘 项目路演、企业咨询、合作沟通、用户访谈、面试、电销等场景的录音分析 结合个人记忆,复盘长周期的项目、梳理人脉、识别非共识与潜台词、洞察心底之问与关键之人等等 YouNavi 希望最终能将每位用户的个人对话等上下文从 ” 模糊印象 “转化为可检索、可分析的工作记忆与长期个人认知资产。
lemonpod

lemonpod

将用户的数字生活转化为个性化 AI 播客的工具。

【产品介绍】 Lemonpod.ai 是一款将用户的数字生活转化为个性化 AI 播客的工具。 该产品通过整合用户的日历日程、运动数据、代码提交记录及音乐收听历史,利用 AI 技术自动生成每日生活简报和每周深度回顾。 用户可以在早晨通勤或闲暇时,以听书的方式高效回顾昨日亮点并预览今日待办,实现个人数据的音频化管理。 【产品功能】 多源数据整合:支持连接 GitHub、Google Calendar、Strava、Last.fm、Todoist 及 X 等应用,全方位聚合个人生活与工作数据。 个性化 AI 主持:提供多种性格迥异的 AI 主持人角色(如热情型、直率型或暗黑幽默型),并在 Core 计划中支持双主持模式。 便捷收听体验:自动生成每日 510 分钟短播客及每周长回顾,支持通过 RSS Feed 推送至 Apple Podcasts 或 Overcast 等主流应用收听。
MeowTXT

MeowTXT

在线 AI 音视频转文字工具。

【产品介绍】 MeowTXT 是一款在线 AI 音视频转文字工具,致力于通过人工智能技术将媒体内容快速转换为文本。 该平台具备高达 97.5% 的识别准确率和 40 倍于实时的处理速度,能够高效满足用户对于转录、翻译及内容摘要的需求,简化从媒体到文本的工作流程。 【产品功能】 多源导入与录制: 支持 MP3、MP4 等多格式文件上传、YouTube 链接直接导入及内置录音功能。 AI 智能处理: 提供 AI 摘要生成、ChatGPT 深度分析接入以及 100+ 种语言的即时翻译。 灵活导出与分享: 支持导出 PDF、TXT、DOCX、SRT 字幕等多种格式,并可生成安全链接进行在线分享。
AceStep v1.5

AceStep v1.5

开源版Suno——更快、更强。

前言 ACE-Step 1.5 是一款开源音乐模型,在 A100 显卡上仅需约 2 秒即可生成完整歌曲。支持本地运行,显存占用仅需 4GB 左右(普通 PC 即可畅玩),且在多项主流评测指标上均超越了目前的顶级商用及开源模型。 目前,这个领域基本被商用闭源模型垄断。这意味着我们的“创作权”往往被绑定在特定的 App 或模型上。一旦失去访问权限,或者模型发生了非你所愿的变动,你的创作能力可能一夜之间受到打击。 通过 ACE-Step 1.5 ,我们希望打破这种依赖,为世界提供一个真正具有竞争力的开源选择。我们认为创作者应当能够:在自己的电脑上运行并完全掌控模型;使用自己的作品进行 Fine-tune (微调);无需再为隐私和数据泄露感到焦虑。 核心特性: 🚀 极速生成:在单卡 A100 上,生成一首 3 分钟的完整歌曲仅需约 2 秒。在消费级显卡上表现依然出色:RTX 3090 约 10 秒即可完成,且显存占用仅需 4GB 左右。 🎧 专业品质:在主流评测指标( SongEval & AudioBox )上,其表现已超越 SUNO 等商业模型,并与现有的开源模型拉开了显著差距。 🎨 高灵活性:创作者只需提供少量歌曲即可训练专属 LoRA ,精准捕捉并复刻特定的音乐风格。 🛡️ 安全合规:训练数据完全基于授权素材 + 合成数据,规避版权争议。 🔧丰富且实用的功能: 全曲生成 (Full song generation) 翻唱/封面重绘 (Song cover / Repainting) 伴奏音轨叠加 (基于现有轨道添加 Stem) 生成式音轨拆分 (Generative stem splitting) 歌曲续写/补全 (Song completion) 由于其极快的生成速度和本地运行的特性,ACE-Step 1.5 解锁了许多全新的工作流: 一、批量生成 + 自动评分 (Batch Generation & Auto Scoring) 得益于本地部署的高效率,你完全可以针对同一个 Prompt 一次性生成 100 个版本,从中挑选最完美的一个。 为了配合这一工作流,我们同步开源了一个 Reward Model (奖励模型)。你可以让模型自动为这 100 首生成的歌曲打分,你只需要直接导出分数最高的那首即可。这种“大力出奇迹”的方式能让你在极短时间内获得高质量的成品。 二、LoRA fine-tuning: 只要有几首歌,或者几十首歌,你就能训练自己的 LoRA 。在我们的实验中,我们用 8 首春节风格的歌曲训练了一台 LoRA 。之后,当我们创作出完全不同的曲风,比如情歌、爵士和摇滚时,它们都带有浓厚的中国新年氛围。LoRA 让创作者可以用自己的音乐微调风格。它从你的歌曲中学习,捕捉你的风格。而且因为你本地运行,你拥有 LoRA ,不用太担心数据泄露。 三、Cover 输入任意歌曲,然后提供提示和歌词,你就能将曲目转换成不同的风格。我们尝试过把一首以人声为主的流行歌曲改编成合成器驱动的器乐舞曲,也尝试把一首柔和的女声歌改编成男性摇滚版本。这与《 SUNO 》的翻唱特色略有不同:它保留了输入歌曲的结构和时长,但重新构想了旋律和乐器编制。你用它打造什么取决于你的创造力,我们迫不及待想看到你的作品。 四、Repainting: 这是个非常方便的功能。你加载一首歌,选中一段,点击“Repaint”,然后重新生成该段,同时保持之前和之后的音频。如果你不喜欢一小部分很棒的赛道,可以继续重新粉刷那段。是的,ACE-Step 很快,所以你可以重涂 100 次,选中你喜欢的那个。 五、Vibe DJ — 一款有趣的社区应用 利用 ACE-Step 的本地运行时、高速和重绘功能,一位社区开发者开发了一个非常酷的应用,叫 VibeDJ 。每次输入提示时,模型都会生成一个固定长度的片段并播放。播放时,你输入下一个提示,然后用 Repaint 生成下一个片段,这样它就能无缝连接上一个片段。这能让任何人通过自然语言提示变成 DJ 。你是通过打字而不是混音来“DJ”的。想象一下,在家庭派对上拿出笔记本电脑,为大家现场主持一场 VibeDJ 表演。这正是本地实时生成所能实现的。 ComfyUI 集成 我们很高兴地告诉大家,ACE-Step 1.5 已经在 ComfyUI 上提供,这得益于他们的 day-0 支持 🙌 教程(如何在 ComfyUI 中使用 ACE-Step 1.5 ): https://blog.comfy.org/p/ace-step-15-is-now-available-in-comfyui 在 ACE-Step 1.5 中,唯一的限制就是你的想象力 请在这里探索 ACE-Step 仓库👇 https://github.com/ace-step/ACE-Step-1.5 如果你喜欢 ACE-Step 1.5 ,请帮忙给仓库加星号!
Dangcingai

Dangcingai

AI 自动配音・粘贴URL链接即出片・10 种语言一键生成。

🧠产品简介 Dangcingai 是一款 AI 自动配音工具:只需要粘贴视频链接或上传本地文件,AI 就会自动分析视频画面和原声,生成配音文案并合成语音。 它支持中、英、日、韩、法、德、西、葡、俄、意 10 种语言,提供9 种不同音色,并包含3 种创作模式(自动配音 / 翻译原声 / 自定义文字),可以一键生成可下载的配音视频。 整个过程无需剪辑软件、无需语言能力、无需音频制作经验。 🎬产品故事 很多时候我们看到一个很棒的视频,想分享给不同语言的朋友或粉丝,但手动翻译、配音、剪辑往往需要花费大量时间。 Dangcingai 的目标很简单: ✨让跨语言视频创作像复制粘贴一样简单。 只需要粘贴一个视频链接,选择语言和音色,AI 就会自动完成整个流程: 1️⃣ 抓取视频 2️⃣ 识别原声并分析画面 3️⃣ 生成目标语言的配音文案 4️⃣ 合成自然语音 5️⃣ 输出最终配音视频 整个流程自动完成,真正实现一键视频配音。 🌍核心功能 🌐10 种语言支持 中文、英语、日语、韩语、法语、德语、西班牙语、葡萄牙语、俄语、意大利语,每种语言都针对视频解说进行了优化。 🎤9 种音色选择 5 种男声 + 4 种女声,从沉稳到活力,从温柔到俏皮,满足不同内容风格。 男声: 🎙 Uncle Fu(沉稳) 🎙 Dylan(活力) 🎙 Eric(沙哑) 🎙 Ryan(阳光美式) 🎙 Aiden(动感) 女声: 🎙 Vivian(明亮犀利) 🎙 Serena(温柔温暖) 🎙 Ono Anna(俏皮) 🎙 Sohee(感性) 🎬3 种创作模式 🤖 自动配音 AI 分析视频画面 + 原声 + 文本信息,自动生成解说并完成配音。 🌐 翻译原声 语音识别 → 翻译 → 重新配音,尽可能保持原视频表达。 ✍️ 自定义文字 直接输入想要的配音内容,自由创作。 ✨创作提示(Prompt) 可以输入风格指令,例如: 🧑‍🔬 “科技测评专业风格” 🌿 “温柔治愈系旁白” 📺 “纪录片解说风格” AI 会按照你的创作意图生成配音内容。 🔊原声处理 可选择: 🔇 完全去除原声 🔉 保留原声并叠加 AI 配音(音量 10%–80% 可调) 📦即用即走 Dangcingai 采用 Web 界面操作: ✔ 无需安装软件 ✔ 在线生成视频 ✔ 支持直接预览与下载 ⚙️技术亮点 Dangcingai 通过多个 AI 模型协同工作完成视频理解与配音: 🤖 语音识别 👁 视频画面理解 🧠 文案生成与翻译 🔊 语音合成 同时具备: ⏱音频时长自适应 自动调整语速,使配音精准匹配视频长度。 🌐多平台视频获取 支持 YouTube、X / Twitter、Reddit、Vimeo 等50+ 视频平台。 ⚡多任务并发处理 支持多个视频任务同时处理,互不影响。 🎯使用场景 🌍 跨语言分享 把喜欢的视频快速分享给不同语言的朋友或粉丝。 ♻️ 内容二创 将英文热门视频重新配成中文解说。 📚 知识搬运 翻译技术、教育或科普类视频到目标语言。 📱 自媒体运营 同一视频快速生成多语言版本,扩大传播范围。 🎧 语言学习 用目标语言重新配音熟悉的视频,帮助学习和理解。 💡一句话总结 Dangcingai 让视频跨语言传播变得像复制 + 粘贴一样简单。 🎬 粘贴视频 → 🌍 选择语言 → 🎤 AI 自动生成配音视频。
speakoala

speakoala

全格式 AI 语音助手,真人音质、多速调节、多款背景音沉浸读屏,解放双眼高效听书。

Speakoala:您的全能网页听书助手 全场景智能朗读 一键转语音: 支持网页文章、新闻、博客、电子邮件以及社交媒体内容的即时朗读。 本地文档支持: 直接上传 PDF、DOCX、EPUB 等本地文件,将文档秒变“有声书”。 自然流畅的听觉体验 超拟真人发音: 提供超过 300 种 AI 语音,涵盖 70 多种语言(含中文、英文等),语调自然,告别机械感。 环境音渲染: 独家支持背景环境音(如雨声、图书馆、白噪音),营造沉浸式阅读氛围。 高效的学习与办公工具 语速自由调节: 支持 0.25x 至 4x 语速调整,满足快速扫读或精听学习需求。 划选朗读与框选: 鼠标选中任意文字或框选特定区域即可立即发音,精准控制阅读进度。 音画同步追踪: 朗读时高亮显示当前单词,方便视觉跟随,提升理解效率并保护视力。 随时随地的生产力释放 解放双手双眼: 在通勤、健身或家务劳动时持续获取信息,缓解视觉疲劳,利用碎片化时间完成长篇阅读。 核心优势: 多平台覆盖: 支持主流浏览器插件。 高性价比: 提供基础免费语音,高级自然语音订阅价格极具竞争力。 隐私安全: 无需复杂设置,即装即用。
Melory

Melory

发现音乐背后的故事。

每一首歌被写下,都有它的理由。Melory 利用 AI 编辑,带你了解这些旋律的时代语境、创作初衷和情绪表达。 当你知道了它为何而写,再次按下播放键后,你听到的不再只是旋律。 【核心功能】 ◎ 音乐故事:不止于听,了解歌曲幕后、创作和情绪。 ◎ 自动同步:正在听歌?打开后直达当前播放的音乐。 ◎ 听歌识曲:偶遇好旋律?一键识别,了解它的故事。 ◎ 探索发现:浏览推荐,或者直接搜索你喜欢的歌曲。 ◎ 边看边听:通过 AM 播放,让旋律与故事同步呈现。 ◎ 收藏分享:收藏喜欢的故事,与朋友分享你的品味。
TypeNo

TypeNo

极致极简的 macOS 开源隐私语音输入工具。

【产品介绍】 TypeNo 是一款专为 macOS 设计的开源、免费且优先考虑隐私的语音输入应用。 它的核心理念是 “极简主义”:无窗口、无设置、无账户。 通过短按 Control 键,TypeNo 能够捕获语音并实现本地转录,在不到一秒的时间内将结果直接粘贴至当前使用的任何应用程序中。该产品通过本地化处理确保数据安全,是追求极致输入效率用户的理想选择。 【产品功能】 一键极速输入: 通过短按 Control 键即可启停录音,识别结果自动粘贴至当前激活窗口并同步至剪贴板。 本地化隐私转录: 依托 marswave ai 的 coli 项目驱动,所有语音识别均在本地完成,无需上传云端,保障绝对的隐私安全。 多格式文件转录: 支持将 .m4a、.mp3、.wav 等音频文件直接拖入菜单栏图标,实现快速文本转录。 零配置系统集成: 无需复杂的偏好设置,仅需麦克风与辅助功能权限即可运行,完美集成于 macOS 菜单栏。
Aixcut

Aixcut

你的专属 AI 剪辑师。

💡没灵感剪故事? AI 自动创作专属故事线,成片自带叙事感,不用费脑构思! ⏱️剪片耗时长? AI 极速处理,字幕配乐一键搞定,数小时工作几秒成片,效率拉满! 📁素材堆成山? 智能识别高价值素材,自动梳理脉络,告别素材闲置浪费! 快剪不丢质感,短视频、品牌宣传、直播切片全场景适配,新手秒上手,专业党高效提效~ 解放机械操作,聚焦创意本身,让灵感即刻落地成优质作品! AixCut,重新定义 AI 高效剪辑✅
SaySo

SaySo

可在任何应用中将自然语音转换为格式化文本的桌面 AI 语音助手。

【产品介绍】 SaySo 是由宇生月伴(杭州)智能科技推出的精准听写工具。 它为 Mac 与 Windows 用户提供具备意图识别能力的语音转写体验。 该产品不仅追求更快的录入速度,更致力于智能理解上下文。 它能适应真实的工作习惯,将零碎的口头表达秒变专业文本。 产品采用隐私优先设计,确保语音数据不被存储、分析或用于训练。 用户的所有历史记录均安全保存在设备本地,实现 100% 的数据私密性。 【产品功能】 自动去除口癖:智能识别并剔除“嗯”、“啊”等口头禅及多余的重叠词汇。 智能结构化排版:自动将口述内容整理为列表、步骤和要点,无需手动调整。 实时智能修正:识别说话过程中的自我纠正行为,精准保留用户最终的表达意图。 语篇长度调整:支持一键将转写内容浓缩为清晰摘要,或将简短想法扩展为长文。 独家词库与翻译:支持专业术语个性化识别,并具备覆盖 100+ 语言的语境翻译能力。 隐私安全保障:坚持零数据留存承诺,任何第三方均无权访问或使用用户的语音数据。
来音制谱

来音制谱

全乐器数字乐谱创作编辑工具。

这是一款简单易用的乐谱制作软件,专为音乐爱好者和专业音乐人设计。简洁的键盘输入法,通过敲击所需音符即可生成乐谱。 你也可以通过 AI 拍照识别功能,快速生成智能乐谱,支持五线谱转简谱。 【多乐器多谱表】 可创建编辑钢琴、吉他、古筝、小提琴、尤克里里,声乐等乐谱,支持多 part 自定义乐谱编辑、五线谱/简谱/六线谱/弹唱谱/四线谱输入。支持歌词、指法、小节、线、装饰音、奏法、力度、记号等元素输入,让你可以轻松创作出美妙的音乐作品。 【编辑方式多样】 支持键盘输入法、内置键盘模拟器、MIDI 音频输入转谱,操作简单,上手快,让你创作乐谱更加得心应手,效率翻倍。 【智能拍照识谱】 如您有纸质乐谱,无需再亲自动手打谱,只需打开《来音制谱》 选择拍照上传,即可生成 AI 数字乐谱,更便于日常使用和携带。 【乐谱可播放】 支持乐谱的播放功能,编辑完乐谱之后,你可直接播放聆听你的作品,这将帮助你更好地预览和修改你的作品,极大的提升创作效率。 【可导出分享】 支持导出为 PDF、MusicXML、来音乐谱、图片等格式文件,让你可以随时保存和分享你的作品到来音旗下 app 或是其他音乐软件。
LocalMusic AI

LocalMusic AI

基于 Apple Silicon 芯片的本地 AI 音乐创作工具。

【产品介绍】 LocalMusic AI 是一款专为 Mac 用户设计的本地音乐生成效率工具。 该产品深度适配 Apple Silicon 芯片,所有 AI 模型推理过程均在本地设备端完成。 核心理念在于极致的隐私保护,确保提示词、歌词及生成的音乐内容不离开用户设备。 平台不收集任何个人数据、使用分析或地理位置信息,提供完全离线的创作体验。 软件通过沙盒化存储管理,保障了用户数据的安全性与自主权。 【产品功能】 本地 AI 音乐生成:内置 ACE-Step 模型,支持在离线状态下根据文本提示词生成完整音轨。 智能音轨分离:集成 Stem 分离功能,可将现有音乐文件中的人声与伴奏进行高精度拆分。 风格定制化:支持加载 LoRA 样式适配器,允许用户根据需求扩展不同的音乐流派与风格。 灵活生成模式:默认采用本地推理,同时也支持通过私有 API 密钥接入云端生成服务以应对复杂需求。 本地存储管理:所有生成的音乐作品、播放列表及个人设置均存储于本地沙盒空间中。
SpokenType

SpokenType

SpokenType —— 让沟通回归自然,让输入触手可及。

SpokenType —— 免费的AI语音输入法-说话自动去口气词-自动翻译-工具调用-自动上写文聊天回复 官网地址:https://spokentype.com 全场景 AI 智能语音协作专家 —— 现已开启公测 不注册用户每日有免费体验额度,注册用户每日免费体验额度更多,也可以付费体验更多额度。 【核心功能:实时翻译与高效输入】 即时同传级翻译: 支持母语实时转译。 全场景跨语言输入: 无论是邮件撰写、即时通讯还是文档编辑,实现目标语言的精准输出。 极速语音转文字: 效率较键盘提升 4 倍,录入速度达每分钟 220 字。 智能口语优化: 自动移除“嗯”、“啊”等冗余词汇,智能分段,变为高质量文章。 【智能交互:深度上下文理解】 AI 读屏与智能回复: 精准捕捉屏幕上下文,帮你自动回复。 一键意图驱动编辑: 支持选中文字后通过语音下达指令。精简、扩写、改变语气,生成创意回复。 交互式文本问答: 选中任何网页或文档内容,即可进行摘要提取、深度解释或翻译。 【个性化定制:精准与专业】 智能场景适配: 根据应用环境自动切换语调——邮件场景专业,聊天场景自然,文档场景清晰。 个性化词典: 记忆用户的专属术语、特定名称与表达习惯,实现极高的识别准确率。 多语言无缝切换: 支持 50+ 种语言,语言自动检测,多语言混说,沟通无国界。 【操作便捷】 快捷键触发: 短按快捷键快速启动
Aqua

Aqua

将语音实时转化为精准文本的 AI 语音交互工具。

【产品介绍】 Aqua 是一款旨在取代传统键盘输入的 AI 语音转文本效率工具。 该产品基于专有的 Avalon 大模型构建,在技术术语识别与长文本处理上的表现优于行业通用模型。 它能够实现跨平台的无缝集成,无需复杂设置即可在各类应用工作流中直接使用。 通过实时感知屏幕内容,Aqua 可以精准理解复杂的编程语法、框架名称以及专业背景知识。 产品高度重视用户隐私,转录历史记录仅保存在本地设备,不会上传至云端服务器。 【产品功能】 实时智能修正:在用户说话的过程中动态调整语法、精炼措辞,并根据上下文实时完成文本录入。 屏幕语境感知:自动识别当前屏幕显示的专业内容,显著提升在编程、提示词编写及学术写作场景下的准确率。 场景风格适配:支持根据目标平台自动切换对应的写作语气与排版格式。 深度自定义:提供自定义词典功能,支持用户预设特定行业术语、品牌名或人名,以实现个性化的精准识别。 多语言支持:原生支持 49 种语言,并允许通过自定义指令控制输出的结构与偏好。
SenseAudio

SenseAudio

一个致力于音频创作的AI语音开放平台。

AI,从声音开始。 行业领先的 AI 语音开放平台,定义音频创作的未来。 商汤 SenseAudio 是商汤科技基于日日新多模态大模型推出的 AI 语音开发平台。专为创作者及企业提供提供自然逼真的语音合成(TTS)、精准的语音识别(ASR)、殿堂级音乐生成、音色克隆与自定义语音 Agent 服务。 【核心亮点】 一、70 + 官方精品音色 专业配音演员 + 头部配音导演 + 资深算法工程师 精心呈现 富有情感、媲美真人语感、贴近真实应用场景的精品音色 覆盖多种年龄、演绎取向、音色特征;满足多种需求场景 二、音色克隆 & 文生音色 l SenseAudio音色克隆模型具备极强的模仿能力,仅需数秒声音素材,即可复刻高度还原的音色。不论是激烈的大声呼喊,还是细微的低声呢喃,SenseAudio 均可复现; l文生音色功能,为您打开构筑音色的想象空间。仅需一句话,文生音色模型即可为您生成定制化 AI 音色。 用户可以通过API调用音色克隆以及文生音色创作的音色,配合最新发布的SenseAudio-TTS模型,实现更加逼真的情绪表达、更稳定的声音输出。 三、形神兼备的 AI 语音创作工具,强大又高效 以下功能均提供 API 服务,接口设计兼容主流协议: l 强大的语音识别(ASR)模型,可实现低延时响应、精准识别、音频校验与深度语义理解,全方位满足各类语音识别需求 l 自定义 Agent,将自定义语音 Agent 转化为通用接口,享受简单、稳定、可靠的 API 服务 l 音乐生成模型,殿堂级编曲能力,一键演奏万千旋律 l 图片生成模型,极强的指令遵循能力,输出百变画风;寥寥数语即可成就点睛之笔 l 视频生成模型,极致的视听生成表现,让您掌控每一帧细节 🙋为什么要在 AI 语音平台中选择 SenseAudio? l 集成世界顶尖 AI 音频工具,开箱即用,省去冗余开发流程 l 成熟的音频数据采集方案,能为客户提供审美在线、贴近使用场景、无版权风险的声音产品 l 可靠、稳定、好用的 API 服务;速度快,兼容性强,资费极具性价比
sipsip.ai

sipsip.ai

支持将视频、播客转化为深度洞察的 AI 内容精炼工具。

【产品介绍】 sipsip.ai 是一款专注于提升信息获取效率的 AI 驱动型内容处理工具。 该产品的核心技术源自于在 GitHub 获得超过 2300 颗星标的开源项目。 用户可以将长视频、播客或文档上传,由 AI 自动提取其核心要点与关键信号。 产品致力于将冗长的原始素材转化为可快速阅读的结构化笔记与见解。 平台强调信息的“提纯”而非单纯的堆砌,旨在帮助用户节省处理海量内容的时间。 【产品功能】 智能转录与摘要:支持将 YouTube 链接或播客一键转化为带时间戳的转录稿及 AI 简报。 定制化每日简报:支持订阅感兴趣的频道,系统会定期自动生成内容综述供用户查阅。 多格式上传处理:兼容本地视频、音频、PDF 电子书及文章链接的深度解析与提取。 内容发现社区:内置 Sip Together 社区板块,方便用户收藏并分享值得关注的优质内容。
AI Rapper

AI Rapper

AI 说唱音乐,用Rap的形式评论一切

Rapper.im是个 AI 说唱生成器,可以把各种文章、热点事件写成一首歌,并唱出来。 比如一下使用场景: #情感表达 为她的写成一首生日歌:内敛的表扬她的聪明、乐观和直率。 #电影回顾 说说《心灵捕手》这个电影:天才少年和心理医生较劲,吵到最后才敢面对自己。 #实事点评 rap 下特朗普任期内做了哪些事,关税、边境、减税和争议都说清楚。 #总结文章 rap 下这篇讲 AI 裁员的文章:老板说提效,员工一边学工具一边担心工牌失效。 #足球讲解 rap 下昨晚那场欧冠决赛,先丢球、反击、绝杀,像老球迷复盘。 #短视频配音 奶牛猫 rapping 自己和铲屎官的日常生活,风格轻松幽默。
LoneIN

LoneIN

主打“情绪转化”的 AI 创作社交平台。

【产品介绍】 LoneIN 定位为一个温暖的创作角落,让难以言表的日常碎碎念通过 AI 技术转化为音乐与画作。 该产品旨在降低创作门槛,用户无需掌握复杂的提示词(Prompt),只需通过与 AI 人设的自然对话,即可将当下的心情和故事凝练为艺术作品。 核心理念是“让情绪成为作品,让作品沉淀关系”,通过情绪艺术日记的形式,帮助用户记录不同阶段的自我。 【核心功能】 聊创一体化:提供如温柔理性的“暖暖”或幽默犀利的“贱贱”等不同 AI 人设。用户在几轮对话后,AI 即可自动创作出专属歌曲或画作。 高自由度定制:支持自定义作品的配文、封面与歌名。提供 20+ 种音乐风格与 20+ 种画作风格选择,涵盖情人节、春节等多种节日场景模板。 情绪艺术日记:每一次创作都会被自动沉淀,形成个人的艺术时间轴,支持回看与复盘。 社区互动共鸣:支持作品发布至社区,提供点赞、评论与关注功能。同时设有匿名表达与内容审核机制,确保社交环境的安全性与私密性。
MuseAI

MuseAI

集 AI 音乐创作、音色克隆与社交互动于一体的综合性智能音乐社区。

【产品介绍】 MuseAI 是一款深耕人工智能音乐创作并致力于构建创作者社区的应用工具。 该产品将 AI 音乐生成与社交互动结合,支持从旋律编曲到歌词创作的全流程自动化。 通过集成推荐与热门榜单,用户可以沉浸式探索海量音乐作品与 MV。 平台提供不同层级的订阅服务,满足普通爱好者与专业音乐人的创作需求。 【产品功能】 多模式音乐创作:支持一句话极简写歌、基于经典旋律的热歌改编以及专业的“大师写歌”模式。 个性化 AI 翻唱与 MV 生成:支持训练专属音色卡片进行翻唱,并能通过一张照片与歌曲合成具备口型同步效果的 MV。 智能辅助工具:具备歌曲串烧功能,支持多语种及古典、流行、电子等多种风格的音乐生成。 社区互动与资产管理:内置点赞、评论、关注等社交功能,并提供私人音乐库用于有序管理作品与草稿。
OpenLess

OpenLess

开源、本地优先的语音输入效率工具。

【产品介绍】 OpenLess 是一款专为 macOS 设计的开源语音输入工具。 该产品主张本地优先原则,确保用户的音频、转写数据及历史记录全部存储于本地设备。 它采用 MIT 协议完全开源,旨在为用户提供一个透明、安全且无订阅负担的语音转文字解决方案。 通过简单的热键操作,用户即可将语音实时转化为结构清晰、打磨干净的文本或 Prompt 提示词。 【产品功能】 本地化隐私保护:数据不出本机,配置与凭证均存储在本地目录,保障核心隐私安全。 灵活接入云服务:支持用户自带凭证,兼容火山引擎 ASR 及 DeepSeek 等各类主流大模型接口。 跨应用光标跟随:兼容任意有光标的输入框,包括开发工具、笔记软件及社交沟通应用。 专注内容整理:模型仅负责对口述内容进行结构化整理与润色,不介入 AI 问答,保持输出纯净。
DingTalk

DingTalk

一款集高清录音、实时转写与 AI 深度分析于一体的智能办公硬件。

【产品介绍】 钉钉 A1 是一款由钉钉推出的 AI 智能录音笔硬件,定位为“办公小助手”。 硬件设计极致轻薄(厚度仅 3.80mm),支持磁吸皮套,具备极佳的便携性。 核心卖点在于硬件与 DingTalk AI 的深度融合,将会议记录从单纯的“录音”升级为“可执行的成果”。 设备配备彩色高清屏,可随时感知录音时长、电量等状态,支持长达 45小时 连续录音及 60天 待机。 【产品功能】 360° 全方位拾音: 采用 6 麦克风阵列与骨传导精准拾音技术,确保复杂环境下的音质清晰。 AI 智能摘要与分析: 自动提炼会议要点、生成纪要,并能精准列出行动清单,支持自动同步到 AI 表格进行协作。 多语言即时互译: 支持 8 种 常用语言即时互译及 21 种 语言同声传译,打破跨国沟通障碍。 场景化纪要模板: 针对团队周会、客户拜访、面试、多人会议等不同场景提供定制化 AI 模板,精准捕捉各场景核心信息。 数据安全保障: 采用 AES 加密 技术,确保录音文件与隐私数据安全,防止丢失泄露风险。
Sonara

Sonara

你的声音,你的仪式,你的声音场。

“这是白噪音领域的「专业AI产品」,由专业算法团队打磨,仍在不断进化。” Sonara将丰富的声音素材交到你手中,你可以自由叠加混音、也可以借助Sonara自研AI为睡眠、专注或深度放松打造专属音景。下载即可免费体验。 产品特色: • 自由混音:浏览精选声音库,涵盖声音、音乐与脑波三大分类。多轨叠加、独立调节音量,将满意的搭配保存为个人配方,随时回味。 • 你的专属AI助手:不知如何开始?和Sonara聊聊你的需求——“帮我在忙碌一天后放松下来”,AI 便会为你推荐声音配方。主导权始终在你手中,AI只负责打开灵感的门。 • 为日与夜而设计:设置睡眠定时器,音景将在入睡后自然淡出。使用专注配方保持心流状态;播放记录自动保存,下次打开即刻续听。 • 与家人共享:一人订阅,最多六位家庭成员通过 Apple 家人共享一起使用。 其他亮点一览: • 无限声音同时叠加混音 • 精选自然、氛围、音乐与脑波音频库 • 无限AI对话和智能配方调配次数 • 保存、命名、整理个人配方 • 简约、治愈的设计美学 • 适配 iOS26 液态玻璃,更沉浸的视觉体验 特殊说明: • 持续进化:我们定期更新声音素材、配方与功能,让你的体验常听常新。 • 隐私至上:我们重视你的隐私,仅在提供服务时处理必要数据。 • 订阅服务:Sonara的完整服务需要订阅后使用(包含无限AI对话、智能配方、完整音频库等),含7天免费试用,可选择月费或年费计划,随时在 Apple ID 账户设置中取消。
Meowa

Meowa

Meowa:一键生成像素级游戏资产与逐帧动画,你的高效创作引擎。

喵吉托工作室在开发游戏的同时,开发了一个 Agent Harness 产品 Meowa,利用多 agent 帮助开发者降低游戏开发过程中各个环节的成本。 我们目前已开放美术 agent(完美像素资产生成,完美抠图,像素帧动画生成,高度风格一致的美术资产生成等能力),音效 agent (音效生成,音乐生成及配套的管线)。网址:https://meowa.ai/ 除了网页版,我们还提供 agent 版本,方便大家集成到自己的工作流中。接下来我们会陆续开放策划 agent,开发 agent,qa agent 等。 各项功能将陆续开放测试。stay tuned!可蹲蹲瓜棚领取免费测试 credit~
BosonAI

BosonAI

支持单张图片秒级生成实时交互式音频数字人的大模型平台。

【产品介绍】 Higgs Avatar v1 是由 Boson AI 团队推出的实时数字人(Avatar)多模态基准大模型。 该平台旨在为语音智能体赋予逼真的人类数字化外在形象,解决传统数字人渲染延迟高、表情生硬的痛点。 产品基于单张静态照片即可生成具备自然点头、眨眼、视线交会等超微表情的动态面部。 作为 Boson AI 技术栈的核心层,它与旗下的 Higgs Audio 语音基础大模型实现了原生级别的深度融合。 旨在满足智能客服、虚拟助手、在线教育及企业培训等高频交互场景对于商业生产就绪、低成本的诉求。 【产品功能】 静态图片实时视频流化:仅需上传一张人物照片,即可实时、逐帧流式渲染出无预设剧本的动态交互视频流。 音画情绪深度同步:与 Higgs Audio 协同设计,使数字人的唇形同步、面部肌肉运动及头部晃动幅度与语音情绪高度对齐。 低延迟渲染:单帧画面渲染耗时仅约 16 毫秒,远超实时对话所需的 62.5 毫秒黄金门槛,确保画质响应绝不落后于声音。 高并发单卡架构:经过极致工程优化,单张 H100 显卡可同时承载 8 路高清实时视频对话通话,显著降低企业生产环境部署成本。
ToolSpeech-音魔方

ToolSpeech-音魔方

说出你的文字,复制你的声音。

ToolSpeech 是一款集 文本转语音(TTS)、语音转文本(STT) 和 语音克隆 为一体的智能语音工具,致力于让你的文字“开口说话”,让你的声音随时复刻,实现高效、个性化的语音交互体验。 核心功能 文本转语音(TTS) 将文字内容转换为自然流畅的语音。 支持多种声音类型与语言选择,音色真实、情感丰富。 可用于朗读文章、制作有声书、课程解说、播客配音等场景。 语音转文本(STT) 将语音内容准确识别为文字。 高效快速,适用于会议记录、采访整理、语音笔记等。 支持多语言识别,识别精度高。 语音克隆 根据样本语音快速生成个性化声音模型。 可复刻用户或角色声音,应用于配音、内容创作、虚拟助手等。 支持多轮训练和高保真输出,声音自然且富有表现力。
Violin

Violin

端到端的 AI 视频翻译工具

【产品介绍】 Violin 核心目标是打破高质量视频内容的语言壁垒。用户上传视频后,它可以自动完成语音转写、文本翻译、语音合成,再把译制音轨重新合成回视频中,并支持同步生成字幕。官网对它的描述是:把任意视频翻译成“听起来像母语配音”的版本,并让字幕与节奏尽可能对齐。 产品目前已经开源,采用 MIT 协议发布。项目同时提供三种使用方式:命令行 CLI、本地 FastAPI Web 界面,以及可直接接入 Claude Code 的 Skill,更适合不同类型的用户和工作流。 【产品功能】 端到端视频翻译与配音:Violin 支持将输入视频自动转写、翻译、配音并重新输出为新视频,支持可选的 SRT 字幕文件,适合做课程视频、演讲内容、知识视频等多语言版本制作。 33 种目标语言输出:目前支持 33 种目标语言,并为其中 16 种高频语言预设了精选的母语语音。 音画节奏对齐:Violin 在输出阶段会对视频速度和音频片段做对齐处理,必要时还会使用冻结帧补偿,以尽量让生成后的配音节奏和原视频画面保持同步,而不是简单粗暴地“整段盖过去”。 多种翻译风格:项目内置 6 种翻译风格配置,包括 standard、kids、academic、casual、storyteller 和 news,可满足教育、儿童内容、新闻讲解等不同场景的表达需求。
7ART

7ART

全栈式的虚拟 AI 艺人与多媒体内容创作平台。

7ART 是一款集成了图像、视频、音乐和语音生成能力的全栈式 AI 创作工坊。 该平台主打虚拟 AI 艺人与虚拟网红的孵化和全流程内容制作。 用户无需具备专业的音视频剪辑或建模技能,仅需通过文字提示词或参考文件,即可一键生成高品质的多媒体资产。 【产品功能】 AI 虚拟艺人与网红生成:系统提供 8 步导向式流程,支持从姓名、外貌、年龄、发型、渲染风格、声音到音乐流派的全方位定制,同时支持上传真实照片作为角色面部参考。 跨工具角色一致性保持:平台支持将生成的角色保存为专属元素资产,用户在后续的图像或视频创作中只需通过提及功能,即可保持多镜头、多场景下的面部特征绝对一致。 全功能 AI 音乐工作室:内置完整的音乐生成与编辑工具,支持根据歌词和曲风生成包含人声与配乐的完整歌曲,同时提供翻唱、歌曲延长、混音以及音轨分离等进阶功能。 智能视频生成与动作控制:支持将文本或图像转化为最长 15 秒的电影级视频,并具备精确的镜头与动作控制能力,可将参考视频中的动态肢体动作直接迁移至自定义的角色图像上。 AI 语音对口型与音效合成:提供文本转语音功能,支持 22 种以上的优质声音和多角色对话,并能让角色的唇形与任何输入的音频实现自然、精准的同步。 一键式全球流媒体分发:制作完成的虚拟艺人音乐作品与专辑,支持通过平台直接发布至主流的全球流媒体音乐服务平台上。
SubEasy

SubEasy

AI 驱动的音视频转写、字幕生成与翻译工具,帮助创作者和团队快速将音频、视频内容转化为高质量文本与多语言字幕。

SubEasy 是一款 AI 驱动的音视频转写、字幕生成与多语言翻译工具,专为内容创作者、视频团队、教育工作者、播客制作者、市场运营人员以及跨语言内容生产者设计。用户只需上传音频或视频文件,或粘贴 YouTube、TikTok、Facebook、X 等平台链接,即可快速获得高准确率的文字稿、字幕文件和翻译结果,大幅降低手动听写、翻译和字幕制作的时间成本。 在功能方面,支持超过 100 种语言的转写与翻译,能够自动识别说话人、生成带时间轴的字幕,并支持 SRT、TXT、Word、PDF 等多种格式导出。平台还提供字幕编辑、字幕样式调整、AI 智能重排、术语表/专有名词优化等功能,帮助用户处理断句不自然、专有名词识别错误、字幕排版混乱等常见问题。对于需要制作双语字幕或多语言内容的用户,SubEasy 可以帮助他们更高效地完成从转写、翻译到字幕导出的完整流程。 SubEasy 适用于多种内容生产场景。例如,视频创作者可以用它为 YouTube、短视频、课程视频快速生成字幕;播客团队可以将音频内容整理成文字稿,用于发布文章、社媒内容或内容复盘;教育机构和学生可以将课程录音、讲座视频转写为学习资料;企业团队则可以用于会议记录、访谈整理、市场调研音频分析以及跨语言内容本地化。对于需要频繁处理音视频内容的人来说,SubEasy 能显著提升工作效率,让用户把更多时间投入到内容创作和传播本身。 功能亮点 SubEasy 的核心优势在于高效、准确和易用。平台通过 AI 技术自动完成音视频转文字、字幕生成、翻译和格式整理,减少人工重复劳动。同时,SubEasy 支持说话人识别、字幕时间轴匹配、字幕样式编辑、AI 重排和术语表优化,能够满足从基础转写到专业字幕制作的不同需求。用户无需掌握复杂的视频剪辑或字幕软件,也可以快速完成较高质量的字幕和文本处理工作。 使用场景 SubEasy 可用于视频字幕制作、播客文字稿整理、线上课程字幕生成、会议录音转写、采访资料整理、短视频多语言翻译、YouTube 视频字幕导出、跨境内容本地化、社媒内容二次创作等场景。无论是个人创作者,还是小型团队、教育机构、营销团队,都可以通过 SubEasy 提升音视频内容处理效率。 FAQ Q:SubEasy 适合哪些用户使用? A:适合视频创作者、播客制作者、教育工作者、学生、市场运营人员、跨境内容团队,以及任何需要处理音频、视频转写、字幕和翻译的人。 Q:SubEasy 支持哪些功能? A:SubEasy 支持音视频转文字、字幕生成、多语言翻译、说话人识别、字幕编辑、AI 智能重排、术语表优化、多格式导出等功能。 Q:SubEasy 是否支持多语言? A:支持。SubEasy 支持超过 100 种语言的转写与翻译,适合跨语言内容制作和国际化传播。 Q:SubEasy 可以导出哪些格式? A:SubEasy 支持导出 SRT、TXT、Word、PDF 等常用格式,方便用户用于视频平台、文档整理或后续编辑。 Q:SubEasy 和传统字幕软件有什么不同? A:传统字幕软件通常需要用户手动听写、翻译和调整时间轴,而 SubEasy 可以通过 AI 自动完成转写、字幕生成和翻译,大幅减少人工操作时间。
Unrush

Unrush

一款全新的agentic的环境声音应用。它主动感知你的状态,回应你的节律,为专注、平静、恢复与休息而自动适应。

Unrush,一款全新的agentic的ambient music应用。 实现从“被动搜索”到“主动感知”的突破:是首款基于 Agentic AI的主动式音乐应用,且基于人类创作者的原创音乐进行制作,保留了音乐的质感与审美。通过实时感知用户状态/情绪/节律,生成千人千面的声景,既不会让听者无聊,也不会被打断,更容易保持专注或进入放松。 功能特点 主动感知:融合时间、天气、地理位置及健康数据(如心率),无需用户操作,自动判断场景。 无限流生成:核心不是固定曲库,而是声音引擎。AI 将“艺术家”创作的骨架实时重组,打造无听觉钩子、永不重复的伴随式音乐。 “艺术家+AI”的专有内容模式:采用自制模式,实现既有艺术质感,又可以做到千人千面的适配。 科学背书:基于音乐影响大脑的直接 BCI 数据构建并反复迭代,而非基于模糊的主观感受。 无界连续控制 (Touchpad):通过Touchpad实现人机共驾,用户成为自己情绪的调音师,能够自然缓慢地改变当前音乐氛围,无需面临突然切歌的打断。 价值主张与使用场景 模糊意图的需求满足:按照当前模糊意图的状态去规划实际任务需要的时间和音乐,节省心力并减少长时间专注时的状态中断。 简化生活与手机戒断:打开 App 就能直接用,告别选择疲劳和信息过载,完美适配手机瘾戒断和极简生活的音乐场景需求。 专属的休憩声音空间:在社会人和自己之间、在情绪不稳和安定之间,提供一个不被打扰的休憩恢复声音空间。 解决神经健康需求:采用先进的脑机接口训练数据,致力于解决脑疲劳、失眠、专注力问题,帮助用户获得脑活力和好心态。
TemPolor天谱乐AI吉他

TemPolor天谱乐AI吉他

全球首款生成式AI吉他,会哼就会弹,所念即所响。

【产品描述】 TemPolor Melo-D智能吉他,是全球首款生成式AI吉他,支持追光独奏、单音弹奏、AI创作,同时内置触摸翻转屏、自研彩虹弦,将重新定义人与音乐的交互方式。 TemPolor Melo-D作为趣丸科技推出的首款智能硬件产品,其背后是公司自研的全球首个多模态音乐生成大模型“天谱乐”的全面赋能。 用户不再需要反复练习复杂和弦以及乐理知识,只需将自己喜欢的歌曲,甚至是哼唱的一段旋律上传,天谱乐大模型就可在几分钟内生成指弹旋律,并自动适配为琴身和屏幕上的“追光”指引,让脑海中的任何旋律,都能变为可演奏的现实。这种“无感”的智能,也是TemPolor的品牌理念——所念即所响。 【产品功能】 追光独奏:AI旋律生产系统,能将任何你喜爱的歌曲一键转化成完整吉他指弹旋律,配合屏幕追光UI动态指引,快速上手。 AI创作:背靠自研AI音乐大模型“天谱乐”,支持文本生成音乐、和弦生成音乐,生成的单曲自带歌词旋律,还能选择加入AI人声帮唱。 高清折叠屏:机身自带“高清折叠屏”,可视化弹唱指引可独立在吉他屏幕显示,不受设备和环境束缚,无需手机APP也能单独使用。 彩虹琴弦:独创的“彩虹琴弦”,六根彩虹弦分别映射真实吉他的六根弦,还原吉他扫弦手感,沉浸感拉满;同时支持单音弹奏,可玩性高。 海量曲库:TemPolor智能吉他整合了国内多家头部音乐平台的海量曲库,并支持用户自定义上传与AI智能转谱功能,确保每一位用户都能轻松获得心仪的曲谱。 折叠设计:自研折叠设计,无需拆卸即可轻松收纳,便携外带不占空间。 【奖项荣誉】 在行业地位方面,TemPolor 获得了全球权威研究机构弗若斯特沙利文授予的“全球生成式AI吉他开创者”认证,标志着其创新性获得国际第三方机构的高度认可。 在设计领域,TemPolor 包揽了多项国际设计大奖,包括 MUSE 设计大赛“生成式 AI 产品金奖”与“音乐类产品银奖”、伦敦设计奖“产品设计金奖”以及纽约设计奖“产品设计银奖”。
LALAL.AI

LALAL.AI

人声移除器,专业级品质,由 AI 和 Transformer 技术驱动。

LALAL.AI 是一款由瑞士团队开发的尖端 AI 音频处理工具,凭借其自主研发的 Orion、Perseus 以及最新的 Andromeda 神经网络架构,定义了音频分离领域的新标准。它不仅能以极低损耗实现人声与伴奏的精准剥离,更突破性地支持鼓、低音、钢琴、原声吉他等 10 种特定乐器音轨的独立提取。无论是追求极致清晰度的专业制作人,还是需要去除环境噪音的播客主,都能通过其简洁的界面获得广播级的高保真音频结果。 除了核心的音轨分离功能,LALAL.AI 还集成了先进的语音净化、混响消除以及语音克隆技术。其独特的“增强处理”模式能在提取过程中自动修正音频瑕疵,有效减少高频损失和人为伪影。支持全平台(Web、桌面、移动端)操作,适配 MP3、WAV、FLAC 等主流音视频格式,是音乐创作、短视频剪辑和翻译转录工作流中不可或缺的高效率生产力工具。
SongSens.ai

SongSens.ai

边听边学!听歌秒变语言达人。

SongSens 是一款把“听歌”变成“学语言”的 AI 音乐翻译工具,核心思路不是只把歌词逐句翻译出来,而是帮助用户真正听懂外语歌曲里的意思、情绪、俚语和双关。它主打“Sing it. Learn it. Speak it.”,更适合喜欢 K-pop、J-pop、拉美音乐或其他外语歌曲的听众,也很适合把音乐当成语言学习材料的人。 它的使用方式比较直接:识别正在播放的歌曲后,系统会同步显示滚动歌词,并把歌词实时翻译成用户熟悉的语言。和那种“复制歌词到翻译器里再自己一句句对”的体验相比,SongSens 更像是把识曲、卡拉 OK 歌词和歌词翻译打包到了一起。 这款产品覆盖的语言也比较广,支持 38 种语言,既能满足日常“听懂这首歌在唱什么”的需求,也能进一步延伸到跟唱、记单词和理解表达方式的学习场景。 【产品功能】 实时歌词翻译:支持把正在播放的外语歌曲歌词实时翻译成目标语言,而且不只是机械直译,还会尽量保留歌词里的情绪、俚语、文字游戏和语境含义;当存在人工校对版本时,也会优先使用更可靠的翻译结果。 快速识曲 + 卡拉 OK 同步:SongSens 可以在大约 3 到 5 秒内识别歌曲,并同步展示滚动歌词,当前歌词行会高亮显示,方便用户边听边看,减少“刚读到上一句,歌已经唱到下一句了”的尴尬。 多种歌词显示模式:支持原文、译文、双语对照和发音模式四种显示方式。对于日语、韩语、阿拉伯语、俄语这类非拉丁文字歌曲,发音模式会提供罗马音或近似拼写,更适合想跟唱的人。 单词学习与词汇积累:用户可以点开歌词里的单词查看含义,并把感兴趣的词保存到自己的词汇列表里。这样它就不只是“听懂歌词”,而是可以顺手把一首歌变成词汇学习材料。 中途切换翻译语言:支持在歌曲播放过程中直接切换翻译目标语言,而且歌词同步不会乱掉。这一点对多语学习者还挺友好,相当于同一首歌可以顺手切着学。
Lickmv

Lickmv

一站式 AI 音乐视频生成与分镜创作 Studio。

LickMV(立刻MV)是一款专为独立音乐人、翻唱博主及短视频创作者打造的 AI 音乐视频一站式在线制作平台。 该平台彻底打通了从音频到影像的全链路生产,将复杂的 MV 工业制作流程(包括歌词解析、智能分镜、首帧绘图、图生视频与字幕同步)完全收敛于同一个工作流中。 它提供网页端专业全功能 Studio 以及 iPhone 移动端 App 双端形态,致力于协助缺乏专业剪辑和镜头调度技能的创作者,低成本、高效率地将声音灵感转化为可直接发布的成片视觉资产。 【产品功能】 音视频一体化分镜创作流 支持上传本地音频或 AI 原生歌曲,并由大模型自动将其按歌词时间轴拆分为带有具体时间的结构化分镜脚本。 纠偏防重首帧图片预览 在消耗高成本视频点数前,系统会先生成分镜首帧和图片预览,让创作者能够先看方向、完成纠偏后再进行视频渲染。 多模型混合图生视频扩展 支持把选中的静态分镜首帧升级为动态镜头,可按需接入 Seedance、Vidu 等业界前沿的多模态视频生成模型。 歌词字幕精准对齐与合成 内置免额度的字幕识别与时间轴生成,支持一键将短视频音乐片段、动效字幕与原始歌曲渲染成一个可下载的完整 MV。 弹性点数无订阅计费机制 网页版 Studio 采用无订阅的“先免费看方向、再决定花点数”机制,字幕、故事板、首首歌生成均免费,后续出图生视频则按需扣点。
Green Convert

Green Convert

主打绿色低碳与高速转录的下一代 AI 神经网络音视频转文字平台。

GreenConvert 是一款融合绿色环保基础设施架构与高级神经网络技术的下一代 AI 音视频转录平台。 该平台专注于提供高精度的多语种转文字服务,同时通过算法和算力调度优化,大幅降低数据处理过程中的服务器能耗。 系统能够智能识别特殊词汇与地方口音,并在渲染高比特率视觉媒体时,将任务定向路由至 100% 使用可再生能源的数据中心,实现“零碳排放”的数字化内容生产。 【产品功能】 下一代神经网络高精转录 依托高级神经引擎,支持将 MP3、WAV、MP4 等多种格式的音视频一键转化为像素级精准的文本。 综合转录准确率高达 98%,支持超过 98 种全球语言和地方方言。 智能环境音还原与声学增强 内置特定的“语音恢复”工具,利用神经网络上采样技术清除环境背景噪音并增强人声频率。 显著提升低质量录音文件的转录清晰度。 声纹识别与自动分轨标记 具备先进的 AI 驱动身份检测能力,可在多人对话、专业访谈或董事会会议中,自动分离并精准标记不同的发言人。 绿色环保算力与能耗优化 首创绿色底层架构,在提取音频流时可降低 40% 的 CPU 负载以减少机房热能。 动态缩减 GPU 空闲浪费,并利用预测性缓存优化减少 60% 的重复网络操作。 工业级批量处理与多格式导出 最大支持上传 5GB 或长达 10 小时的单文件,VIP 用户支持 50 个文件同时并行处理。 转录完成后支持一键无损导出为 PDF、DOCX、TXT、以及 SRT 和 VTT 专业外挂字幕格式。
Plazmapunk

Plazmapunk

融合多风格视觉模型与音轨自动同步的 AI 原生音乐视频创作工作台。

Plazmapunk 是一款面向音乐人、独立制作人、音频创作者及出海新媒体团队打造的 AI 原生音乐视频自动化生成平台。 该产品专注于解决传统音乐录影带制作周期长、后期剪辑门槛高以及视听同步繁琐的痛点。 用户只需直接上传个人音轨文件或使用内置工具,系统即可在数分钟内自动推演并生成与音频节奏精准匹配的专业级视觉画面。 系统将高密度的视觉生成管道与特化的音频特征提取算法深度整合,消除了用户在单点视听剪辑软件之间高频切换的操作摩擦。 和许多缺乏听觉感知能力、画面与节奏完全割裂的普通视频生成工具不同,Plazmapunk 更加强调视听语言的内在逻辑统一与结构化叙事控权。 系统在底层聚合了 Kandinsky 2.2 以及 Stable Diffusion XL 等前沿视觉大模型矩阵,支持在云端画布中自由调用。 平台不仅能够自动捕捉音乐的节拍、律动进行动态画面渲染,还原生配套了支持多场景流式微调的场景脚本编辑器。 这使得它能够直接解决海外流媒体宣发时宣发素材产出慢、内容同质化等实际痛点。 更适合追求敏捷交付的数字艺术家、跨境独立音乐人、短视频矩阵营销团队以及需要低成本批量生产多平台音乐卡点视频的商业机构。
Voicenotes

Voicenotes

跨语言免 Bot 接入的 AI 原生会议录音转写与结构化知识萃取工作台。

Voicenotes 是一款面向企业管理者、工程师、新媒体运营及跨国协作团队打造的 AI 原生会议记录与音频资产资产沉淀平台。 该产品专注于解决传统会议助手需要强制邀请机器人加入线上视讯、离线会议无法覆盖以及语境信息难以追溯的痛点。 用户只需在会议开始前一键开启录音,系统即可无感捕获现场声音并同步生成高清转写文本。 系统将多语种流式识别通道与自适应的摘要生成管道深度整合,免去了用户在会后重新梳理、拼凑碎片信息的繁琐操作。 和许多严重依赖云端开源模型、容易产生文本幻觉或缺乏细粒度安全屏障的普通录音听写应用不同,Voicenotes 更加强调会议资产的语义化沉淀与即时知识唤回。 系统在底层内嵌了对 60 多种语言及地方口音的主动感知引擎,支持用户在多语种夹杂表达时进行无缝流式转录。 平台在保障数据从不用于任何外部大模型二次训练的合规底座上,原生提供了支持全局对话检索的 Ask AI 问答交互功能。 这使得它能够直接解决团队会后待办划分模糊、大客户历史对局资产难以查阅的实际痛点。 更适合需要高效执行工程复盘、进行精益客户调研以及追求打造敏捷个人第二大脑的数字化高绩效个体。 【产品功能】 免 Bot 挂载的多端场景一键全量录音:支持线上视频会议与线下实地会谈,无需邀请机器人进房,在全局工作流中无感捕捉每一帧音频细节。 60 多种语种自适应流式混合识别:内置高敏度的口音与多语言混合探测机制,支持在对话中途平滑切换表述语言而无需前置配置更改。 瞬时交付结构化摘要与行动待办项:会议结束的瞬间自动分发清洗完毕的文本摘要、行动大纲与清晰的执行下一步,支持一键导出生产级 PDF 资产。 支持全局跨对局调取的 Ask AI 虚拟助手:允许用户随时通过对话框向 AI 提问,快速激活、召回埋藏在历史无数场会议记录中的深层知识盲区。 严苛的数据隔离与不参与模型训练硬约束:严格遵循 SOC 2 Type II 及 GDPR 安全规范,对全量音频资产进行高强度加密,并承诺绝不泄露用户声纹数据。
MELO音乐

MELO音乐

无需乐理知识即可快速生成人声与编曲的 AI 音乐创作平台。

该平台面向零乐理用户与专业创作者 通过 AI 大模型将文字灵感实时转化为完整音乐作品 覆盖作曲 编曲 人声与歌词生成的一体化创作流程 让音乐从想法到成品的门槛大幅降低 【产品功能】 云端 AI 作曲生成:输入文字 情绪或场景即可生成完整歌曲结构与编曲 对话式创作体验:通过自然语言持续调整风格 节奏与情绪表达 多端创作同步:支持 Web App 小程序等多设备无缝衔接创作进度 AI 音乐社区:展示与发现用户作品 激发跨风格灵感碰撞 高品质在线播放:提供接近录音室级别的在线试听体验 个人作品管理:统一管理历史创作内容与音乐资产 会员算力服务:提供更高生成速度与长音频无损输出能力
MeloLab

MeloLab

基于多模型融合的AI音乐创作与音频生产平台。

该平台面向内容创作者与商业音频生产场景 通过文本描述即可生成可下载与可商用的完整音轨 同时支持编曲 分轨 编辑与音频增强的一体化工作流 并整合多种音乐生成模型与专业级音频处理工具 【产品功能】 文本生成音乐:通过自然语言描述快速生成完整音乐与背景音轨 多模型音乐引擎:支持多种AI音乐模型切换提升风格多样性 音频编辑工作流:提供MIDI编辑 音轨扩展与结构重组能力 分轨处理系统:支持人声与乐器分离方便二次创作与混音 AI翻唱与改编:可对已有音轨进行风格重塑与再创作 商业音乐输出:提供免版税可商用音频导出流程与权限说明 场景化音乐生成:覆盖播客 广告 游戏 Vlog等多行业需求
网易云音乐AI

网易云音乐AI

一款基于前沿深度神经网络算法的 AI 虚拟歌手创作软件。

一款面向音乐创作者、二次元爱好者及独立音乐人打造的 AI 演唱合成工具。 用户只需在软件内输入曲谱和歌词,AI 歌手即可在几秒钟内完成高质量的歌曲演唱。 平台内置了包括洛天依在内的多位声线风格各异的人工智能歌手伙伴。 系统能够驾驭流行、电子、民族、摇滚等多种不同的音乐作品风格。 软件基于深度神经网络算法,无需复杂的参数调节即可输出媲美真人的自然歌声。 该工具致力于通过降低音乐制作中人声录制的门槛,协助创作者快速将音乐创意转化为成品。 【产品功能】 曲谱输入即时演唱:用户只需在系统内输入旋律曲谱与歌词文本,AI 歌手即可在数秒内自动完成歌曲的演唱渲染。 多风格歌手矩阵:提供治愈系流行、摇滚、电子及民族等多种声线特色的虚拟歌手,满足不同曲风的契合度需求。 多维度参数微调:提供针对音高、力度、音量、换气以及咬字发音等多维度的控制工具,方便创作者精确控制表现力。 前沿说唱能力支持:内置专业的说唱创作与调整模块,支持对虚拟歌手的说唱节奏与语调进行工程化调节。 全套视频创作教程:配套从快速上手、页面布局到颤音、倚音调整等全流程的视频教学工具,降低软件的进阶使用门槛。
VidMuse

VidMuse

一款支持音乐与视频双向互导的多模态 AI 创意视听生成平台。

VidMuse 是一款面向视频剪辑师、音乐制作人及自媒体创作者打造的智能化视听内容生产系统。 它专注于打破传统的“先有视频再配乐”或“先有音频再配画面”的单向创作局限。 用户只需提供一段基础的音乐轨道,系统即可在数秒内智能衍生出极具画面通感与节奏对齐的视频作品。 同时平台在最新版本中集成了高阶的图像生成技术,支持用户直接将静态视觉转换为动态叙事。 该工具致力于通过深度融合的音视频模态算法,帮助用户在极短时间内批量产出极具表现力的数字多媒体资产。 【产品功能】 音视频多模态双向互导:支持直接通过音频轨道或曲风氛围智能衍生出匹配的高品质视频,实现音画同步。 高阶专业视频模式定制:提供专业级的控制面板,支持 16:9 等主流画幅比例调节,并支持一键导出 720p 级别的内容。 海量多元风格轨道矩阵:预置包含电子、国风、霓虹岛屿、赛博朋克等多种不同叙事基调的音乐视频示例库。 静态图像深度生成融合:集成了最新的图像自适应生成模块,支持将静态图片素材无缝编织进长周期的视频创作流中。 工业级命令行扩展支持:提供专属的智能体与命令行接口,允许开发者通过代码与自动化脚本深度接管生成流水线。
BabelVoice

BabelVoice

BabelVoice 语音隐私记录app

一键即可本地录音、导入音频并将语音转换为文本。BabelVoice 是一款本地转录应用,默认情况下,录音、语音和转录文本都保存在您的设备上。支持本地ai模型转录语音到文本,支持多个本地模型,无需为token付费。
Tracksensei

Tracksensei

面向电子音乐制作人的 AI 混音分析与制作反馈平台。

TrackSensei 可读取 Ableton 工程文件与音频成品,结合轨道结构、插件链、MIDI、编曲与频谱数据,生成可直接执行的制作建议。 平台将问题按优先级呈现,帮助制作人定位混音浑浊、动态不足、低频冲突或编曲能量变化等具体问题。 【产品功能】 Ableton 工程解析:读取 .als 文件中的轨道、设备、自动化、发送效果与 MIDI 信息。 音频深度分析:分析响度、动态范围、频谱平衡、立体声表现与混音状态。 制作评分体系:从混音、响度、频率平衡与编曲等维度给出评分和改进方向。 AI 制作导师:支持围绕当前作品继续追问,获得针对具体轨道与段落的反馈。 曲风适配反馈:根据用户选择的音乐流派与子流派调整混音、响度和编曲参考标准。 分轨互动诊断:支持上传多个分轨,分析底鼓与贝斯冲突、侧链效果与频率遮蔽等问题。
Dub / ninja

Dub / ninja

面向地下电子音乐挖掘与连续选曲的 24 小时 AI DJ 平台。

Dub / ninja 聚焦电子乐细分场景,自动发现、筛选并编排来自独立厂牌与音乐人的曲目。 平台为每首歌提供速度、调性、能量、风格与 AI 评分等信息,帮助听众快速判断曲目特征。 它也会根据节奏、调性和能量推荐适合衔接的作品,为 DJ 选曲和音乐探索提供参考。 【产品功能】 AI 曲目挖掘:持续发现地下电子音乐、独立厂牌作品与新发布曲目。 曲目智能分析:展示 BPM、调性、能量等级、音乐风格与厂牌信息。 AI 乐评推荐:围绕曲目结构、氛围与适用场景生成简要分析。 混音搭配建议:根据速度、调性和能量推荐可衔接的相似曲目。 实时电台播放:提供持续更新的 AI DJ 选曲流与当前播放信息。 收藏与关注:支持保存曲目、关注音乐人和厂牌,沉淀个人音乐偏好。
CosyVoice 输入法

CosyVoice 输入法

智能语音转录落地的桌面端输入辅助工作台。

QwenType输入法 是一款面向文字工作者、商务办公人员、科研学者及多语种跨境协作团队打造的 AI 原生语音输入与智能成稿平台。 该产品专注于解决传统语音输入工具对口语填充词识别生硬、自我修正无法自动抹除以及散乱口述难以一键结构化沉淀的痛点。 【产品功能】 自动填充词过滤的智能语音转录:实时高质量语音转文本,自动识别并去除口语化的填充词与重复词,保持文本干净利落。 散乱口述自适应排版的结构化内容:说出一堆事情后,系统会自动识别其中的项目结构,整理成编号列表、表格或大纲。 消除改口痕迹的口语自我更正编辑:精准识别口语中的自我修正词汇,并将修正内容自动应用到最终稿件。 指令驱动的一键意图理解直接成稿:告诉系统想要的格式,即可直接将口述话语写成称谓、问候、签名一应俱全的正式邮件。 数字公式单位自动还原的多样化文本:口播中的大额数字与百分比自动还原为标准符号,并能识别公式表达以补齐对应运算符号。 跨地区方言与多语种自适应转写系统:无缝识别上海话、粤语、四川话等多种方言,并能将其跨区域转写为标准的普通话。
千问输入法

千问输入法

AI 原生语音输入效率工具。

千问输入法是一款面向文字工作者、办公人员、多语种沟通团队及需要高频录入文字的超级个体打造的 AI 原生语音输入辅助软件。 该产品专注于解决传统语音输入法中大量口语语气词残留、自我改口痕迹无法自动修正以及碎片化口述文字缺乏结构化排版的痛点。 【产品功能】 自动填充词过滤的实时语音转录:实时执行高质量语音转文本,自动识别并去除口语化填充词与重复词,保持文本干净利落。 散乱口述自适应排版的结构化内容:说出一堆事情后,系统会自动识别其中的项目结构,整理成编号列表、表格或大纲样式。 消除改口痕迹的口语自我更正编辑:精准识别口语中的自我修正词汇,并将修正后的内容自动应用到最终输出的稿件中。 指令驱动的一键意图理解直接成稿:告诉系统想要的特定格式,即可直接将随性的口述话语转化为称谓与问候俱全的正式邮件。 数字公式单位自动还原的多样化文本:口播中的数字与百分比自动还原为标准符号,并能识别公式表达以补齐对应运算符号。 跨地区方言与多语种自适应转写系统:无缝识别多种主流方言并将其跨区域转写为标准的普通话,避免由于口音造成的信息卡顿。
Scribbler

Scribbler

AI 原生播客与视频内容摘要工作台。

Scriber.so 是一款面向播客爱好者、视频重度用户、数字化研究员及泛媒体内容运营个体打造的 AI 原生音视频提炼与信息检索服务平台。 该产品专注于解决当前长视频及音频节目体量大、核心观点发掘费时,以及碎片化音视频素材无法进行跨文本结构化检索的操作痛点。 【产品功能】 音视频链接驱动型多源内容秒级摘要:支持一键托管任意播客与 YouTube 视频,全自动抓取关键见解并输出结构化的知识清单。 无缝穿透长线音视频的对话式内容内省:允许用户直接与所听、所看的音视频内容展开实时对话,秒级检索并锁定核心事实。 定向追踪高价值内容的播客一键自动订阅:提供功能完备的播客内容管理面板,支持订阅并常态化更新追踪喜爱的行业大咖频道。 自适应分阶计费的多轨柔性智能转录:内置极具性价比的按需转录与按需摘要机制,支持精准剔除无效语汇并还原干净得体的字面文本。 精选出版级顶尖播客内容库无门槛畅享:自带丰富的高质量公开播客数字沙箱,为新一代效率伙伴的跨界调研提供无缝的物料保障。
Opentypeless

Opentypeless

开源 AI 语音输入,让说话直接变成可用文字,让说话变成Agent的输入

OpenTypeless 是一款开源、跨平台的 AI 语音输入工具,支持 macOS、Windows 和 Linux。你只需要按下全局快捷键,说出想法,它就能完成语音转文字、AI 润色,并把最终文本直接输入到当前正在使用的应用中。 它不仅适合日常听写,还支持选中文本后用语音发出指令,让 AI 帮你改写、总结、翻译或优化表达。比如写邮件、回复聊天、整理会议记录、写 Issue、写文档、写提示词时,都可以减少手动打字和反复修改。 核心亮点: 任意桌面应用可用:按快捷键说话,自动输入到当前应用 AI 自动润色:把口语化表达整理成清晰、可读的文字 选中文本改写:选中文本后说出修改要求,快速重写、翻译或总结 Ask Anything:通过语音快速提问,在小窗口中获得简洁回答 支持多种 STT 和 LLM 服务商:可接入 Whisper、Groq、Deepgram、AssemblyAI、OpenAI、DeepSeek、Gemini、Ollama 等 BYOK 友好:可以使用自己的 API Key,核心功能不强依赖官方云服务 开源透明:MIT License,适合重视可控性和隐私的用户 适用场景: 写邮件、写文档、写笔记 快速回复聊天和评论 将语音想法整理成正式文字 中英文翻译和多语言输出 用语音快速改写已有文本 桌面端快速语音问答 常见问题: Q:OpenTypeless 是普通听写工具吗? A:不只是听写。它会在语音转文字后继续用 AI 润色、改写或翻译,让输出结果更接近可直接使用的成稿。 Q:是否必须使用官方云服务? A:不必须。OpenTypeless 支持 BYOK,你可以配置自己的 STT 和 LLM 服务商,也可以使用本地或兼容 OpenAI API 的模型。 Q:支持哪些系统? A:支持 macOS、Windows 和 Linux。 Q:适合谁使用? A:适合经常写作、沟通、记录、整理想法的用户,尤其是希望用语音替代大量键盘输入的人。
Mogura

Mogura

easy use , offline subtitle transcription

Mogura 把你的视频和音频转成字幕—全程在你的 Mac 本地完成。 采用先进的本地语音识别技术,充分利用Mac的GPU 加速,Mogura 在本机完成转写。你的媒体文件始终留在电脑上:不联网处理、不上传、无需账号、无需订阅。 转写 拖入一个视频或音频文件,自动得到带时间轴的字幕。 -提供多种本地模型———追求速度选小模型,追求精度选大模型。 -支持 99种语言,并可自动识别语种。 编辑 -在干净的编辑器里校对字幕,并与播放实时同步。 -点击任意一句即可跳转;播放时字幕自动跟随高亮。 -键盘快捷操作,编辑更专注高效。 导出 -导出 SRT、VTT、ASS 等通用字幕格式,适用于各大视频编辑器与在线平台。 隐私优先
Joyin

Joyin

支持免费转写的浏览器原生音视频转文字平台。

Joyin 是一款无需配置环境、支持多种媒体格式上传的轻量级 AI 音视频转录工作台。 该产品专注于解决传统转录软件限制时长、收费昂贵以及用户在浏览器内处理媒体文件时面临的隐私合规痛点。 【产品功能】 无限额的浏览器原生音视频一键转写:支持在页面内直接上传多种主流媒体格式,且不对转写总时长设置门槛,实现真正意义上的无限量使用。 跨格式兼容的媒体文件解析底座:内置高效的转码管线,能够稳定识别 MP3、WAV、MP4、MOV、FLAC 等多种音频与视频容器。 辅助文档自动生成的 PDF 一键导出:在完成文本转写后,系统支持直接将处理好的文案转化为 PDF 格式,方便用户直接分享或打印归档。 极简且免注册的隐私友好交互逻辑:用户无需进行任何复杂的账号绑定或个人信息录入即可直接发起转写任务,确保个人媒体资产安全。
歌歌AI

歌歌AI

歌歌AI写歌是全球领先的AI音乐创作工具与创作者社区,自研歌歌AI音乐大模型,用AI重构创作链路,让创作、发布、变现更简单。

歌歌AI写歌——人人都是音乐家! 【AI对话创作】 语音与专属制作人对话,无需任何乐理知识,一键创作流行、说唱、摇滚、古风、民谣、电音等多种风格原创歌曲,生成歌曲直到满意为止,助力你成为发行级音乐人。 【多模式创作】 支持歌手模式、纯音乐模式等多种创作方式,自由修改词曲编唱,让创意完全可控。 【一键发行】 创作完成后一键发行至主流平台,无需重复上传,全渠道分发触达海量听众。 【版权收益】 建立完善版权结算体系,平台自动汇总播放数据,兑现版税收益,让音乐创意转化为稳定收入。 【MV智能生成】 上传照片或用AI生成图片,输入视频提示词,一键生成对口型MV视频,让你的音乐作品更具视觉表现力,轻松适配全平台传播。 【音乐社区】 在音乐社区,与全世界的音乐创作者相遇,探索无限可能!与全球的伙伴分享你的音乐创作,结识更多原创音乐人,一起碰撞灵感,交流心得,共同成长!
MVLAND

MVLAND

面向音乐人和创作者的 AI 音乐视频创作平台。

【产品介绍】 MVLAND 是一款面向音乐人和内容创作者的 AI MV 创作平台。它能够理解歌曲的歌词、情绪与节奏,并将音乐转化为视觉化的视频表达,帮助用户更轻松地为作品生成高质量音乐短片。 【核心能力与亮点】 音频一键生成视频:用户上传音乐后,平台可自动生成匹配歌曲氛围的 AI 音乐视频。 理解歌词与情绪:MVLAND 不只是生成画面,还会结合歌词含义、音乐情绪和节奏进行视觉叙事。 多曲风适配:支持说唱、流行、R&B 等多种音乐类型,让不同风格的歌曲获得更合适的画面表达。 创作门槛低:面向音乐人和普通创作者,帮助用户无需专业视频制作能力也能完成 MV 创作。
Musefy

Musefy

Musefy 帮助创作者在线将提示词转化为 AI 歌曲、歌词和背景音乐

musefy 是一款面向创作者的 AI 音乐工作室。它能将简单的内容需求转化为歌曲、背景音乐和歌词,适用于视频、播客、直播、游戏和广告等场景,并将所有作品保存到一个可重复使用的素材库中。 核心功能 AI 音乐生成器:根据自然语言提示词,结合你的内容场景,生成带人声的歌曲或纯音乐背景音轨。 AI 歌词生成器:创作副歌钩子、合唱段落和完整歌词构思,并可直接将其用于音乐生成器。 音频转 MIDI 与 MIDI 编辑器:将音频创意转换为 MIDI,并通过内置编辑器调整编曲,实现更精细的控制。 以创作者为中心的内容需求模板:从现成的提示词模板开始创作,覆盖 YouTube 片头、播客主题曲、直播循环音乐、产品广告、游戏预告片和歌曲 Demo 等场景。 素材存储工作区:将所有完成的歌曲和歌词分别保存在“My Music”和“My Lyrics”中,方便播放、下载,并在不同项目中重复使用。 使用方式 选择创作者需求模板:使用自然语言描述你的视频、播客、直播、游戏、广告或歌曲 Demo,并指定所需的风格和情绪。 生成音乐或歌词:提交提示词和可选歌词,生成纯音乐、完整歌曲或独立的歌词草稿。 查看并保存素材:将满意的生成结果保存到工作区,之后可以复制、下载,并在未来的编辑项目中重复使用。 非常适合 YouTube 片头、Vlog 和短视频开场音乐。 播客主题曲、栏目过场音乐和谈话节目背景音乐。 直播背景循环音乐和低干扰背景音乐。 产品发布宣传片、预告片和推广视频。 需要快速制作 Demo 和获取创作灵感的词曲作者及歌词型创作者。 无需打开传统 DAW,即可将创意转化为可供创作者直接使用的音频,并围绕你的内容创作流程建立可重复使用的声音素材库。
BokeBox

BokeBox

内容进匣,AI 成播——多源变私人播客,人设音色全自定义

BokeBox(播匣)是一台只属于你的私人 AI 播客工作室。 把视频、网页链接、文章、会议纪要、课程材料或纯文稿丢进匣子,它会: 理解内容 → 重写为口播脚本 → 用你指定的声音讲述 → 生成封面与知识闪卡 → 变成随时可听的私人播客。 不是「字幕朗读器」,也不是单一格式转音频工具;而是多源输入、可听完、有人设的口播节目生产线。 【功能亮点】 多源进匣 本地视频 / 链接 / 文稿 / 会议与课程材料均可;Source 插件继续扩展内容源,不锁死某一种平台。 真的能听完 AI 按口播结构重写:有开场、有重点、有收尾,而不是干巴巴念字幕。 人设与音色你说了算 主播是谁、对谁讲、什么风格、节目叫什么——支持全局默认或单集临时改;预置音色 + 文字描述定制。 听完带走知识 自动提炼知识闪卡与节目笔记,一耳朵内容变成可复习资产。 AI 可直接调用(MCP) 内置 Model Context Protocol,Cursor / Claude 等可创建节目、查询任务。对助手说「把这个链接做成 播客」即可。 数据在你自己手里 单用户私有部署,任务与进度落本地;支持 Docker 一键启动,开源协议 LGPL-3.0。 【使用场景】 • 通勤 / 家务 / 散步:把长视频、长文改成「耳朵时间」 • 终身学习:课程回放、发布会、访谈听重点 • 创作者 / 研究者:先听消化多源素材,再决定写什么、剪什么 • 一人公司:周会、链接、笔记统一收成自己的「信息广播」 • 隐私敏感用户:内容不出自己的机器 【四步上手】 丢进去:上传视频 / 粘贴链接 / 投入文稿 设一下(可选):沿用全局人设,或给这一集单独定调 去忙别的:转写 → 写稿 → 配音 → 封面 / 闪卡后台跑完 戴上耳机:打开播放页,像听一档真正为你制作的节目 【FAQ】 Q:只能转长视频吗? A:不是。视频、链接、文稿、会议与课程材料都能进;还可用 Source 插件扩展。 Q:听起来会不会像机器人念稿? A:强调口播结构 + 可定制人设 / 音色 / 语气标签(停顿、轻笑、语速等),目标是「有人在讲」而不是 「机器在念」。 Q:和在线 AI 播客 demo 有什么区别? A:本地 / 私有部署、人设可控、进度可管、闪卡可复习,并且 MCP 可被 AI 助手直接编排。 Q:适合做公域播客平台吗? A:不适合。BokeBox 刻意做小、做私、做深——单用户私人工作室,不是多租户社交 SaaS。 开源地址:https://github.com/vastsa/BokeBox 协议:LGPL-3.0
Fovea

Fovea

Speak. Capture. Deliver. All in one.

Fovea 是一个围绕你的注意力构建的 AI 硬件产品。 下一代人机交互应该是这个样子:眼睛看、嘴说、AI理解并执行。 按下快捷键,Fovea 就会看到你的屏幕,知道你的注意力在哪里,并听见你的声音。并把你的意图与当前上下文对齐,交付给 AI 执行。 松开按键后,Fovea 会把你的意图与当前上下文对齐,然后将一个有依据的任务交付给你选择的应用或 AI 工具。 每一次交互也可以成为你私有记忆的一部分,并被你的其他智能体和 AI 工具使用。 说出意图,捕捉现场,交付任务,一气呵成。
众声 AI

众声 AI

一体化 AI 音乐 Agent

众声AI(massmusic.cn)是一站式AI音乐创作平台,均使用顶级AI音乐大模型,主打对话式AI音乐创作,图文素材生成,同时也包含免费发行AI音乐、免费商业授权分销等多项服务。适配音乐人、自媒体、内容创作者使用。 核心优势亮点 一体化全能创作Agent 集作词作曲、音乐顾问、音频处理、图片生成于一体的对话智能体。聊天即可完成写词编曲、曲风专业咨询、歌曲后期加工、封面LOGO图像生成,多轮对话持续优化内容,一站式搞定音画全流程创作。 专业在线音频处理工具箱 内置精准分轨、一键母带优化、音量均衡等多项实用功能,生成歌曲无需跳转第三方软件,在线完成音频精加工,一站式搞定从创作到后期全流程。 免费音乐发行服务 创作完成的原创歌曲可享受免费国内发行渠道,直达国内各大主流音乐流媒体平台,一站式搞定歌曲上架,省去发行渠道费用与繁琐流程。 免费商用授权分销,多渠道多收益 由平台发行的音频均附赠商用授权分销,被第三方应用到短视频、游戏、电视剧、综艺、商业宣传等均可合规变现。 一站式商用创作解决方案 产出音频、图片可用于短视频配乐、独立音乐发行、商业宣传等合法商用场景,新手零成本体验完整创作能力。 海量封面&艺人LOGO模板 平台内置海量艺人LOGO、音乐封面预设模板,涵盖流行、国风、电子、民谣等多种风格,直接套用修改文字、配色,快速产出专业宣传视觉图。
一大小小讲解员

一大小小讲解员

把一大纪念馆,变成孩子愿意主动探索的一场闯关。

7月份带娃去参观了上海中共一大纪念馆,想着让参观更有趣味性,做了这个简单的应用。 一大小小讲解员是一款面向 1–6 年级儿童的中共一大纪念馆移动导览。 它把参观路线做成短语音、找线索、点亮星星与现场打卡:一至三年级用发现型任务进入故事,四至六年级用思考型问题理解历史。 孩子在真实展项前完成自己的探索,家长也能按馆内动线轻松陪逛。 参观结束后可拍照打卡,生成带时间与地点记录的探馆纪念海报;手机号注册后,个人进度会独立保存。
YESTOOL.AI

YESTOOL.AI

面向大众的全能 AI 图像、视频与音乐生成平台

yesTool AI 是一款集成了图像、视频和音乐生成的全能 AI 创作平台,面向无技术背景的普通创作者和商业团队。产品聚合了 Kling AI、Runway、Veo 等多种前沿模型,解决用户跨工具订阅成本高与学习门槛大的痛点。核心差异在于提供全类型商用版权内容的一站式极简生成体验。 【核心功能】 聚合多前沿模型:在一个平台内集成 Kling AI、Runway、Wan、Veo 等顶级模型,用户无需切换工具即可调用不同模型能力,可以快速享受前沿模型能力。 多模态极速生成:支持30秒生成音乐、数秒编辑图像、数分钟生成4K视频,极速将用户的自然语言描述转化为高质量多媒体内容,非常适合内容创作者。 全量商用版权保障:生成的所有视频、音乐和图像均100%原创且自带完整商用权,可直接用于 YouTube 变现或商业项目,无版权风险等相关潜在问题。 跨媒介无缝协同:支持将生成的音乐添加至视频并实现完美对口型,或跨媒介保持角色外观一致,实现多媒体元素的深度整合,真正实现跨媒介无缝协同。
播刻岛

播刻岛

为播客听众提供 AI 文稿与翻译的客户端

播刻岛是一款面向播客爱好者与外语学习者的智能播放客户端。它通过 AI 时间轴文稿、多语言翻译和智能总结,解决长音频与跨语言播客难以快速获取核心信息的问题,将音频内容可视化与结构化,并提供基于兴趣图谱的个性化推荐。 【核心功能】 AI 时间轴文稿:随播随显的精准文稿,支持点击句子同步跳转播放,便于回听与精读,并且支持 OPML 一键导入与 RSS 解析,跨设备云端同步订阅库,轻松迁移现有播客资产。 纯净播放体验:提供离线收听、变速播放、睡眠定时及深色模式,基础功能永久免费且无广告,让被广告侵袭已久的用户可以享受纯净的播放体验。 多语言与智能推送:支持中英日韩等 20 余种语言翻译,可一键生成单集摘要与要点,快速抓取核心内容。并且基于深度学习与兴趣图谱进行实时推荐,帮助用户打破信息茧房,发现优质创作者。
MusicHero.ai

MusicHero.ai

为创作者提供免费文本转音乐的一站式 AI 平台

一款面向内容创作者和自媒体的 AI 音乐生成工具,支持从文本直接生成多种风格的音乐。用户无需注册即可免费体验,核心差异在于集成了歌词生成、人声分离和 MP4 视频制作,提供一站式的音频创作与商用授权解决方案。 【核心功能】 文本转音视频:输入文字描述或歌词即可自动生成多种风格的高质量音乐,支持 MP3 和 WAV 格式下载。为生成的音乐自动制作 MP4 歌词视频,完美适配 YouTube 和 TikTok 等平台的分享需求。 AI 功能内置:内置 AI 歌词生成器辅助创作,同时支持生成高质量音效,满足视频与播客等项目需求,并且通过 AI 一键分离人声与伴奏,快速生成卡拉 OK 伴奏音轨,适合混音与二次创作。 商用授权下载:付费订阅用户可获取音乐分发与商业使用许可证,并提供 PDF 授权文件下载。
Flow Music

Flow Music

面向音乐人的 AI 音乐创作与发行平台

Google Flow Music 是一款面向音乐创作者的生成式 AI 平台,集音乐生成、混音、视频制作与社区分享于一体。它通过 Lyria 3.5 音乐模型和 Veo 视频模型,让用户无需专业团队即可创作录音室级歌曲并配导演音乐视频。其核心差异在于支持 Vibe-code 自定义音乐工具,并根据个人风格持续学习提供个性化创作体验。 【核心功能】 AI 音视频生成:借助 Lyria 3.5 模型,通过对话式交互生成具备丰富音乐性和动态人声的完整歌曲,并且集成 Veo 视频模型,让用户自主控制角色与美学,无需剧组即可生成专属音乐视频。 个性化创造:提供丰富的音频效果器与 Stem split 功能,方便用户对音轨进行深度重构与混音改编,平台持续学习用户风格以优化创作推荐,并支持发布歌曲、创建歌单与乐迷互动。 Vibe Code 空间:支持通过代码构建音频插件、音乐游戏和自定义 DAW 等个性化音乐创作工具,让用户存在自己调优的空间。
Meet 妙记

Meet 妙记

记会议,记灵感,记待办,记录您的每一天

【功能亮点】 • 实时语音转写:语音实时转文字,会议不再漏记重点 • 说话人区分:自动区分与会者,纪要责任清晰 • AI 智能纪要:录音结束自动生成纪要,关键内容一目了然 • 主题回看:历史录音自定义检索,随时回溯决议与待办 【使用场景】 • 会议记录:商务会议、周会、访谈自动成稿 • 灵感速记:通勤、散步时口述灵感,开口即存 • 待办整理:把口头任务交给妙记,自动归入「记录您的每一天」 【产品规格】 • 覆盖 iOS、Android、Mac、Windows 四端,数据多端同步 • 单次录音最长 4 小时,适合长会与课程 • 内置 19 种行业纪要模板,一键套用 • 免费使用,核心转写与纪要能力零门槛
Custom Song

Custom Song

把一段回忆、一句祝福或一个重要时刻,变成专属 AI 歌曲、歌词海报和音乐视频

CustomSong 是一个面向个性化音乐礼物场景的 AI 创作平台,帮助用户用更有温度的方式表达情感和纪念重要时刻。它特别适合生日、纪念日、婚礼、节日、异地关系、家庭回忆等需要独特表达的场景,让礼物从普通祝福变成一段真正属于收礼人的音乐记忆。 【核心功能】 故事生成歌词:用户输入零散的回忆文字,AI自动将其转化为富有诗意的歌词。 场景与曲风定制:提供生日、婚礼等多种场景选择,并支持挑选特定的音乐风格。 快速生成歌曲:几分钟内即可将定制歌词转化为录音室音质的专属歌曲。
合奏吧

合奏吧

一个专业的为音乐爱好者打造的云合奏平台

海内存知音,天涯若比邻~合奏吧是一个全新的线上音乐合奏平台,是爱乐者的乐园! 【多格视频】支持2-9格视频合奏,无论是一人乐队,还是与乐友一起,打破时间空间的限制,组建线上乐团,创作多声部音乐,感受和声的美妙。内置节拍器功能,一拍即合。 【线上组队】不管是钢琴、小提琴、大提琴、吉他、长笛、单簧管、萨克斯,手风琴等西乐,还是古筝、二胡、古琴、琵琶、笛萧等民乐,亦或声乐,不管是古典流行爵士或其他风格,您都可以寻找与自己趣味相投的乐手,不同的组合,碰撞出更多的激情与创意。 【练习打卡】为了帮助您养成良好的练琴习惯,我们特别推出了打卡功能。可统计练琴时长天数,设定可见范围,记录练习内容,看见进步,结识音乐搭子,组建自己的打卡圈子。 【发布帖子】您可以在应用内发布自己的音乐作品、乐谱、练琴心得、音乐感悟等帖子,与其他乐友分享交流。 【联系我们】QQ群:562071137
AudioPod AI

AudioPod AI

AI 音频工作站。

【产品介绍】 AudioPod AI 是一款基于浏览器的 AI 音频工作站,集成了文本转语音、语音转文本、AI 音乐生成和音轨分离等核心功能。 【主要功能】 AI 语音合成:支持 85+ 种语言,提供多种预设音色,支持 5 秒音频快速克隆个人声音 AI 音乐创作:生成完整歌曲、说唱、器乐和采样循环 音轨分离:提取人声、鼓点、贝斯等独立音轨,制作卡拉 OK 版本 语音转文字:自动转录并识别多说话人,准确率达 99% 音频增强:智能降噪、去除回声和背景杂音 媒体提取与转换:支持 1800+ 平台的音视频下载,20+ 格式互转 适用于播客制作、视频配音、音乐创作、在线教育等场景,提供 API 接口供开发者集成。
Noiz Agent

Noiz Agent

Noiz 推出的 Audio Super Agent。

Noiz 推出的 Audio Super Agent。 支持文本转情感 AI 音频,真实可感; 支持将想法转化为充满温情的 AI 播客; 用电影般的旁白和情感,让你的文字变成可听的电子书; 用富有变现力的多语言配音 AI,给你的视觉注入心跳; 专有的 AI 语音模型善于捕捉情感、语调和灵魂; 切换语音,调整角色 AI 声音与情感,只需一条指令。
火宝短剧

火宝短剧

人人都可以是导演的时代来了

曾经,拍一部短片需要专业的团队、昂贵的器材、复杂的后期。但现在,AI 正在悄然改变这一切。 我们想做的,就是 降低创作的门槛 ,让技术不再成为表达的障碍,让每一个有故事的人,都能用影像表达自己。 从剧本生成到角色设计,从分镜绘制到视频合成——我们试图构建一个 完整的创作流 ,让 AI 成为你最得力的创作伙伴。
noiz

noiz

以声音为引擎,连接技术与创造力的全新平台。

我们相信,声音,正在重新定义内容表达的边界。 NOIZ AI,以自研 AI 语音大模型为核心,打造面向未来的内容生态平台。我们将声音的价值重新演绎,并以声音为引擎重构当下内容的创作方式。我们相信,声音会成为每个人都能驾驭的创造力工具。 更懂 “人” 的语音生成技术 NOIZ AI 支持 3 秒音色克隆,实现声音的快速复刻,而且具备跨语言、跨风格迁移能力,还能精准控制情绪与语调细节 —— 愤怒、幽默、温柔等等,情绪的表达不再只是选项,而是可调节的创作语言。我们正在让机器说话,像人一样真实而有温度。 原生支持多模态交互,创作从不设限 文字、语音、图像皆可输入,创作从不设限! AI 自动理解意图并生成适配内容。当你上传一张图片,无需多言,系统即可智能生成配音脚本并完成声音演绎,让创作更直觉、更高效。 AI-Native 内容社区,声音形态的无限想象空间 在 NOIZ 的社区里,鬼畜混剪、短剧配音、有声书等新内容形态层出不穷。无数的 NOIZ 用户正在这里沸腾。我们相信,未来的内容不止于图文,而是充满声音的生命力与想象力。
Castwise

Castwise

专为播客创作者设计的内容生产工具。

【产品介绍】 Castwise 是一款专为播客创作者设计的内容生产工具,能够将单个音频文件自动转化为多种营销素材。 【核心功能】 上传音频后,系统可一键生成: 文字内容:完整转录稿、节目笔记、长文章 社交媒体素材:X Thread、小红书卡片、高光片段 辅助内容:字幕文件、思维导图、Newsletter 【定价模式】 采用按分钟计费,无需订阅。 新用户获赠 30 分钟免费额度,付费价格为每分钟 $0.10(限时优惠价)。 支持英文、简体中文、繁体中文等多语言处理。 产品同时提供 API 接口,方便开发者集成到自有应用中。
Next Music

Next Music

AI 音乐创作神器,原创、翻唱、GIF 视频。

Next Music 是一款创新的免费 AI 音乐生成工具,让音乐创作变得简单有趣。 核心功能 ⚡ 极速创作 只需 30 秒即可生成完整音乐作品,让灵感即刻变为现实。 🎵 智能翻唱 支持为经典旋律重新填词,创作独特的翻唱版本,赋予老歌新生命。 🎬 趣味视频 一键生成魔性音乐视频,支持导入任意表情包素材,让作品更具传播力。 💰 完全免费 所有功能免费开放,零门槛享受 AI 音乐创作的乐趣。 适用场景 短视频 BGM 制作 创意内容配乐 娱乐搞笑视频 音乐爱好者创作实验 无论你是专业创作者还是音乐爱好者,Next Music 都能帮你轻松实现音乐创意,开启 AI 音乐创作新体验!
且听

且听

AI 时代深度讲解分析好书的语音听库。

且听 APP —— 一个精彩内容不仅可以听、可以读,更致力于引发你的深度思考。 在且听 APP,你可以通过「听」的方式高效获取知识。 我们辅以权威榜单,主动呈现你最感兴趣的内容,帮你减轻选择负担。 开箱即听:简化一切步骤,让听书像呼吸一样自然。 认知升级:区别于传统听书,我们绝非单纯的文字搬运。且听 APP 为你补充书本之外的背景与延伸知识,帮你构建更完整的认知体系。给原本只能用来娱乐放松的碎片化时间,额外扩展了积累知识的可能。听了,还想听。 【功能亮点】 深度内容库:优质内容持续扩充,深度拆解分析,让你的任何兴趣都有回响。 权威榜单: 汇集各类权威图书榜单,用数据帮你筛选,不再苦恼于挑选内容。 拟真音色:多种 AI 音色风格可供选择,精准匹配你的听觉偏好。 文音对照:完善的精华文本一并提供,听读自由切换,让你自主选择知识获取的方式。 【且听上线活动】 ● 注册即享:新用户注册即可领取 7 天会员。 ● 邀请有礼:每成功邀请一位新用户注册登录,双方均可获得 1 个月免费会员。多邀多得,让知识无限续杯。
NewsBang

NewsBang

AI 新闻与洞察应用。

【产品介绍】 NewsBang 是一款 AI 驱动的新闻应用,专注于通过”提问模型”(Questioning Model)重新定义新闻阅读体验。 【产品功能】 智能阅读:从可信来源提取关键要点,单屏呈现平衡观点,支持左滑深度解读 AI 播客:由虚拟主播 Alice 和 Brad 播报新闻,用户可随时加入实时语音互动 个性化推送:每日早 8 点定制新闻简报,适配快节奏生活方式 产品突破传统 AI 摘要模式,通过提出更好的问题帮助用户理解新闻背后的”为什么”,解决信息过载难题。 采用类似短视频的滑动交互,让深度阅读变得轻松高效。
Tunee

Tunee

让每个人通过简单的对话,创作真正个性化的音乐。

【产品描述】 Tunee是国内首个对话式音乐创作Agent,由天谱乐团队孵化。你只需要用自然语言描述你的想法,和Tunee对话,即可生成你真正想要的音乐。 【产品功能】 智能对话创作- 只需告诉 Tunee 您的想法。无需复杂的参数,也无需专业术语。 多媒体理解- 上传视频、图像或音频片段。Tunee 能够理解情感和风格,从而创作出与之匹配的音乐。 实时网页搜索- Tunee 搜索最新的音乐趋势并分析参考资料,让您的创作始终与时俱进。 专业输出- 完整的制作流程,包含智能母带处理、歌词创作和商业授权。 【团队介绍】 我们是一支充满热情的中国团队,由独立音乐人、吉他手和算法工程师组成,来自TikTok、阿里巴巴等知名公司。我们的团队成员来自伦敦艺术学院、纽约大学、南加州大学、香港大学、港科大等世界一流学府,带来了多元化的视角。6年来(2019-2025),我们深耕音乐行业,打造了影响数百万用户的音乐产品。现在我们立足新加坡,致力于为全球音乐爱好者提供服务。
Suno

Suno

在任何地方发现、创造、分享音乐。

Suno 正在构建一个任何人都能创作出伟大音乐的未来。无论你是浴室歌手还是排行榜艺术家,我们都打破了你与梦想创作的歌曲之间的障碍。无需乐器,只需想象力。从你的脑海到音乐。 1. 令人惊叹的歌曲质量 无论你脑中是否有旋律,是否写下了歌词,或者只是想听到某种感觉——Suno 让高质量的音乐创作变得触手可及 2. 每日 10 首免费歌曲 即刻将任何时刻转化为定制音乐——从通勤到内部笑话。用音乐表达言语无法传达的情感。永远免费,无需订阅。 3. 免费 AI 音乐生成器 发现当每个人都能创作音乐时,一切皆有可能。使用市场领先的 AI 歌曲生成器,探索数百万首歌曲——混音、幽默和原始情感。 3. 与全世界分享 创作对你有意义音乐,然后与同样能感受到它的人分享。从你的小圈子到数百万音乐爱好者,你的下一首曲目可以走得更远。
Podwise

Podwise

排名第一的 AI 播客应用。

Podwise 是一款专为终身学习者打造的AI工具,能将海量的播客、YouTube视频等音视频内容,迅速转化为结构化的知识。无论您是想节省时间、高效学习,还是构建自己的知识库,Podwise 都能为您提供强大支持。 核心功能: AI智能摘要: 自动从长篇内容中提炼出关键要点、章节和行动建议,让您在几分钟内掌握核心思想。 交互式逐字稿: 提供带时间戳的完整文字稿,方便您随时定位和回顾重要信息。 结构化思维导图: 自动生成内容的思维导图(Mind Map),帮助您理清逻辑脉络,加深理解和记忆。 无缝知识库整合: 支持一键将您的笔记和摘要导出到 Notion, Obsidian, Readwise 等主流知识管理工具中。 使用 Podwise,您可以轻松将碎片化的收听时间,转化为系统性的知识积累,让学习变得前所未有的高效和轻松。
ListenHub

ListenHub

免费 AI 播客生成器 | FlowSpeech 说人话的 TTS。

【产品介绍】 ListenHub 是一款 AI 驱动的播客创作与声音定制平台,让用户通过文字、图文甚至简单的创意,快速生成自然流畅的对谈式播客。输入内容后 3 分钟即可完成音频化转化,让播客创作从未如此简单。同时,ListenHub 提供 声音克隆服务,帮助创作者构建专属音色,打造独特的个人品牌,让你的播客更具辨识度。 【产品功能】 文本转对谈播客:输入文字或上传图文,选择两位虚拟主播,AI 自动生成生动自然的对谈播客。 声音克隆与品牌构建:通过声音克隆打造专属音色,支持多风格(脱口秀、口播等)个性化选择,强化个人或品牌特色。 一站式播客生产:集脚本改写、音频生成于一体,播客可直接发布或二次创作,用于视频、动画等多场景传播。 【产品理念】 ListenHub 希望让每个人都能“听见自己的好奇心”。我们用 AI 技术降低播客创作的门槛,帮助知识、故事与观点以最自然的声音传播。无论你是个人创作者还是团队品牌,ListenHub 都能让你的内容更快、更高效地被听见。
谱乐 AI

谱乐 AI

开启人人都能创作的 AI 音乐时代。

谱乐 AI 是 一站式 AI 音乐 创作平台, 集 AI 音乐生成、混音、母带处理、人声克隆与替换以及音乐发行于一体,在这里,每个人都能创作,每个人都能发行。 1. 多模型 AI 音乐创作 集成 Suno AI 、Mureka 等顶尖模型,加上自研 YM 模型,一键生成专业级音乐作品,满足各种风格需求。 2. AI 音色克隆训练 上传音频样本训练专属 AI 模型,克隆独特音色,让 AI 用你喜欢的声音演唱,打造个人专属音乐风格。 3. 智能歌词创作 AI 驱动的歌词创作助手,支持多种风格和主题,与音乐生成无缝结合,帮你创作完整的音乐作品。 4. AI 母带处理 专业级 AI 母带处理技术,自动优化音频动态、均衡和响度,让你的音乐达到商业发行标准。 5. 智能音轨分离 AI 驱动的音轨分离技术,精确提取人声、鼓点、贝斯等独立轨道,为混音和翻唱提供完美素材。 6. 多轨音频混音 支持 16 轨道专业混音,包含 EQ 调节、音量控制、实时预览,让你像专业制作人一样创作音乐。 7. 专业音频编辑 在线多轨音频编辑器,支持剪切、拼接、淡入淡出等专业编辑功能,无需安装任何软件。 8. AI 音质增强 智能音频升采样和降噪技术,提升音频清晰度和保真度,让你的作品音质更加出色。 9. MIDI 音乐转换 将 MIDI 文件转换为真实乐器演奏,支持多种音色选择,为音乐制作提供更多创作素材。 10. 音乐续写延长 基于现有音乐片段,AI 智能续写延长,保持风格一致性,轻松创作完整长篇作品。 11. 一站式创作平台 从创意到成品的完整音乐制作流程,所有工具集成在一个平台,提升创作效率。 12. 全球音乐平台发行 一键发行到汽水音乐、QQ 音乐、网易云音乐、Spotify、Apple Music 等全球 100+ 主流音乐平台,让你的作品触达全世界听众。 13. 完整商业使用权 所有创作的音乐均享有明确的商业使用授权,可放心用于广告、视频、直播等商业项目。 你的音乐,应该被世界听见。
海绵音乐

海绵音乐

专注 AI 编曲与旋律生成。

集AI创作与播放管理于一体的免费音乐工具,支持自定义曲风、心情及音色,一键生成歌词。其亮点在于强大的多轨编辑器和MIDI键盘功能,为用户提供从灵感激发到成品分享的全流程服务,无论是音乐新手还是资深爱好者都能轻松上手,享受个性化音乐创作的乐趣。
YouTube Dubbing

YouTube Dubbing

在线看国外视频的浏览器插件,不仅可翻译字幕,还能直接播放译后配音。

「YouTube中文配音」是一款在线看国外视频的浏览器插件,区别于传统字幕类插件,不仅翻译字幕,更能直接播放译后配音。只需点击播放按钮,即可一键翻译并收听外语视频,让你省去盯字幕的烦恼,大幅提升观看效率。 支持 GPT、Claude 系列等 AI 模型翻译,涵盖几乎所有主流语言,从英语、韩语、法语到小语种、方言均可轻松应对。 多平台终端:兼容 Chrome、FireFox、Safari(含 iOS 版)等浏览器,可在 PC、Android、iOS 等设备上使用,随时随地看外语视频。 多网站覆盖:目前已适配 YouTube、Udemy、Bilibili、gamedev.tv 等热门站点,并持续拓展更多平台,让你不错过任何优质内容。 🤩 当前产品完全免费
BeatViz

BeatViz

AI 驱动的音乐视频生成平台。

【产品介绍】 BeatViz 是一款 AI 驱动的音乐视频生成平台,专为音乐人、内容创作者和品牌打造。 用户只需上传音频文件并输入文字描述,AI 即可在数分钟内自动分析音乐节奏(BPM)和情绪,生成与音乐完美同步的专业级视频。 平台集成了 Google Veo、Luma AI、Pika 等多个顶级 AI 视频模型,支持多种分辨率(16:9/9:16/1:1)和自定义时长。 无需视频编辑经验,即可快速制作出适合 YouTube、TikTok 等平台的高质量音乐视觉内容。 【核心功能】 智能音乐同步:自动检测 BPM 和节拍,视觉效果精准匹配音乐节奏 AI 音乐生成:无音轨时可根据提示词自动生成原创配乐 多模型聚合:整合多个领先 AI 视频模型,一键切换不同视觉风格 可视化编辑器:双面板工作流,左侧生成素材,右侧实时编辑 一键特效:内置病毒式流行效果库,无需手动编辑
Dayvo

Dayvo

轻量级 AI 语音日记应用。

【产品介绍】 DayVo 是一款轻量级 AI 语音日记应用,专为思维速度快于打字速度的用户设计。 DayVo 定位为”思维伴侣”,适用于日常想法捕捉、语音日记和快速记录场景。 相比传统语音备忘录,它解决了录音难以回顾和搜索的痛点,让语音记录真正变得可用。 目前已在 iOS App Store 上线。 【核心功能】 实时转录:录音时自动将语音转换为文字 灵活编辑:文本支持直接编辑、复制和导出 智能搜索:可快速检索历史录音内容 本地优先:所有数据存储在设备本地,保护隐私安全 极简操作:一键录音,无需复杂设置
ACE Studio 2.0

ACE Studio 2.0

面向音乐制作人的 AI 驱动音乐工作站。

【产品介绍】 ACE Studio 2.0 是一款面向音乐制作人的 AI 驱动音乐工作站,集成了歌声合成、AI 乐器、声音克隆、声线转换、音轨分离等多项功能。 【核心功能】 歌声合成:支持 140+ 声线、8 种语言,可将 MIDI 和歌词转化为专业级人声 AI 乐器:通过 MIDI 生成自然的乐器演奏,支持合奏模式 声音克隆:上传歌声样本即可训练个人 AI 歌声模型 声线转换:将声音转换为不同角色或创意音色 音轨分离:采用先进技术将音轨拆分为独立分轨 生成工具包:提供音乐增强、灵感生成等 AI 辅助创作工具 产品通过 ACE Bridge 插件支持 VST3、AU、AAX 格式,可无缝集成至主流 DAW。 所有 AI 声音和乐器均基于真实艺术家授权录制,支持免版税商业使用。
Befreed

Befreed

个性化音频学习 Agent。

【产品介绍】 BeFreed 是一款个性化音频学习应用,将书籍和知识内容转化为定制化的音频播客。 【核心功能】 智能音频生成:根据用户学习意图,自动整合多个知识源,生成个性化音频内容 自定义语音:用户可选择喜爱的旁白声音 灵活学习模式:支持故事化讲述或事实陈述,可选择浅尝或深度学习 互动对话:可与音频内容进行实时问答交互 知识管理:提供 Mindspace 功能,自动生成闪卡、学习笔记和知识记忆库 BeFreed 将碎片时间转化为学习场景,让用户在通勤、运动等日常活动中轻松完成知识获取。
Producer

Producer

AI 音乐创作平台。

【产品介绍】 Producer 是一个 AI 音乐创作平台,通过生成式 AI 技术帮助用户从简单的文本提示创建专业级音乐作品。 【核心功能】 AI 音乐生成:通过自然语言指令生成多种风格的音乐作品 音轨混音:支持替换音乐中的特定声部(Stems),如乐器或人声 音频扩展:可延长现有音轨,扩展音乐长度 音频上传与录制:支持上传或录制音频文件进行二次创作 个性化定制:根据用户需求调整音乐风格和效果 平台采用 FUZZ2.0 音乐模型,为音乐人、内容创作者和游戏开发者等提供高效的音乐创作工具。
Huxe AI

Huxe AI

AI 音频伴侣。

Huxe:将日常信息转化为个性化音频智能 在通勤、运动或需要远离屏幕时——无需无尽滚动,即可保持领先。 【每日简报:告别无意义刷屏的清晨】 • 一份个性化音频简报,整合你的实际邮件、日程安排以及你所关注的世界动态。准备出门的五分钟里,便已尽在掌握。 【个性化信息流】 • 并非泛泛的推荐内容——而是关于你特定兴趣的真正个性化音频。每次都为你生成全新内容。如同拥有一支真正了解你的编辑团队。 深度播客:任何问题,即刻成播客 • 瞬间将好奇心转化为音频。无论是”解释一下大家都在用的那个新社交应用”还是”维多利亚时代建筑史”,你都能获得清晰的解答,而非淹没在搜索结果的海洋中。 【交互式智能:真正会倾听的音频】 • 随时打断以深入探讨、简化说明或完全转向。说出”等等,换个方式解释”或”详细讲讲那部分”。这不是录音——而是一场由你掌控深度与方向的对话。 核心魔力:一切实时更新。绝不重复。零投入所需。 我们正在重新定义人类获取信息的方式——从尊重你的时间、智识与注意力的音频开始。
GMI Cloud 推理引擎

GMI Cloud 推理引擎

模型统一接入和在线使用的云服务平台。

GMI Cloud Inference Engine 是全球 AI 模型统一接入与在线使用的“高性能推理引擎平台”, 底层搭载 H100/H200 芯片,集成全球近百个最前沿的 LLM、Video、Image、Audio 模型,为 AI 开发者与企业提供速度更快、质量更高的模型服务。 已上线模型: LLM(已上线36个) 近期上线: Kimi-K2-Thinking MiniMax-M2 GPT OSS 120b GLM-4.6 DeepSeek-V3.2-Exp …… Video(已上线32个) 近期上线: Minimax-Hailuo-2.3系列 kling-v2-5-turbo veo-3.1系列 sora-2系列 Wan2.5系列 …… Image(已上线4个) flux-kontext-pro seededit-3-0-i2i-250628 seedream-3-0-t2i-250415 seedream-4-0-250828 Audio(已上线12个) minimax-audio-voice-clone-speech-2.6系列 minimax-tts-speech-2.6系列 elevenlabs-tts-v3 ……
Lattice AI

Lattice AI

AI 音频处理 Agent。

【产品介绍】 Lattice AI 具有由 Lattice-1-Alpha 模型提供的高级强制对齐和字幕生成功能。 具有最先进的对齐精度,目前仅支持英语。 可以处理含噪声音频和不完美的转录文本,并针对 CPU 和 GPU(CUDA/MPS)进行优化。 【产品功能】 Lattice AI 引擎:速度与精准度的飞跃 闪电般的媒体处理,零云端依赖。 音视频资产:时间轴完美对齐 将复杂的音视频内容转化为可搜索、可操作的数据资产。 Lattice AI 驱动的数据自主权 隐私即架构 – 完全掌控您的 AI 能力和数据。
Fish Audio

Fish Audio

最自然的 AI 语音生成器。

【产品介绍】 Fish Audio S1 是最具表现力和情感丰富的 TTS 模型,能够创建栩栩如生的声音,捕捉情感、节奏和细微差别。 10 秒内即可克隆任意声音,保留口音、语调和说话习惯,带来无与伦比的真实感。 【产品功能】 1. 视频配音 将脚本转化为丰富的、场景匹配的叙述,非常适合用于YouTube、广告和解说。切换语调,添加情感标签,吸引观众注意。 2. 有声书朗读 具有逼真节奏、情感和章节级控制的发布级叙事。无需录音棚即可生成符合 ACX/Audible 规格的数小时音频。 3. 角色配音 克隆签名声音或为游戏、动画和互动故事打造品牌形象。在线或通过易于使用的API微调动态情感。 4. 对话聊天机器人 为客户支持和虚拟代理提供自然的语音,延迟最小。注入语气标记,以提供有帮助、富有同情心或积极向上的回应,使其真正具有人的感觉。
音秘 AudioMyst

音秘 AudioMyst

让创作更聪明,让声音更动人。

【产品介绍】 音秘 AudioMyst 是一款百度推出的 UGC+PGC 结合的基于行业领先 AI 模型开发的音频内容自动化生产及消费平台。 旨在通过智能化工具降低播客制作门槛,赋能个人声音创作者、媒体机构及开发者,打造“零技术门槛、全场景覆盖”的音频内容生态。 【产品功能】 1. 文字转对话音频: 根据脚本生成高度拟人的,有情绪有节奏的聊天对话式播客音频。 支持添加背景音乐,音频更丰富。 精简模式和深度模式切换,灵活控制生成时长。 边生成边试听,告别等待焦虑。 2. 音色克隆,自定义主播:平台会提供预设的不同风格的主播,用户还可以自己录制10s音频进行音色克隆,添加自己的专属主播。 3. 下载与分享:可以下载自己创建的和公开的音频文件、脚本文件、封面图,可以将播客音频以复制链接或图片二维码的形式进行分享。 4. 播客广场畅听: 精选播客:平台不定期更新关于论文研报、时事新闻、电影赏析、书籍推荐、体育赛事等专题播客,用户既可以是创作者,也可以是听众,获取一手资讯,随时填补碎片时间。 公开播客:用户可以将自己创作的播客公开分享到播客广场,其他用户可以收听和评价,互动体验超强。 我生成的:用户可以在我生成的里面查看收听自己创作的播客,并可以随时切换私密/公开或删除。 5. 支持人工修改脚本:音秘创作的脚本不满意?可以人工逐字修改编辑,重新生成音频,AI 也得听人指挥。
SekoTalk

SekoTalk

让 Seko 不止会生成画面,也能开口说话。

【产品介绍】 SekoTalk 是视频生成工具 Seko 的子品牌,让 Seko 不止会生成画面,也能开口说话。 它专注语音驱动与口型匹配,带来更真实的表达体验。 【产品功能】 精准口型同步:从日常对话到高速 Rap,都能自然匹配,适配头像、半身像和全身像。 多语言、多风格:支持中文、英语、法语、日语、韩语及闽南语等多种方言;可生成京剧、Rap、美声、民歌、K-Pop 等多样声音风格。 长视频稳定性:一致性生成最长可达 15 分钟。 多人对话:支持多人交替或同时说话的复杂场景。 提示词控制:SekoTalk 支持通过提示词控制角色动作。
来福

来福

你的私人AI电台,海量内容、打开就播,个性化推荐、越听越懂你,语音聊天、智控点播,多种AI主播随心选。

你的私人 AI 电台,海量内容、打开就播,个性化推荐、越听越懂你,语音聊天、智控点播,多种 AI 主播随心选,给你7x24h的声音陪伴。 海量内容,打开就播 实时内容种类多、质量高,不用找节目,打开即享自动推送节目,连播听不停。 个性化推荐,越听越懂你 拒绝千篇一律,AI根据你的历史收听喜好推荐节目,越听推荐越精准。 语音提问、点播、控制、聊天 开麦说话,即可交流提问、点播想听的节目、换节目调音量,还可以聊上几句。 AI 主播,多种风格 不同节目搭配不同主播,资讯速报员、八卦段子手、生活观察者……多种风格随你挑选。 🤩 当前产品完全免费
小云雀

小云雀

一站式智能内容创作工具,覆盖视频、口播、海报、商品图等多种内容类型的创作。

小云雀是剪映出品的 AI 视频和图片创作助手,支持零门槛创作视频、数字人口播视频、设计图和图片换背景,只需输入一句指令,AI 即可高效帮你完成内容创作。 更有多样化数字人形象,满足不同场景的创作需求,告别创意忧愁,助力内容脱颖而出! 小云雀的核心能力: 智能生视频:不会剪辑缺乏灵感?只需输入创作主题,即可产出 15-60 秒爆款短视频,原始实拍与 AI 生成素材自然融合,小白也能轻松创作! 数字人讲解:真人模特费用高?小云雀提供超丰富的可商用数字人形象,输入文字自动生成口播视频,创作简单又高效! AI 图片设计:无需设计基础!一句指令即可批量生成吸睛的风格化图片,轻松呈现高级感,打造专业设计。 智能换背景:精准抠图,智能光影优化,根据需求匹配多元化的图片背景,无需专业棚拍,瞬间高级感拉满! 照片会说话:无论是真人照片、卡通人物还是动物,都能瞬间像真人一样口播说话,创意无边界。 🤩 当前产品完全免费
回森

回森

Z 世代的全民唱歌软件。

【产品介绍】 回森是年轻人的音乐K歌社区! 【产品功能】 1. 爆火的弹幕合唱,几秒钟一个歌声弹幕一张嘴就停不下来。给好友的作品发射满屏歌声弹幕是森友们最上瘾的互动玩法,可以用多位好友的弹幕组成一个超震撼合唱团作品。 2. 更舒服的K歌体验,Ai 美音功能来袭,精准塑造更完美的你!回森专研实验室级别K歌音效、智能升降调、一键修音、超新潮音乐视频模版、特效、配图,唱歌的小烦恼通通为你搞定。 3. 歌房陪伴不打烊,或嗨唱、或畅聊,抢唱、点唱、PK、自由麦,你想要的功能这里都有。但是更重要的,这是一个 24 小时不打烊的陪伴空间。 4. 与懂你的人相聚,天团是森友们的兴趣小群组,加入天团可以遇到一群志同道合的新朋友,大家互唱弹幕、互送礼物、一起泡歌房……还可以参加丰富的天团活动赢取荣誉和奖励,比如天团 PK 赛、天团音乐节等。
Typeless

Typeless

真正智能的 AI 语音听写。

【产品介绍】 Typeless 是一款智能语音听写 AI。通过自然地说话,Typeless 会将您的文字实时转换成精美的消息、电子邮件和文档,就像您精心输入的那样,这会比打字快 4 倍。 使用Typeless,计算机上的每个应用程序中均可实现无缝 AI 语音听写。你终于可以专注于你想说什么,而不是如何说。你的声音就是新的键盘。 【产品功能】 自动删除“嗯”、“呃”和“你知道”等填充词,使您的转录清晰、专业。 自动检测并删除您讲话中不必要的重复词,确保您的语言简洁易懂。 Typeless 可以识别您在句子中间纠正自己,并仅保留您最终想要表达的信息,从而避免混乱和混淆。 自动将语音列表、步骤和关键点组织成清晰的结构化文本,省去手动格式化的麻烦。 Typeless 让您轻松表达想法,确保您的信息易于理解并且您的观点清晰明了。 根据您使用的应用程序(工作电子邮件、聊天、客户支持)调整语气和风格,确保符合上下文。 无论您使用任何语言,还是无缝地混合使用多种语言,Typeless 都会自动检测并转录您的语言。简单又轻松。 轻松地将您的独特词汇添加到您的个人词典中,Typeless 不会错过。 150 年来,我们依赖键盘——但那个时代即将结束。你的键盘现在已过时。自然说话,看着你的声音变成清晰、格式化、润色的文本。
智声云配 DubbingX

智声云配 DubbingX

有情绪的 AI 语音,才能真正像人。

【产品介绍】 智声云配 DubbingX ,功能涵盖语音合成 TTS(Text-To-Speech)、音色迁移转换、音色采集自制、歌声迁移转换、歌声合成、AI 音乐生成等。成为全球目前唯一一款【多情绪、多语态、全可控】的 AI 配音工具。利用近【 2500 种细分情绪语态】,呈现出的超自然、超拟真、超情绪表现力,覆盖各类游戏、动画、影视、有声书、机器人、虚拟人等场景,全面满足您的业务与产品所需。所有音色版权合规可商用,助您降低高达 80 %以上的配音制作成本。 【产品功能】 语音合成 TTS(Text-To-Speech) 提供普通模式和导演模式两种选择,普通模式适用于单人发声需求,导演模式专为对白和对话场景设计,支持多角色同时发声。 用户可以根据需求在界面上轻松切换模式,实现复杂对话场景的快速生成。 音色迁移转换 用户可以将一个人的声音转换为另一个人的声音,实现音色的灵活迁移。 支持用户采集并自制音色,为个性化配音提供可能。 音色采集自制 用户可以将自己的歌声转换成任意想要的音色,甚至能够模拟出专业歌手的演唱效果。 支持 AI 音乐生成,为用户提供音乐创作的灵感和支持。
TemPolor

TemPolor

人人都能玩点音乐。

【产品简介】 天谱乐是趣丸科技自研的全球首个多模态音乐生成大模型,不仅支持文生曲、音频生曲,还首创图片生曲和视频生曲功能,生成的歌曲自带人声唱词,效果达到专业发行水准。 简单来说,用户只需要输入一句话、一张照片或一段视频,就可以在2分钟内生成一首词曲结构完整的歌曲。目前已有 4600 万人注册使用天谱乐官网、小程序以及唱鸭 App,累计创作近 1200 万首 AI 歌曲。 天谱乐致力于通过 AIGC 探索音乐创作的技术平权,打破 AI 在音乐理解和生成上的局限,并通过技术创新降低音乐创作门槛,让用户不再受限于专业的乐理知识,复杂的音乐制作流程和昂贵的版权费用,为用户提供高效、创新的创作体验。2024 年天谱乐音乐大模型项目在第三届琶洲算法大赛中夺得全球总冠军。 【产品功能】 文本生曲:用户只需输入一个想法、几句当下的心情,或者写好的歌词,天谱乐会基于长序列音乐语义建模,根据用户的创意,生成长达 4.5 分钟的歌曲或纯音乐,打破了传统音乐创作对专业知识和技能的限制。 图片/视频生曲:当用户拍摄了一张照片、录制了一段视频,上传到天谱乐,天谱乐会基于AI 影像识别算法,逐帧识别和理解画面色彩、情绪的细微变化,最终生成高契合度的配乐,让图片或视频更具感染力。 MidiRender:专业创作者可以输入一段自己构想的动机旋律,让天谱乐根据这个原创音乐片段完成歌词填充和编曲,精确控制大模型创作过程,让 AI 音乐创作实现从盲盒式生成到精确控制的转变。 多语言:支持中、英、日、韩、俄、西、德、法等16国语言。 【全新升级】 扩展:让音乐流畅自然——现已支持基于 MIDI 的人声和乐器扩展。 编辑歌词:无需重建音轨,即可随时更新您的人声歌词。 修复人声:快速修复唱错或跑调的歌词。 替换:使用新提示音重写并重新生成任何乐器部分。 删除:在完全控制的情况下删除不需要的音轨。 获取许可证:立即为您的 Create 项目下载升级证书。 【团队介绍】 我们是一支充满热情的中国团队,由独立音乐人、吉他手和算法工程师组成,来自TikTok、阿里巴巴等知名公司。我们的团队成员来自伦敦艺术学院、纽约大学、南加州大学、香港大学、港科大等世界一流学府,带来了多元化的视角。6年来(2019-2025),我们深耕音乐行业,打造了影响数百万用户的音乐产品。现在我们立足新加坡,致力于为全球音乐爱好者提供服务。