AceStep v1.5官方Logo - 音频与音乐工具

AceStep v1.5

开源版Suno——更快、更强。

音频与音乐
AceStep v1.5 - 开源版Suno——更快、更强。 - 产品截图展示1

关于 AceStep v1.5

前言 ACE-Step 1.5 是一款开源音乐模型,在 A100 显卡上仅需约 2 秒即可生成完整歌曲。支持本地运行,显存占用仅需 4GB 左右(普通 PC 即可畅玩),且在多项主流评测指标上均超越了目前的顶级商用及开源模型。 目前,这个领域基本被商用闭源模型垄断。这意味着我们的“创作权”往往被绑定在特定的 App 或模型上。一旦失去访问权限,或者模型发生了非你所愿的变动,你的创作能力可能一夜之间受到打击。 通过 ACE-Step 1.5 ,我们希望打破这种依赖,为世界提供一个真正具有竞争力的开源选择。我们认为创作者应当能够:在自己的电脑上运行并完全掌控模型;使用自己的作品进行 Fine-tune (微调);无需再为隐私和数据泄露感到焦虑。 核心特性: 🚀 极速生成:在单卡 A100 上,生成一首 3 分钟的完整歌曲仅需约 2 秒。在消费级显卡上表现依然出色:RTX 3090 约 10 秒即可完成,且显存占用仅需 4GB 左右。 🎧 专业品质:在主流评测指标( SongEval & AudioBox )上,其表现已超越 SUNO 等商业模型,并与现有的开源模型拉开了显著差距。 🎨 高灵活性:创作者只需提供少量歌曲即可训练专属 LoRA ,精准捕捉并复刻特定的音乐风格。 🛡️ 安全合规:训练数据完全基于授权素材 + 合成数据,规避版权争议。 🔧丰富且实用的功能: 全曲生成 (Full song generation) 翻唱/封面重绘 (Song cover / Repainting) 伴奏音轨叠加 (基于现有轨道添加 Stem) 生成式音轨拆分 (Generative stem splitting) 歌曲续写/补全 (Song completion) 由于其极快的生成速度和本地运行的特性,ACE-Step 1.5 解锁了许多全新的工作流: 一、批量生成 + 自动评分 (Batch Generation & Auto Scoring) 得益于本地部署的高效率,你完全可以针对同一个 Prompt 一次性生成 100 个版本,从中挑选最完美的一个。 为了配合这一工作流,我们同步开源了一个 Reward Model (奖励模型)。你可以让模型自动为这 100 首生成的歌曲打分,你只需要直接导出分数最高的那首即可。这种“大力出奇迹”的方式能让你在极短时间内获得高质量的成品。 二、LoRA fine-tuning: 只要有几首歌,或者几十首歌,你就能训练自己的 LoRA 。在我们的实验中,我们用 8 首春节风格的歌曲训练了一台 LoRA 。之后,当我们创作出完全不同的曲风,比如情歌、爵士和摇滚时,它们都带有浓厚的中国新年氛围。LoRA 让创作者可以用自己的音乐微调风格。它从你的歌曲中学习,捕捉你的风格。而且因为你本地运行,你拥有 LoRA ,不用太担心数据泄露。 三、Cover 输入任意歌曲,然后提供提示和歌词,你就能将曲目转换成不同的风格。我们尝试过把一首以人声为主的流行歌曲改编成合成器驱动的器乐舞曲,也尝试把一首柔和的女声歌改编成男性摇滚版本。这与《 SUNO 》的翻唱特色略有不同:它保留了输入歌曲的结构和时长,但重新构想了旋律和乐器编制。你用它打造什么取决于你的创造力,我们迫不及待想看到你的作品。 四、Repainting: 这是个非常方便的功能。你加载一首歌,选中一段,点击“Repaint”,然后重新生成该段,同时保持之前和之后的音频。如果你不喜欢一小部分很棒的赛道,可以继续重新粉刷那段。是的,ACE-Step 很快,所以你可以重涂 100 次,选中你喜欢的那个。 五、Vibe DJ — 一款有趣的社区应用 利用 ACE-Step 的本地运行时、高速和重绘功能,一位社区开发者开发了一个非常酷的应用,叫 VibeDJ 。每次输入提示时,模型都会生成一个固定长度的片段并播放。播放时,你输入下一个提示,然后用 Repaint 生成下一个片段,这样它就能无缝连接上一个片段。这能让任何人通过自然语言提示变成 DJ 。你是通过打字而不是混音来“DJ”的。想象一下,在家庭派对上拿出笔记本电脑,为大家现场主持一场 VibeDJ 表演。这正是本地实时生成所能实现的。 ComfyUI 集成 我们很高兴地告诉大家,ACE-Step 1.5 已经在 ComfyUI 上提供,这得益于他们的 day-0 支持 🙌 教程(如何在 ComfyUI 中使用 ACE-Step 1.5 ): https://blog.comfy.org/p/ace-step-15-is-now-available-in-comfyui 在 ACE-Step 1.5 中,唯一的限制就是你的想象力 请在这里探索 ACE-Step 仓库👇 https://github.com/ace-step/ACE-Step-1.5 如果你喜欢 ACE-Step 1.5 ,请帮忙给仓库加星号!

相关推荐

探索更多 音频与音乐 类产品

KITS AI

KITS AI

KITS AI 是面向音频工作者的编辑处理和人声转换工具。

KITS AI 在音乐制作工作流程中提供AI人声处理工具,从人声音高校正、人声隔离丶音频乐器轨道分离以及 AI 母带工具最终处理您的作品。 克隆你自己的唱歌和说话模型,或通过社区AI语音库,最低成本使用知名歌手本人亲自克隆和授权的声音模型完成你的作品。 将工作流程的每一步都提高 10 倍,让你能够减少在语音编辑工作中花费的时间,将更多时间用于灵感创作。
Elevenlabs

Elevenlabs

市面上最逼真的 AI 语音,为社交媒体、广告、电影等生成高质量的画外音。

可以说 70+ 种语言,多语言文本转语音模型与有助于国际受众建立联系。 具有丰富情感,响应文本中的情感线索,并调整其交付以适应即时内容和更广泛的上下文。 克隆你自己的声音模型,或选择语音库内的数千个高品质语音,也可使用自定义创建从头开始创建新的 AI 语音。 无论您是制作有声读物、视频还是交互式内容,都可以找到完美的声音来将您的愿景变为现实。
NoemaLab 创作实验室【Beta】

NoemaLab 创作实验室【Beta】

致力于如何让音乐创作者在 AI 辅助下,仍然保持对音乐作品的控制权与表达意图。

你的想法 —— 旋律、情绪、画面 —— 都是真实的创作素材。 但它们在变成作品之前,往往还只是一种「感知」。 我们提供专业的各种 AI 音乐工具:音乐理解、音乐生成、AI 音乐检测、Prompt 提示词打分等。 Noema Lab 不是「AI 音乐一键生成」的平台。 我们专注于这个最关键的环节:帮你把模糊的感知,转化为 AI 能理解的精准指令。
ListenLeap

ListenLeap

通过播客提升英语听力的在线学习平台。

ListenLeap: 用播客重塑你的英语学习体验,从“听懂”到“脱口而出”只需一步! 为什么选择ListenLeap? “碎片时间学英语”从未如此高效! 【学生党】雅思听力8分的秘密武器,跟读+精听,双管齐下。 【职场人】商务会议、邮件报告、行业术语,用播客助力职业晋升之路。 【宝妈&儿童】睡前故事、趣味儿歌,让孩子在“沉浸式英语环境”中自然学会地道发音。 【自律达人】通勤、健身、做饭……随时随地“磨耳朵”,杜绝时间浪费与无效努力。 核心功能:科学设计,直击学习痛点 资源为王:你的专属英语播音站 【10,000+全球精选播客资源】覆盖新闻、商务、文化、考试、亲子、生活、历史等20+垂直领域,BBC、TED、NPR、AEE等知名播客每日同步更新,iTunes、Spotify热门播客资源全面收录。 【智能分类+人工精选】可靠的难度智能评分系统、广泛的应用覆盖场景,精准筛选,匹配你的学习目标。 【自定义你的播客宇宙】精选列表不够?支持自选播客,覆盖全网资源,无论是小众频道还是热门节目,一键收藏,打造你的专属学习库! 播放黑科技:从“被动听”到“主动学” 【播放联动】 · 双语对照:中英字幕配合无痛听懂播客,长按生词即时翻译,附带解析+发音示范; · AI智能字幕:调用当下最先进的AI大语言模型,提供通顺流畅的翻译文本,结合后台人工审核校对,实现丝滑双语切换; · 盲听模式:一键遮挡字幕,专注听力提升; · 单词提示:高亮标注重点词,自选雅思、托福等难度; · 单句循环:反复精听难句,彻底攻克“连读弱读”。 【学习进度记忆】断点续播+跨设备同步,通勤听一半?回家用网页版继续! 【倍速播放】0.5x慢速拆解复杂对话,2.0x快速适应母语者语速。 AI教练全程陪练:比家教更懂你 【跟读评分系统】AI即时评分并实时分析发音准确度、流利度、语调。 【智能AI讲解】即时划词,AI讲解全覆盖,不再受教材资料提供的知识点限制。 【深度追问功能】想知道更多?在AI讲解下继续追问,从语法结构到文化背景,打破砂锅问到底! 【智能笔记】高亮重点内容,一键生成详细的笔记卡片,支持保存AI讲解并同步至网页端整理。 资料自由:学练一体,效果翻倍 【离线音频】支持缓存播客音频,断网环境也能继续学习。 【文稿下载】导出PDF字幕稿至本地,可打印纸质版,随时随地阅览跟读。 【独家资料包】经典播客配备配套录音稿对照与知识讲解练习PDF,助力高效练习。 成长可视化:坚持更容易 【学习记录】每日英语听力记录,打卡解锁图表,累计时长生成学习曲线图,成就感拉满。 【多端同步】手机记录碎片学习,网页版大屏深度复习,进度无缝衔接。 ListenLeap网页版:多端英语学习中枢 【大屏沉浸式学习】更大的屏幕,更清晰的界面,更方便的操作,高清字幕+多窗口笔记,适合精听训练、资料整理。 【跨设备无缝切换】手机听过的播客,电脑端继续做练习,学习永不中断。 立即体验:listenleap.com
RapFlow AI

RapFlow AI

输入歌词或描述创作你的专属说唱。

灵韵音乐是一款基于 AI 大模型与音乐生成技术打造的智能音乐创作平台,面向 普通用户、内容创作者及音乐爱好者,让“不会写歌的人,也能轻松创作完整作品”。 从一句灵感开始,到完整歌曲生成,只需几步。 🌟 产品定位 低门槛 · 高效率 · 可商业化的 AI 音乐创作工具 不需要专业乐理 不需要作词作曲经验 不需要音乐制作软件 人人都能成为“音乐创作者”。 🚀 核心功能亮点 🎵 1. AI 智能歌词创作 支持 主题 / 风格 / 语言 / 情绪 多维度定制 自动生成结构完整、押韵自然的专业歌词 适合流行、民谣、电子、说唱等多种风格 一次生成,多次优化,灵感不断 示例: “写一首关于友情的流行歌曲,温暖治愈风格” 🎶 2. 歌词一键生成歌曲 基于 Suno API,将歌词直接转化为完整歌曲 自动生成旋律、编曲和演唱 输出可播放音频,真正“听得见”的作品 支持歌曲生成状态查询,稳定可靠 👤 3. 多端用户体系 Web 端完整功能支持 微信小程序快速登录 用户数据统一管理,作品云端保存 支持昵称、头像等个性化信息 💎 4. 积分系统(商业化基础) 注册即送 100 积分 生成歌词 / 歌曲按次消耗 支持积分流水记录,规则清晰透明 为后续 充值 / 会员 / 套餐 扩展预留空间 ❤️ 5. 作品管理与收藏 查看「我的歌词」「我的歌曲」 歌曲收藏功能,打造个人音乐库 支持播放次数统计,增强创作成就感 🎯 典型使用场景 🎤 内容创作者 / 自媒体 B 站、抖音、快手原创背景音乐 视频配乐、主题曲快速生成 提升内容独特性,避免版权风险 🎮 游戏 / 应用开发者 游戏背景音乐、角色主题曲 剧情配乐快速生成 降低外包作曲成本 🎁 情感 & 社交场景 定制生日歌、纪念日歌曲 情侣 / 友情 / 家庭主题音乐 让情感表达更有“声音温度” 🎧 音乐爱好者 / 初学者 不懂乐理也能创作完整歌曲 灵感验证工具,快速试听效果 辅助专业音乐人进行创作尝试 ❓ 常见问题 FAQ Q1:生成的歌曲可以商用吗? 取决于所使用的 AI 模型和音乐生成服务的授权协议。平台建议用户在商业使用前确认相关版权条款。 Q2:不会写提示词也能用吗? 可以。系统支持简单自然语言描述,例如: “写一首失恋但不悲伤的歌” Q3:生成失败会扣积分吗? 不会。只有在生成成功后才会扣除对应积分,失败任务可重新尝试。 Q4:可以多语言生成吗? 支持中文、英文等多语言歌词生成,具体取决于模型配置。 Q5:后续会支持哪些功能? 歌曲风格更细分 AI 翻唱 / 改编 歌词二次润色 积分充值与会员体系 作品分享与社区 📈 适合的产品发展方向 AI 音乐 SaaS 平台 小程序 + Web 双端变现 内容创作工具型产品 创作者经济 / AIGC 赛道
YouNavi

YouNavi

专注于对话分析与洞察场景的 Agent 产品。

YouNavi 是一个专注于对话分析场景的 Agent 产品,通过一键整合高密度对话上下文(会议、访谈、独白、播客等,支持本地录音,导入主流会议软件、主流录音硬件等),采用 Agentic 架构进行长程任务推理分析,发掘言外之意、锁定关键信息。 为创业者、OPC、管理者、投资人、咨询顾问、销售顾问、HR、教师、采访者等高频沟通人群提供录音转写、洞察分析、深度研究与决策建议,并完成一切衍生的案头工作成果,让每一场会议、访谈、沟通都沉淀为可执行的洞察。 【产品功能】 全渠道上下文无感采集: 会议软件同步:自动同步腾讯会议、飞书、钉钉等在线会议平台的会议内容,,打通分散的对话上下文。 录音硬件接入:支持 Plaud、安克飞书录音豆、钉钉A1录音卡、TicNote、得到GetSeed录音卡、讯飞录音笔等智能录音硬件的数据同步,以及手机录音和电脑本地文件夹的自动监测与上传。 常见录音工具:支持通义听悟、千问APP录音同步,iPhone、AppleWatch录音则可以通过iCloud同步至Mac后,通过“苹果语音备忘录”同步至YouNavi。 系统录音:支持 Mac/PC 客户端桌面后台录音功能,能够不限时长记录麦克风和系统音频,并免费转写文本。 本地文件夹同步:支持按照层级结构同步任意一个/多个本地文件夹的全部文件,实现跟您本地文件系统的无感互通。 CLI调用:支持飞书、钉钉、企业微信、腾讯会议等的官方CLI调用,实现对应平台日历日程、文档、表格、聊天、群聊等信息的接入。 未来支持更多的信息同步:更多在线文档、IM、邮箱、播客、直播等。 数据本地存储确保隐私安全:数据同步过程、处理过程和存储都在本地执行,确保私密对话的安全性。 Agentic 索引与检索: 采用 Agent 驱动的方式,在海量私域上下文(会议录音、文档等)中精准定位对当前问题最有帮助的背景信息,并结合公网信息与专家库,在准确度和分析深度上远超 RAG 方案。 复杂长周期上下文的深度分析: 上下文串联:不同于市面上常见的 “单次会议总结”,YouNavi 能跨越时间维度(如数月),将多次讨论、随笔和文件关联起来,分析某个项目或想法的演进过程,识别长期对话中呈现的趋势、矛盾点以及思维模式的变化。 水下信息挖掘与洞察:挖掘会议或访谈中各方未达成一致的隐性冲突或独特观点,分析参与者的情绪波动曲线,识别沟通中的认知盲区和思维惯性,提供类似 “军师” 视角的深度解读。 支持特定场景(如早期投资分析、创业者支持、咨询场景、战略分析场景、用户访谈与产品分析、候选人分析、销售商机分析等):挖掘投资人质疑点、战略决策演变逻辑、候选人前后矛盾等能够直接辅助关键决策的深层信息。 交付与长期记忆: 结构化输出:生成会议复盘、工作周报、用户调研报告、咨询建议报告、共识地图、IC 投决会 Memo 等专业文档。 记录和学习用户决策习惯的长期记忆: 主动学习用户的判断偏好,使未来的建议更加贴合用户。 支持专业输出Skill:支持一键导入已有Skill,并支持各类知识工作场景的专业内置Skill,您也可以直接定制您需要的skill,将沟通录音一键变成符合您个性化需求的任何形态内容,如洞察报告、PPT、网页、图片等等。 移动端支持使用微信/飞书扫码绑定、通过微信/飞书/钉钉 IM来跟Navi对话 【典型场景】 会议、沟通、播客内容的个性化总结、备忘 项目路演、企业咨询、合作沟通、用户访谈、面试、电销等场景的录音分析 结合个人记忆,复盘长周期的项目、梳理人脉、识别非共识与潜台词、洞察心底之问与关键之人等等 YouNavi 希望最终能将每位用户的个人对话等上下文从 ” 模糊印象 “转化为可检索、可分析的工作记忆与长期个人认知资产。