首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 盘点数据安全合规方向的热门证书【快来了解一下】
· Stable Diffusion 30种采样器全解!
· 大模型评测新思路:弱智吧精华问题大全
· 超越RAG:揭秘IAG框架如何引领推理问答系统的创新之路
· OCR的终极解法——传统算法VS多模态大模型
· 国内首个!最火的MoE大模型APP来了,免费下载,人人可玩
· 免配置、免翻墙,Stable Diffusion平替来了!
· 社区供稿|GPT-4 与国产模型,大!横!评!
· 震撼科技界:清华大学与智谱AI联手,引领中文长文智能写作新纪元!
· 爆肝!超详细的胎教级Midjourney使用教程,看这一篇就够!
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
大模型
MaskGCT:登上GitHub趋势榜榜首的TTS开源大模型
01 前言 近日,香港中文大学(深圳)联手趣丸科技推出了新一代大规模声
音
克
隆
TTS模型——MaskGCT。
MaskGCT
声音克隆
开源
F5-TTS:上海交大开源超逼真声
音
克
隆
TTS,告别ElevenLabs,以后就用它了!实测真的很牛
音
频
克
隆
的开源项目很多,但是每次项目里要用的时候,总还是惦记着11labs的api。
F5-TTS
音频克隆
关于AI声
音
生成的一切(
语
音
+
音
乐+嘴型)
其实声
音
生成也有很多革命性的工具,例如高质量的声
音
识别、文字转成人声、人声
克
隆
、
音
乐生成,已经能组成完整工作流了,其中一些工具甚至已经打包好了,只要下载解压就能用!
声音
开源
网易(TTS)EmotiVoice:开源
语
音
合成,支持2000多
音
色
你是否曾经想过,如果你能用一句简单的提示来控制你的
语
音
合成器,那该多方便?
EmotiVoice
语音合成
大模型
“实时”
语
音
翻译!AI
语
音
具有“情绪”!最强开源AI大模型来了
你想把一段
语
音
转成文字,或者把一段文字转成
语
音
,但是你不知道怎么操作!
大模型
开源模型
语音
工具
AI文本转
语
音
工具(TTS):MeloTTS
今天给大家介绍一个效果不错的开源文本转
语
音
工具:MeloTTS MeloTTS是一个可以把文字转换成声
音
的工具,它支持英
语
、西班牙
语
、法
语
、中文、日
语
和韩
语
等多种
语
言。
MeloTTS
语音工具
开源
十大开源
语
音
识别项目
这项技术在多个领域有着广泛的应用,包括但不限于
语
音
助手、
语
音
搜索、自动转写以及
语
音
命令识别。
语音识别
开源项目
开源
语
音
、视频转文字神器:开源whisper介绍
OpenAI的Whisper是一种基于深度学习的
语
音
识别模型,它是一种通用的
语
音
识别模型,可以用于
语
音
识别、
语
音
翻译和
语
言识别等任务。
人工智能
大模型
wisper
Insanely Fast Whisper:超快的Whisper
语
音
识别脚本
项目简介 这篇内容介绍了OpenAI的Whisper Large v2
语
音
转录模型的超快速能力。
音频
Whisper
开源
【
语
音
领域-又双叒更新】阿里开源FunAudioLLM: 2大核心模型、5大亮点功能!效果炸裂!手把手带你理论+实战部署推理!
CosyVoice 特点:包括多
语
言
语
音
生成、零样本学习、跨
语
言
克
隆
和指令遵循。
asr
tts
声音
OpenAI
OpenAI大动作:Whisper large-v3重塑
语
音
识别技术
这款最新的自动
语
音
识别模型不仅在多
语
言识别方面取得了显著进步,而且还将很快在OpenAI的API中得到支持。
Whisper
语音识别
开源
开源
语
音
大
语
言模型来了!阿里基于Qwen-Chat提出Qwen-Audio!
作为一种重要模态,
语
音
提供了超越文本的多样且复杂的信号,如人声中的情感、
语
调和意图,自然声
音
中的火车汽笛、钟声和雷声,以及
音
乐中的旋律。
大模型
语音
开源
从声纹模型到
语
音
合成:
音
频处理 AI 技术前沿 | 开源专题 No.45
;7.2k License: Apache-2.0 ESPnet 是一个端到端的
语
音
处理工具包,涵盖了端到端
语
音
识别、文本转
语
音
、
语
音
翻译、
语
音
增强、说话人分离等功能
AudioCraft
音频
RVC和SVC声
音
模型难找?推荐这个网站
本篇文章介绍:1, 声
音
数据集训练到模型的过程 2 ,SVC和RVC声
音
模型网站推荐 一、声
音
数据集训练到模型的过程 AI声
音
模型训练是通过分析大量
音
频数据来学习声
音
特性,生成与目标声
音
相似的新
音
频
声音克隆
数字人
开源
【开源项目】Flow Matching
语
音
合成
CFM是一种新技术,已被证明可以改进扩散模型,Meta的Voicebox模型将CFM引入
语
音
合成领域,下面是voicebox的一个工作流程图 Matcha-TTS是第一个开源conditional
音视频
Flow
Matching
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100