首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 第一性原理以及第一性原理是怎么帮马斯克成为首富的
· 爆火的“哄哄模拟器”,它是如何炼成的?Prompt泄漏了
· 从第一性原理看大模型Agent技术
· ComfyUI官方使用手册【官网直译+关键补充】
· 芯片拼接技术:英伟达新核弹,站在苹果的肩膀上
· AI声音克隆 | 最全最简教程(权威版)
· Github上Star数最多的大模型应用基础服务:Dify 深度解读
· 生成式AI与大语言模型的区别
· 自己电脑上跑大语言模型(LLM)要多少内存?
· 深入解析 Mistral AI 的 Mixtral 8x7B 开源MoE大模型
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
视频
用AI做郭德纲说英文相
声
的爆款视频(详细教程)
郭德纲用英文说相
声
的短视频火爆全网,单条视频点赞破9.7万,转发量更是高达11.8万,AI的内容形式层出不穷,不断地出爆款,其实这个两周前有出过教程--用这个AI,把视频翻译成30+种语言,丝滑程度,随时能把生意做到全世界
视频
翻译
语言
实时语
音
克隆
项目简介 这份内容介绍了实时语
音
克隆的技术实现,作者通过将说话者验证技术转移到多说话人文本到语
音
合成(SV2TTS)来实现语
音
克隆。
语音
克隆
字正腔圆,万国同
音
,coqui-ai TTS跨语种语
音
克隆,钢铁侠讲16国语言
按照固有的思维方式,如果想要语
音
克隆首先得有克隆对象具体的语言语
音
样本,换句话说,克隆对象必须说过某一种语言的话才行,但现在,coqui-ai TTS V2.0版本做到了,真正的跨语种无需训练的语
音
克隆技术
coqui-ai
TTS
语音
Insanely Fast Whisper:超快的Whisper语
音
识别脚本
项目简介 这篇内容介绍了OpenAI的Whisper Large v2语
音
转录模型的超快速能力。
音频
Whisper
国内厂商语
音
识别与Whisper评测:现状与概况对比
语
音
识别技术不仅可以应用于智能助手、语
音
控制、自动化客服等领域,还有望为残障人士提供更便捷的沟通工具。
语音识别
Faster-Whisper
开源
语
音
、视频转文字神器:开源whisper介绍
OpenAI的Whisper是一种基于深度学习的语
音
识别模型,它是一种通用的语
音
识别模型,可以用于语
音
识别、语
音
翻译和语言识别等任务。
人工智能
大模型
wisper
AI
音
乐热潮下,“神曲工作室”率先失业
都说今年五一档最难抢票,但这个票,许多乐迷指的是演唱会门票:凤凰传奇、邓紫棋、陈奕迅……越是
声
线特殊、现场力爆棚、感染力强,越是一票难求…… 与此同时,很多
音
乐人却高兴不起来,suno、天工、ACE
音乐
音频
OpenAI
OpenAI大动作:Whisper large-v3重塑语
音
识别技术
这款最新的自动语
音
识别模型不仅在多语言识别方面取得了显著进步,而且还将很快在OpenAI的API中得到支持。
Whisper
语音识别
教程
Suno
音
乐新手指南(手把手完整版教程)
在标记歌曲部分时,尝试一个简短的风格描述和一个名词——应该被听到的乐器或
声
音
。
suno
歌曲
教程
视频
Prompt | 抖
音
视频脚本
复制脚本并访问 https://beta.elevenlabs.io/speech-synthesis 以生成文本转语
音
。
prompt
「语
音
转换新速度」— 探秘Whisper JAX的70倍速提升
在AI的众多分支中,语
音
识别技术的突破性进展尤为引人瞩目。
Whisper
语音识别
教程
用so-vits-svc-4.1进行
音
色转换的极简教程!
其实歌
声
转换不仅仅适用于歌
声
,普通讲话也可以,只是歌唱的
音
调基本能覆盖到低、中、高全域
声
音
类型,而正常说话可能无法做到全域覆盖,但是如果在录制
声
音
的时候能够做到覆盖多种
音
调类型,也可以实现
声
音
转换。
so-vits-svc
音色转换
教程
OpenAI
基于 OpenAI Whisper 模型的实时语
音
转文字工具
· WhisperLive 是一款专注于
音
频处理和创作的开源软件,使用 OpenAI Whisper 模型将语
音
输入转换为文本输出,可以用于转录麦克风的实时
音
频输入和预先录制的
音
频文件,为艺术家和
音
乐制作人提供了一个强大的平台
WhisperLive
音频
开源软件
RAG
RAG 2.0来了,它能成为生产落地的福
音
吗?
RAG作为当前最流行、相对成熟的的LLM应用架构,受到了开发者的广泛关注,相关围绕RAG优化的技术层出不穷,但依旧难逃达不到生产应用要求的尴尬。
RAG
大模型
解读wav2lip:探究语
音
驱动唇部动作的技术原理!
具体来说,wav2lip的训练流程如下:首先,提取
音
频特征,将
音
频特征与人脸图像进行配对,形成一个
音
频-图像对,然后训练专家
音
频和口型同步判别器。
wav2lip
语音
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100