首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 使用这个工具后,我将 RAG 的准确性和召回率都提高了两倍!
· 硬核解读Stable Diffusion(系列三)
· 大模型狂飙两年后,“六小龙”开始做减法
· ChatGPT写论文指令全集
· 微软研究团队:Sora核心技术及未来机会研究报告-中英对照版
· AI绘画:InstantID Win11本地安装记录!
· 这个数字人开源项目太牛了,非常全面的项目解决方案(含源码)
· 你要牢记的四个常用AI提示词框架:ICIO、CRISPE、BROKE、RASCEF,有助于获取更加稳定和高质量的内容
· 通俗解读大模型微调(Fine Tuning)
· RAG检索增强技术在知识库智能检索场景下的应用实践
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
语
音
克隆又又又又又升级了
,时隔几个月Meta又推出了最新的
语
音
生
成
技术,不仅能可能声
音
,还能通过对声
音
的描述来
生
成
独特的
音
色,同时还能通过描述来
生
成
各种各样的
音
效,甚至能通过文字描述来编辑声
音
,整体来说,这项技术几乎囊括了现在人们对
语
音
生
成
技术的所有的需求
Meta
语音生成
懒人福
音
!用AI
生
成
会议纪要,让你的工作更高效!
**效率提升**:AI可以实时转录会议内容,并在会议结束后迅速
生
成
纪要,大幅提高工作效率。
会议纪要
AI工具
工具
AI文本转
语
音
工具(TTS):MeloTTS
今天给大家介绍一个效果不错的开源文本转
语
音
工具:MeloTTS MeloTTS是一个可以把文字转换
成
声
音
的工具,它支持英
语
、西班牙
语
、法
语
、中文、日
语
和韩
语
等多种
语
言。
MeloTTS
语音工具
大模型
“实时”
语
音
翻译!AI
语
音
具有“情绪”!最强开源AI大模型来了
你想把一段
语
音
转
成
文字,或者把一段文字转
成
语
音
,但是你不知道怎么操作!
大模型
开源模型
语音
开源
通过声
音
生
成
逼真的全身形象?!Meta开源AI工具:audio2photoreal
audio2photoreal的核心技术是基于深度学习的图像
生
成
模型,它可以从
音
频中提取
语
音
特征,然后用这些特征来控制人脸和身体的运动。
audio2photoreal
开源工具
开源
十大开源
语
音
识别项目
)是 Meta 开源的一款全新的 AI
语
言模型,可以识别 4000 多种口头
语
言并
生
成
1100 多种
语
音
(文本到
语
音
),可谓是“
语
音
巴别塔”。
语音识别
开源项目
一文读懂GPT-1:
生
成
式预训练如何提升
语
言理解
为了深入探索大
语
言模型的发展历程,我们精心挑选了一系列经典论文进行分享,希望能与大家共同学习和理解大
语
言模型背后的技术。
GPT
RAG
RAG——使用检索增强
生
成
构建特定行业的大型
语
言模型
下面是检索增强技术论文的摘要部分,从中我们可以看到,检索增强技术是用于知识密集型nlp任务处理文本
生
成
时,先通过信息检索技术来增强信息输入来使
生
成
的内容更具体、更多样化和更真实的技术。
大模型
实时
语
音
克隆
项目简介 这份内容介绍了实时
语
音
克隆的技术实现,作者通过将说话者验证技术转移到多说话人文本到
语
音
合
成
(SV2TTS)来实现
语
音
克隆。
语音
克隆
开源
语
音
、视频转文字神器:开源whisper介绍
OpenAI的Whisper是一种基于深度学习的
语
音
识别模型,它是一种通用的
语
音
识别模型,可以用于
语
音
识别、
语
音
翻译和
语
言识别等任务。
人工智能
大模型
wisper
OpenAI
OpenAI大动作:Whisper large-v3重塑
语
音
识别技术
这款最新的自动
语
音
识别模型不仅在多
语
言识别方面取得了显著进步,而且还将很快在OpenAI的API中得到支持。
Whisper
语音识别
CodeGeeX:Tab一下,代码自动
生
成
为此,我们研发了一款新型的大规模多
语
言代码
生
成
模型 CodeGeeX。
大模型
Insanely Fast Whisper:超快的Whisper
语
音
识别脚本
项目简介 这篇内容介绍了OpenAI的Whisper Large v2
语
音
转录模型的超快速能力。
音频
Whisper
阿里
阿里&字节发表VividTalk,只需单张照片即可根据
音
频
生
成
栩栩如
生
的人物说话头像视频
只需提供一张人物的静态照片和一段
语
音
录
音
,VividTalk即可制作出一个看起来像是实际说话的人物的视频。
VividTalk
视频
开源
开源
语
音
大
语
言模型来了!阿里基于Qwen-Chat提出Qwen-Audio!
音
频编码器由640M个参数组
成
。
大模型
语音
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100