文章列表-AI魔法学院

文章列表

MaskGCT：登上GitHub趋势榜榜首的TTS开源大模型

01 前言近日，香港中文大学（深圳）联手趣丸科技推出了新一代大规模声音克隆TTS模型——MaskGCT。

MaskGCT 声音克隆

TTS它又来了！OpenVoice：一款借鉴于TTS实现的强大的AI语音克隆工具！

各种AI工具也层出不穷，其中语音克隆技术也是尤为引人瞩目的产品之一。

tts 文本转语音

关于AI声音生成的一切（语音+音乐+嘴型）

其实声音生成也有很多革命性的工具，例如高质量的声音识别、文字转成人声、人声克隆、音乐生成，已经能组成完整工作流了，其中一些工具甚至已经打包好了，只要下载解压就能用！

声音

FFmpeg之父新作——音频压缩工具 TSAC

前两天FFmpeg作者Fabrice Bellard在个人主页发布了一款音频压缩工具TSAC。

TSAC 音频工具

【TTS语音克隆开源最强王者】5款爆火开源模型(Fish、F5、GPT、CosyVoice、MaskGCT)效果对比，等你来评!

哪款语音克隆模型最好，等你来评价~本文案例效果仅供参考！

语音克隆开源模型

Prompt | 抖音视频脚本

这个prompt可帮助您为 TikTok 视频生成极具吸引力的脚本。

prompt

语音、视频转文字神器：开源whisper介绍

OpenAI的Whisper是一种基于深度学习的语音识别模型，它是一种通用的语音识别模型，可以用于语音识别、语音翻译和语言识别等任务。

人工智能大模型 wisper

从声纹模型到语音合成：音频处理 AI 技术前沿 | 开源专题 No.45

· EnCodec：一种高保真度神经音频编解码器。

AudioCraft 音频

VividTalk：用一张照片和一段音频让人物栩栩如生地说话

最新的突破来自VividTalk项目，这是一个能够将单张照片和一段音频结合起来，创造出仿佛真人在说话的视频的技术。

VividTalk 视频

RVC和SVC声音模型难找？推荐这个网站

本篇文章介绍：1，声音数据集训练到模型的过程 2 ，SVC和RVC声音模型网站推荐一、声音数据集训练到模型的过程 AI声音模型训练是通过分析大量音频数据来学习声音特性，生成与目标声音相似的新音频

声音克隆数字人

AI视频新技能！这套流程教你打造视频人物和声音完美同步！

这个视频中人物的身体姿势、头发、头部姿势、面部表情都在发生运动，看了上面的视频后，群里一位朋友问如何实现视频中的人物口型与音频的完美同步，以及当前可行的方法。

AI视频

【语音领域-又双叒更新】阿里开源FunAudioLLM: 2大核心模型、5大亮点功能！效果炸裂！手把手带你理论+实战部署推理!

CosyVoice 特点:包括多语言语音生成、零样本学习、跨语言克隆和指令遵循。

asr tts 声音

GPT-4o实时语音方案提供商Livekit开源voice agent：轻松处理音视频流

轻松访问 LiveKit WebRTC 会话并处理或生成音频、视频和数据流。

voice agent 开源音视频

一款构建AI数字人项目开源了！自动实现音视频同步！

本周GitHub项目圈选: 主要包含音视频同步、多代理框架、3D对象模型、适用于开发者的演示文档构建工具、网页程序打包、自构建CRUD应用等热点项目。

AI数字人音视频同步

whisper-live：OpenAI Whisper模型的近实时实现

它可用于转录来自麦克风的实时音频输入和预先录制的音频文件。

OpenAI Whisper 大模型

<123 4 5 6 7 8 9 10 ...>

汇聚AI资讯，网罗AI文档，详解AI工具！

关于我们用户协议隐私条款商务合作：skillupvip

© 2023-2025 AI魔法学院

京ICP备20027199号-1