首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 使用这个工具后,我将 RAG 的准确性和召回率都提高了两倍!
· 硬核解读Stable Diffusion(系列三)
· 大模型狂飙两年后,“六小龙”开始做减法
· ChatGPT写论文指令全集
· 微软研究团队:Sora核心技术及未来机会研究报告-中英对照版
· AI绘画:InstantID Win11本地安装记录!
· 这个数字人开源项目太牛了,非常全面的项目解决方案(含源码)
· 你要牢记的四个常用AI提示词框架:ICIO、CRISPE、BROKE、RASCEF,有助于获取更加稳定和高质量的内容
· 通俗解读大模型微调(Fine Tuning)
· RAG检索增强技术在知识库智能检索场景下的应用实践
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
Stable Diffusion
小白设计师福
音
:Stable Diffusion 16款插件测评,好用不?推荐吗?
#65039;⭐️⭐️ 能做什么:Ultimate SD Upscale 是一款强大的图像超分辨率工具,可用于将低分辨率图像提升到高分辨率、减少噪
声
和模糊
SD
插件
文生图
VividTalk:用一张照片和一段
音
频让人物栩栩如生地说话
最新的突破来自VividTalk项目,这是一个能够将单张照片和一段
音
频结合起来,创造出仿佛真人在说话的视频的技术。
VividTalk
视频
OpenAI
两天star量破千:OpenAI的Whisper被蒸馏后,语
音
识别数倍加速
懂技术的小伙伴也可以寻找其他替代方案,比如语
音
转文字模型 Whisper、文字翻译 GPT、
声
音
克隆 + 生成
音
频 so-vits-svc、生成符合
音
频的嘴型视频 GeneFace++dengdeng。
语音
HeyGen
被高估的Pika,被低估的多模态AI
例如,在医疗领域可以通过结合图像、录
音
和病历文本,提供更准确的诊断和治疗方案;在交通领域,结合图像和传感器数据,带来更智能、更安全的自动驾驶体验;在教育领域,将文本、
声
音
、视频相结合,呈现更具互动性的教育内容
大模型
多模态
Python
Whisper对于中文语
音
识别与转写中文文本优化的实践(Python3.10)
阿里的FunAsr对Whisper中文领域的转写能力造成了一定的挑战,但实际上,Whisper的使用者完全可以针对中文的语
音
做一些优化的措施,换句话说,Whisper的“默认”形态可能在中文领域斗不过
Whisper
语音优化
大模型
大模型RAG检索增强问答如何评估:噪
声
、拒答、反事实、信息整合四大能力评测任务探索
为此,噪
声
鲁棒性测试根据所需的噪
声
比,将外部文档包含一定数量噪
声
文档的实例包含在内。
大模型
RAG检索增强
数字人
一款构建AI数字人项目开源了!自动实现
音
视频同步!
本周GitHub项目圈选: 主要包含
音
视频同步、多代理框架、3D对象模型、适用于开发者的演示文档构建工具、网页程序打包、自构建CRUD应用等热点项目。
AI数字人
音视频同步
Stable Diffusion
stable diffusion最全18种controlnet模型,详细教程讲解。
等到年底的时候做一个最全面的视频和文字讲解,现在还是在等等,目前AI领域热度确实是在持续降温,但是呢,深入了解AI的人都知道,AI的发展不是想人一样需要很长时间的积累,有时候可能就是一个算法的突破,就能应用到文字,图像
声
音
等
Stable
Diffusion
文生图
controlnet
换脸
除了深度换脸、模拟配
音
,还能口型匹配的AI软件出现了
DeepMedia公司的创始人Rijul Gupta表示:“我们基本上已经完美地实现了这项新技术,任何人都可以克隆任何人的
声
音
,并通过5秒钟的
音
频参考,让它用不同的语言说话。”
AI
人工智能
胎教级SO-VITS-SVC使用教程:人工智能生成歌曲
sd生成的话筒xswl 原始歌曲处理(人
声
和伴奏分离) 如果想要使用孙燕姿的模型进行二次创作,首先需要一段已经准备好的
声
音
范本,然后使用模型把原来的
音
色换成孙燕姿模型训练好的
音
色即可 这里我们五月天的
音乐
DeepMusic发布“和弦派”2.0:重塑AI
音
乐创作范式,赋予创作者全方位掌控
4月29日,国内领先的人工智能
音
乐服务商DeepMusic,发布了自主研发的AI
音
乐工作站——“和弦派”2.0正式版。
和弦派
DeepMusic
音乐创作
开源
OpenAI 开源语
音
识别 Whisper 的使用体验怎么样?
关于Buzz Buzz 是一款基于 OpenAI 开源 Whisper 自动语
音
识别模型的软件工具,能够将
音
频或视频中的语
音
自动识别为带有时间戳的文本字幕。
生成式AI
开源
网易有道强力开源中英双语语
音
克隆
其中的
音
素(phonemes)可以这样得到: python frontend.py data/my_text.txt > data/my_text_for_tts.txt. 5.
语音
开源
开源
从 GPT-4o 到 LiveKit:实时语
音
交互的开源实现
今天我们来聊聊OpenAI 发布会提到的实时对话语
音
技术。
GPT-4o
语音交互
开源
生成式AI领域拓展!MetaAI开源AudioCraft:一个支持AudioGen、MusicGen等模型的
音
频生成开发框架
音
乐可能是最具挑战性的
音
频类型,因为它由局部和长程模式组成,从一系列
音
符到具有多种乐器的全局
音
乐结构。
开源模型
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100