首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 使用这个工具后,我将 RAG 的准确性和召回率都提高了两倍!
· 硬核解读Stable Diffusion(系列三)
· 大模型狂飙两年后,“六小龙”开始做减法
· ChatGPT写论文指令全集
· 微软研究团队:Sora核心技术及未来机会研究报告-中英对照版
· AI绘画:InstantID Win11本地安装记录!
· 这个数字人开源项目太牛了,非常全面的项目解决方案(含源码)
· 你要牢记的四个常用AI提示词框架:ICIO、CRISPE、BROKE、RASCEF,有助于获取更加稳定和高质量的内容
· 通俗解读大模型微调(Fine Tuning)
· RAG检索增强技术在知识库智能检索场景下的应用实践
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
动作识别模型有哪些
网络结构: 因为
视
频
可以分为空间和时间两个部分。
动作识别
模型
工具
4K star!录屏好帮手,超酷的实时按键显示工具
今天我就帮你找到了一个好用的工具,它开源免费效果还超酷,帮你完成实时可
视
化键盘按键的效果,它就是:Keyviz。
Keyviz
录频
Python
Whisper对于中文语
音
识别与转写中文文本优化的实践(Python3.10)
阿里的FunAsr对Whisper中文领域的转写能力造成了一定的挑战,但实际上,Whisper的使用者完全可以针对中文的语
音
做一些优化的措施,换句话说,Whisper的“默认”形态可能在中文领域斗不过
Whisper
语音优化
换脸
除了深度换脸、模拟配
音
,还能口型匹配的AI软件出现了
Captions:利用 AI 轻松实现
视
频
翻译本地化 Captions以制作AI生成的字幕、语
音
纠正以及在后期制作中纠正
视
频
创作者眼球位置的技术而闻名。
AI
剪映克隆声
音
功能详解:剪映上线5秒“AI克隆
音
色”,一堆AI公司又要进入慢性死亡了...
剪映的
音
色克隆,只能克隆自己声
音
的,而不能像一些现在市面上的开源项目一样,上传一段
音
频
后,就能把那个人的声
音
克隆出来。
剪映
声音克隆
人工智能
胎教级SO-VITS-SVC使用教程:人工智能生成歌曲
sd生成的话筒xswl 原始歌曲处理(人声和伴奏分离) 如果想要使用孙燕姿的模型进行二次创作,首先需要一段已经准备好的声
音
范本,然后使用模型把原来的
音
色换成孙燕姿模型训练好的
音
色即可 这里我们五月天的
音乐
大模型
从零开始学习大模型-第二章-大模型学习路线
随着技术的进步,大模型如OpenAI的GPT-4和Sora、Google的BERT和Gemini等已经展现出了惊人的能力-从理解和生成自然语言到创造逼真的图像及
视
频
。
大模型
学习
大模型
OCR终结了?旷
视
提出可以文档级OCR的多模态大模型框架Vary,支持中英文,已开源!
背后原理 目前的多模态大模型几乎都是用 CLIP 作为 Vision Encoder 或者说
视
觉词表。
OCR
手写
文字识别
DeepMusic发布“和弦派”2.0:重塑AI
音
乐创作范式,赋予创作者全方位掌控
4月29日,国内领先的人工智能
音
乐服务商DeepMusic,发布了自主研发的AI
音
乐工作站——“和弦派”2.0正式版。
和弦派
DeepMusic
音乐创作
开源
OpenAI 开源语
音
识别 Whisper 的使用体验怎么样?
关于Buzz Buzz 是一款基于 OpenAI 开源 Whisper 自动语
音
识别模型的软件工具,能够将
音
频
或
视
频
中的语
音
自动识别为带有时间戳的文本字幕。
生成式AI
开源
网易有道强力开源中英双语语
音
克隆
其中的
音
素(phonemes)可以这样得到: python frontend.py data/my_text.txt > data/my_text_for_tts.txt. 5.
语音
开源
开源
从 GPT-4o 到 LiveKit:实时语
音
交互的开源实现
今天我们来聊聊OpenAI 发布会提到的实时对话语
音
技术。
GPT-4o
语音交互
阿里
阿里Outfit Anyone实现真人百变换装
之前我分享了阿里通义千问APP推出的 "全民舞王" ,只要一张照片就能生成一段舞蹈
视
频
这几天相信有很多小伙伴都有在社交媒体和朋友圈刷到过这种 其背后就是用的 Animate Anyone 算法
Outfit
Anyone
阿里
大模型
全量免费的EMO模型上架通义APP,外媒称之为Sora之后最受期待的大模型之一
只需要一张人物肖像照片和一段任意时长的
音
频
,EMO就可以让照片中的人物按照
音
频
内容“张嘴”唱歌、说话,且口型基本保持一致,实现自然的面部表情和头部姿态。
EMO
阿里
全民演唱
阿里
阿里最近推出AI项目的动作太过
频
繁,脑子跟不上了,事出反常必有妖,盘点一下
上传一段
视
频
,AI 自动识别
视
频
中的运动主体人物,并一键替换成有趣的 3D 角色模型,生成与众不同的 AI
视
频
。
阿里
大模型
<
...
6
7
8
9
10
11
12
13
14
15
...
>
1
2
4
5
6
7
8
9
100