首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 最强国产开源多模态大模型MiniCPM-V:可识别图片、视频,还可在端侧部署
· Kimi+扣子Coze,我零门槛制作了一个好用的智能体Agent | 智能体开发
· 13.5K Star ! Fish Speech Windows本地搭建,能否达到官方的级别?强烈推荐
· 【Stable Diffusion操作升级】Stable Diffusion 常用模型下载与说明
· 包阅AI-免费AI阅读翻译神器!
· 字节跳动最强AI工具 “豆包” ,近1000款应用!一句话自动生成图文,堪比ChatGPT?
· 大模型评测新思路:弱智吧精华问题大全
· 精通结构化提示词:如何精确操控指令的作用域与优先级
· 小白设计师福音:Stable Diffusion 16款插件测评,好用不?推荐吗?
· LangChain手册(Python版)11模块:提示模板
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
RAG
谈谈RAG存在的一些问题和避免方式
那么我们的问题是:谁知道埃
隆
·马斯
克
?
RAG
大模型
阿里
阿里最近推出AI项目的动作太过
频
繁,脑子跟不上了,事出反常必有妖,盘点一下
一个静态图片转视
频
的项目。
阿里
大模型
RAG
LangChain - RAG:线上系统多文档要
频
繁更新,每次都要重新花钱做一次 embedding,老板不批预算,批我...
做为大模型落地的两大方向之一,RAG 有个很大的坑等着我们,设想一下,需要定时更新一匹 PDF 文件到 RAG chatbot 里面去,总量不算多也不算少大约 15,000~ 的样子,开发环境里面根本没考虑过重新 re-index、re-embedding 的事,事到临头要更新了才想起来要重新做 embedding 不仅耗时更要耗钱,结果老板不出所料的不批预算,批我解气... 怎么破?
大模型
ComfyUI
无需编码,轻松提升图像品质:探索ComfyUI的图像增强功能
手动安装(Windows、Linux): 1.使用Git
克
隆
ComfyUI存储库。
文生图
开源
腾讯悄悄开源混元版「Sora」,这就是开源领域的No.1。
腾讯也活成了,马斯
克
心中,那个OpenAI的模样。
sora
视频生成
Google
AI“同声传译”新进展!Google发布,无监督,语
音
识别:Translatotron 3!
语
音
识别(ASR)是指将人类的语
音
转换为文本的技术,然而,目前的语
音
识别技术还面临着一些挑战,其中最大的一个就是如何支持更多的语言。
Translatotron
语音识别
一文彻底搞懂多模态 - 多模态推理
这两种模态的信息可以是图片和文本、视
频
和语
音
等。
多模态推理
大模型
ComfyUI
ComfyUI安装及生成第一张图
/install.sh)" 2、安装一些需要的包 打开一个新终端并运行以下命令 brew install cmake protobuf rust python@3.10 git wget 3、
克
隆
ComfyUI
文生图
Stable Diffusion
AnimateDiff:一篇文章教你学会用Stable Diffusion制作GIF动图
这是一个AnimateDiff介绍教程,这个工具可让您使用Stable Diffusion创建令人惊叹的 GIF 动画,这是目前为止最好的文本生成视
频
(Text-to-video)人工智能工具之一。
AnimateDiff
视频
训练
Sora
通俗易懂地解释OpenAI Sora视
频
生成的特点有哪些?它与此前的Runway Gen2、Pika有什么区别?以及缺点是什么?
Sora生成的视
频
与此前其它平台生成的视
频
到底有哪些区别?
sora
视频生成
语
音
识别的未来已来:深入了解faster-whisper的突破性进展
这种实现不仅提高了语
音
识别的速度,还优化了内存使用效率。
语音识别
Faster-Whisper
大模型
Westlake - Omni:西湖心辰推出的全球首个开源的中文情感端 - 端语
音
交互大模型
例如,CNNs可以从语
音
频
谱图中提取出关键的声学特征,而Transformer模型则可以对长文本进行深入理解,从而实现准确的情感分析和语
音
合成。
Westlake
-
Omni
语音
低调的PDF,为什么成了数字文档“永远的神”?
尽管PostScript的页面描述效率已经非常高,但还是远远超出当时个人电脑的硬件能力范围,因此沃诺
克
和格施
克
最初将PostScript的服务对象定位在大型印刷工作站,直到乔布斯适时的出现
工作
详解 Diffusion (扩散) 模型
目前,它们主要用于图像和
音
频
生成。
Diffusion
开源模型
Stable Diffusion
stable diffusion最全18种controlnet模型,详细教程讲解。
目前AIgc领域正在持续关注,等到年底的时候做一个最全面的视
频
和文字讲解,现在还是在等等,目前AI领域热度确实是在持续降温,但是呢,深入了解AI的人都知道,AI的发展不是想人一样需要很长时间的积累,有时候可能就是一个算法的突破
Stable
Diffusion
文生图
controlnet
<
...
7
8
9
10
11
12
13
14
15
16
...
>
1
2
4
5
6
7
8
9
100