首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 使用这个工具后,我将 RAG 的准确性和召回率都提高了两倍!
· 硬核解读Stable Diffusion(系列三)
· 大模型狂飙两年后,“六小龙”开始做减法
· ChatGPT写论文指令全集
· 微软研究团队:Sora核心技术及未来机会研究报告-中英对照版
· AI绘画:InstantID Win11本地安装记录!
· 这个数字人开源项目太牛了,非常全面的项目解决方案(含源码)
· 你要牢记的四个常用AI提示词框架:ICIO、CRISPE、BROKE、RASCEF,有助于获取更加稳定和高质量的内容
· 通俗解读大模型微调(Fine Tuning)
· RAG检索增强技术在知识库智能检索场景下的应用实践
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
工具
AI文本转
语
音
工具(TTS):MeloTTS
今天给大家介绍一个效果不错的开源文本转
语
音
工具:MeloTTS MeloTTS是一个可以把文字转换成声
音
的工具,它支持英
语
、西班牙
语
、法
语
、中文、日
语
和韩
语
等多种
语
言。
MeloTTS
语音工具
开源
语
音
、视频转文字神器:开源whisper介绍
OpenAI的Whisper是一种基于深度学习的
语
音
识
别
模型,它是一种通用的
语
音
识
别
模型,可以用于
语
音
识
别
、
语
音
翻译和
语
言
识
别
等任务。
人工智能
大模型
wisper
微调
大
语
言模型综述<演进,技术路线,区
别
,微调,
实
践,潜在问题与讨论>
下面是一些基于ChatGLM衍生出来的大模型应用: langchain-ChatGLM:基于 langchain 的 ChatGLM 应用,
实
现基于可扩展知
识
库的问答。
大模型
Transformer
TrOCR——基于transformer模型的OCR手写文字
识
别
前期我们使用大量的篇幅介绍了手写数字
识
别
与手写文字
识
别
,当然那里主要使用的是CNN卷积神经网络,利用CNN卷积神经网络来训练文字
识
别
的模型。
OCR
手写
文字识别
教程
openpose原理及安装教程(姿态
识
别
)
OpenPose是一个用于
实
时
多人姿态估计的开源库,它可以检测图像或视频中的人体关键点,并且能够
识
别
不同的身体部位和动作。
行为识别
姿态识别
开源
来个优秀的开源人脸
识
别
项目!
指纹
识
别
技术具有
实
用性强、采集和使用方便等优点。
人脸识别
开源项目
开源
F5-TTS:上海交大开源超逼真声
音
克隆TTS,告
别
ElevenLabs,以后就用它了!
实
测真的很牛
只是
别
被缅北拿去就好。
F5-TTS
音频克隆
开源
人脸
识
别
的开源的项目有哪些?
OpenCV:OpenCV(Open Source Computer Vision Library)是一个广泛使用的计算机视觉库,提供了许多人脸
识
别
算法和工具。
人脸识别
开源项目
OCR
14.6K star!最好用的OCR文字
识
别
项目,没有之一!
伙伴们,平
时
都会用到文字
识
别
吧?
Umi-OCR
开源项目
文字识别
开源
几款开源的OCR
识
别
项目,收藏备用
tesseract Tesseract,一款由HP
实
验室开发由Google维护的开源OCR引擎,开源,免费,支持多
语
言,多平台; https://github.com/tesseract-ocr
OCR
语
音
克隆又又又又又升级了
,
时
隔几个月Meta又推出了最新的
语
音
生成技术,不仅能可能声
音
,还能通过对声
音
的描述来生成独特的
音
色,同
时
还能通过描述来生成各种各样的
音
效,甚至能通过文字描述来编辑声
音
,整体来说,这项技术几乎囊括了现在人们对
语
音
生成技术的所有的需求
Meta
语音生成
开源
【
语
音
领域-又双叒更新】阿里开源FunAudioLLM: 2大核心模型、5大亮点功能!效果炸裂!手把手带你理论+
实
战部署推理!
整体项目的框架如下: 核心模型一:
语
音
识
别
模型SenseVoice介绍 SenseVoice 是一个全面的
语
音
基础模型,旨在执行各种
语
音
理解任务,包括自动
语
音
识
别
(ASR)、
语
言
识
别
asr
tts
声音
开源
6个最佳开源TTS引擎
TTS引擎用于
实
现文本到
语
音
的转换。
TTS引擎
开源模型
工具
TTS它又来了!OpenVoice:一款借鉴于TTS
实
现的强大的AI
语
音
克隆工具!
而 OpenVoice 作为一款强大的多
语
言即
时
语
音
克隆AI工具,可以为用户提供高效、个性化的
语
音
克隆服务,是一款值得推荐的项目。
tts
文本转语音
工具
OCRmyPDF—可智能
识
别
PDF文本和图片信息的工具
如果需要,可以在执行OCR之前对图像进行纠偏和/或清洁 •验证输入和输出文件 •在所有可用的CPU核心之间分配工作 •使用Tesseract OCR引擎
识
别
超过
OCRmyPDF
工具
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100