Manga Image Translator – 开源漫画图片文字翻译工具,多语言翻译无缝嵌入原图 Manga Image Translator是开源的漫画图片文字翻译工具,能一键翻译漫画和图片中的文字。Manga Image Translator基于OCR技术识别文本,结合机器翻译将文字转换成目标... AI项目框架# # AI 5个月前040
NodeTool – AI工作流可视化构建器,拖放节点设计复杂工作流 NodeTool是开源的AI工作流可视化构建器。NodeTool集成广泛的AI工具和模型,基于简单、可视化的界面,让用户无需编码即可快速原型设计和测试。NodeTool支持在本地GPU上运行AI模型... AI项目框架# # AI# 导出 5个月前0260
ColorFlow – 清华和腾讯共同推出的图像序列着色模型 ColorFlow是清华大学和腾讯ARC实验室共同推出的图像序列着色模型,能精细化地保持图像序列中个体身份的同时进行着色。基于检索增强、上下文学习和超分辨率技术,ColorFlow确保黑白图像序列着色... AI项目框架# 5个月前0120
豆包视觉理解模型 – 豆包推出视觉理解模型,具备识别和推理能力 豆包视觉理解模型是豆包推出的先进AI大模型,具备视觉识别和理解推理能力。豆包视觉理解模型能识别图像中物体的类别、形状、纹理等,还能理解物体间的关系和场景含义,进行复杂的逻辑计算任务,如解析学术论文图表... AI项目框架# # AI 5个月前080
VMB – 中科院联合多所高校机构推出增强多模态音乐生成的框架 VMB(Visuals Music Bridge)是中国科学院信息工程研究所、中国科学院大学网络空间安全学院、上海人工智能实验室、上海交通大学等机构推出的多模态音乐生成框架,能从文本、图像和视频等多种... AI项目框架# 5个月前020
MV-Adapter – 北航联合 VAST 等开源的多视图一致图像生成模型 MV-Adapter是多视图一致图像生成模型,是北京航空航天大学、VAST和上海交通大学的研究团队推出的。MV-Adapter能将预训练的文本到图像扩散模型转化为多视图图像生成器,无需改变原始网络结构... AI项目框架# 5个月前080
豆包3D生成模型 – 豆包推出3D生成模型,自然语言交互实时生成3D场景图 豆包3D生成模型是豆包推出的3D生成模型,属于豆包大模型家族。模型基于3D-DiT 架构,能生成高质量 3D 模块。与火山引擎数字孪生平台 veOmniverse 结合使用,能高效完成智能训练、数据合... AI项目框架# # AI 5个月前000
MarkItDown – 微软开源的多功能、多格式文档转Markdown工具 MarkItDown是微软开源的多功能文档处理工具,能将PDF、PPT、Word、Excel、图像、音频、HTML等多种格式的文件转换成Markdown格式。支持OCR文字识别、语音转文字和元数据提取... AI项目框架# 5个月前0110
FACTS Grounding – 谷歌推出的评估大模型能力的基准测试 FACTS Grounding是谷歌DeepMind推出的评估大型语言模型(LLMs)能力的基准测试,衡量模型根据给定上下文生成事实准确且无捏造信息的文本的能力。FACTS Grounding测试集包... AI项目框架# 5个月前040
WeaveFox – 蚂蚁推出 AI 前端研发平台,根据设计图直接生成源代码 WeaveFox是蚂蚁团队推出的AI驱动前端智能研发平台,基于蚂蚁自研的百灵多模态大模型,能直接根据设计图生成前端源代码。工具支持多种应用类型,包括控制台、移动端H5、小程序等,且兼容多种技术栈,如R... AI项目框架# # AI 5个月前0130