Optimus-1 – 哈工大联合鹏城实验室推出的智能体框架 Optimus-1是哈尔滨工业大学(深圳)和鹏城实验室推出的智能体框架,能解决在开放世界环境中完成长期任务的挑战。框架结合结构化知识和多模态经验,让智能体更好地执行复杂任务。 AI项目框架# 5个月前090
PaliGemma 2 – 谷歌DeepMind推出的全新视觉语言模型 PaliGemma 2是Google DeepMind基于Gemma 2语言模型家族推出的新一代视觉语言模型(VLM),作为PaliGemma模型的升级版。结合SigLIP-So400m视觉编码器和不... AI项目框架# 5个月前000
Llama 3.3 – Meta AI推出的纯文本语言模型 Llama 3.3是Meta AI推出的70B 参数模型,大型多语言预训练语言模型,性能与40B参数的Llama 3.1相当。模型专为多语言对话优化,支持英语、德语、法语、意大利语、葡萄牙语、印地语... AI项目框架# # AI 5个月前040
Fox-1 – TensorOpera 开源的小语言模型系列 Fox-1是TensorOpera推出的一系列小型语言模型(SLMs),包括Fox-1-1.6B和Fox-1-1.6B-Instruct-v0.1。Fox-1模型在3万亿个网络抓取的文档数据上预训练... AI项目框架# 5个月前080
One Shot, One Talk – 中科大联合香港理工推出的动态图像生成技术 One Shot, One Talk是先进的图像生成技术,能从单张图片中生成具有个性化细节的全身动态说话头像,支持逼真的动画效果,包括自然的表情变化和生动的身体动作。One Shot, One Tal... AI项目框架# 5个月前0240
Aurora – xAI为Grok AI助手推出的新图像生成模型 Aurora是xAI为AI助手Grok新增的图像生成模型。Aurora擅长创建逼真的图像,擅长人物肖像。Aurora能生成包括公共和版权人物在内的图像(如米老鼠)。Aurora 的可用性因用户等级而异... AI项目框架# # AI 5个月前0100
clone-voice – 开源的声音克隆工具,支持16种语言 Clone-voice是开源的声音克隆工具,基于深度学习技术分析和模拟人类声音,实现声音的高质量克隆。工具支持包括中文、英文、日语、韩语等在内的16种语言,能将文本转换为语音或将一种声音风格转换为另一... AI项目框架# # AI 5个月前010
SNOOPI – AI文本到图像生成框架,提升单步扩散模型的效率和性能 SNOOPI是创新的文本到图像生成框架,基于增强单步扩散模型的指导提升模型性能和控制力。SNOOPI包括PG-SB(适当指导 - SwiftBrush)和NASA(负向远离转向注意力)两种技术。PG... AI项目框架# 5个月前080
MEMO – 音频驱动的生成肖像说话视频框架,保持身份一致性和表现力 MEMO(Memory-Guided EMOtionaware diffusion)是Skywork AI、南洋理工大学和新加坡国立大学推出的音频驱动肖像动画框架,用在生成具有身份一致性和表现力的说话... AI项目框架# # AI 5个月前160
NVILA – 英伟达推出的视觉语言大模型 NVILA是NVIDIA推出的系列视觉语言模型,能平衡效率和准确性。模型用“先扩展后压缩”策略,有效处理高分辨率图像和长视频。NVILA在训练和微调阶段进行系统优化,减少资源消耗,在多项图像和视频基准... AI项目框架# 5个月前060