阿里云魔搭发起“ModelScope-Sora开源计划”

简介: 阿里云魔搭发起“ModelScope-Sora开源计划”


今日,2024全球开发者先锋大会上,阿里云魔搭社区公布“ModelScope-Sora开源计划”,将以开源力量助力中国类Sora模型的探索和创新。该计划将为类Sora模型开发提供一站式工具链,涵盖数据处理工具、多模态数据集、类Sora基础模型、训练推理工具等。现阶段,魔搭发布了业界首个开源的多模态数据处理系统Data-Juicer,包含100多种高效算子,可大幅提升视频数据处理效率和质量。


Sora引发整个技术圈对多模态大模型的关注。除采用DiT模型架构外,学习了大量高质量数据,无疑也是Sora效果惊人的秘诀。


阿里通义实验室资深算法专家李雅亮表示,“数据决定了机器学习任务的天花板,只有‘投喂’的数据质量高、颗粒度细、数量多,模型训练才能走出‘垃圾进,垃圾出’的困境。”


图|魔搭ModelScope-Sora开源计划



Data-Juicer开源,

去粗取精应对多模态数据


不过,类Sora模型的数据处理挑战极大。主流大数据框架并非为多模态数据设计,而视频处理难度较图文又大幅攀升,现有工具难以应对。因此,“ModelScope-Sora开源计划”首先上架了由阿里通义实验室研发的多模态数据处理系统Data-Juicer,它可对庞杂的多模态数据去粗取精,“榨出”更高质量、更丰富、更易“消化”的数据。


Data-Juicer支持文本、图片、音频、视频,内置筛选、映射、去重、格式化输出、美学打分等上百种高效算子,开发者可以像玩乐高一样自由组合。就像精于剪辑的导演,Data-Juicer能根据指定动作自动剪出视频片段,还能增强分辨率、调整宽高比、去除文本段,或通过计算光流判断视频动静,只保留精彩瞬间。此外,它还可自动打标,对光线变化、环境氛围都能精细捕捉并生成文字描述。


image.png

图|魔搭开源的Data-Juicer流程示意图


李雅亮介绍,魔搭社区还推出了基于Data-Juicer的沙盒实验室。研发人员可以先在迷你数据集和模型上快速迭代,找到最合适的配方。


然后,在Data-Juicer的数据加工流水线上,开发者可以使用阿里云PAI来调用集群和GPU进行大规模数据处理,后续还可在PAI上一站式完成模型的训练、推理。



从模型、数据到工具,

魔搭助力中国类Sora模型开发



魔搭“ModelScope-Sora计划”同步开源了基础类Sora模型。华东师范大学博士生段忠杰联合魔搭社区,实现了DiT架构的视频生成扩散模型lite-Sora,并在小规模数据集上初步训练,得到能生成大幅度运动视频的实验模型。该模型正进一步深度训练,最终目标是完成对Sora的复现。


image.png

图|魔搭开源的lite-Sora模型架构图


接下来,魔搭社区还将举办“ModelScope-Sora挑战赛”, 鼓励更多开发者打造并开源自己的类Sora模型,共同加速中国多模态大模型的发展。同时,魔搭将助力构建开放的中文高质量多模态数据集。


作为国内规模最大、最活跃的AI开源模型社区,阿里云魔搭目前已汇聚3000多款优质模型及上千数据集,为超过400万开发者提供模型及免费算力服务。


目录
相关文章
|
4天前
|
消息中间件 Cloud Native 开发者
电子好书发您分享《阿里云云原生开源开发者沙龙北京站 PPT 合集 》
**阿里云开源沙龙PPT合集:北京站聚焦云原生技术** 探索云原生领域的深度与广度,[阿里云](/ebook/8334/116563?spm=a2c6h.26392459.ebook-detail.5.da096cf6t38G15)分享了北京开发者沙龙的精彩内容,涵盖微服务、消息队列等主题,助力开发者洞悉行业趋势。![image](https://ucc.alicdn.com/pic/developer-ecology/cok6a6su42rzm_67b12f6cad6e4b2786859b3a668b3351.png)
48 3
|
4天前
|
关系型数据库 分布式数据库 数据库
开源之夏2024学生报名启动!阿里云PolarDB社区项目期待你的参与!
开源之夏2024学生报名启动!阿里云PolarDB社区带你变得更强!
开源之夏2024学生报名启动!阿里云PolarDB社区项目期待你的参与!
|
4天前
|
存储 缓存 安全
阿里云EMR数据湖文件系统: 面向开源和云打造下一代 HDFS
本文作者详细地介绍了阿里云EMR数据湖文件系统JindoFS的起源、发展迭代以及性能。
71950 2
|
4天前
|
Kubernetes Cloud Native 安全
电子好书发您分享《阿里云云原生开源开发者沙龙北京站 PPT 合集》
? 阿里云开源开发者沙龙北京站精彩回顾!获取PPT合集,深入云原生安全与微服务实践:[北京站PPT](/ebook/8334/116563?spm=a2c6h.26392459.ebook-detail.5.4dc56cf6htj2uT) ? 图文并茂探讨微服务安全与K8s监控解决方案。不容错过的云原生学习资源!?
43 2
|
4天前
|
弹性计算 运维 数据可视化
开源!阿里云开源帕鲁一键部署服务模板
阿里云响应《幻兽帕鲁》游戏火爆,迅速推出游戏联机专属服务,实现3分钟内自动化部署服务器,简化玩家上手难度。借助阿里云计算巢,服务在1个月内迭代70多个版本,提供丰富功能。现在,阿里云宣布将帕鲁快速部署服务模板全面开源,任何人都能获取。这一服务利用IaC技术,实现软件SaaS化,提供一键开服功能,并支持灵活配置和全球化部署。此外,通过计算巢的可视化操作和快速变配功能,满足玩家个性化需求。阿里云计算巢作为免费产品,旨在促进更多软件云端发展。
42 0
|
4天前
|
数据采集 机器学习/深度学习 人工智能
阿里云魔搭社区发起ModelScope-Sora开源计划
阿里云魔搭社区在2024全球开发者先锋大会上启动ModelScope-Sora开源计划,聚焦中国多模态大模型研究,推出一站式工具链和Data-Juicer多模态数据处理系统,提升处理效率与质量。该计划还包括基础类Sora模型开源及沙盒实验室,以支持开发者迭代与训练。面对数据质量、安全、商业平衡及算力挑战,魔搭社区致力于推动AI创新,已汇聚众多模型与开发者。
166 1
阿里云魔搭社区发起ModelScope-Sora开源计划
|
4天前
|
弹性计算 运维 监控
解密阿里云弹性计算:探索云服务器ECS的核心功能
阿里云ECS是核心计算服务,提供弹性云服务器资源,支持实例按需配置、集群管理和监控,集成安全防护,确保服务稳定、安全,助力高效业务运营。
84 0
|
4天前
|
存储 弹性计算 固态存储
阿里云服务器CPU内存配置详细指南,如何选择合适云服务器配置?
阿里云服务器配置选择涉及CPU、内存、公网带宽和磁盘。个人开发者或中小企业推荐使用轻量应用服务器或ECS经济型e实例,如2核2G3M配置,适合低流量网站。企业用户则应选择企业级独享型ECS,如通用算力型u1、计算型c7或通用型g7,至少2核4G配置,公网带宽建议5M,系统盘可选SSD或ESSD云盘。选择时考虑实际应用需求和性能稳定性。
149 6
|
4天前
|
域名解析 弹性计算 Linux
阿里云购买云服务器、注册域名、备案及绑定图文教程参考
本文为大家介绍了2024年购买阿里云服务器和注册域名,绑定以及备案的教程,适合需要在阿里云购买云服务器、注册域名并备案的用户参考,新手用户可通过此文您了解在从购买云服务器到完成备案的流程。
阿里云购买云服务器、注册域名、备案及绑定图文教程参考
|
2天前
|
存储 安全 数据库
阿里云服务器计算型、通用型、内存型主要实例规格特点、适用场景及最新价格参考
在阿里云服务器的实例规格中,有共享型也有企业型,一般用户选择较多的企业级实例规格有计算型、通用型、内存型,每一种实例规格又有多个实例规格族可选,不同的云服务器实例规格在架构、计算、存储、网络、安全等方面有着不同,因此,其适用场景也有所不同。本文来详细介绍一下阿里云服务器计算型、通用型、内存型主要实例计算、存储等性能及其适用场景,以供参考。
阿里云服务器计算型、通用型、内存型主要实例规格特点、适用场景及最新价格参考

热门文章

最新文章

http://www.vxiaotou.com