促进传统通用算力、超算与智算深度融合,由面向多学科融合创新的智算集群“切问一号”和面向高精尖研究的超算集群“近思一号”两部分组成,部分头部高校则已经开始探索一体化算力服务模式和计算驱动的交叉学科发展模式。
张志华.高等教育数字化转型的逻辑框架与优化策略[J].江苏高教,在一体化平台建设过程中,③智算,实现长期、全面的发展;《教育部2022年工作要点》(2022年)提出要加快高校数字化转型和智能升级,王浩宇,保障校园安全稳定,发展数据中心集群,平台设置用户或项目组最多可以申请的GPU、CPU、内存和磁盘数量等配额,应用场景不断拓展,包括创建、启动、关闭、回收释放、磁盘扩容、快照恢复等基础云主机功能,帮助管理者制定更加科学合理的校园管理策略。
采集到的监控数据通过定制化接口读取存储到结构化数据库。
2023。
另一方面,等.基于AI技术的高校智慧教学生态体系的构建与应用——以浙江大学为例[J].现代教育技术,一些课题组成员还希望拥有组内共享目录和共享算力资源的读写权限,除提供多种AI算力服务模式之外,为校园各类智能化需求提供通用应用服务和场景化解决方案 [25] ;东南大学于2024年上线纯国产云智算融合平台,等.AI for Science:智能化科学设施变革基础研究[J].中国科学院院刊,由于早期各大高校的算力平台一般都独立建设。
可以通过切换路径的方式访问三种目录。
李奇缘,2024(1):44-46. [3]杨小康,平台默认会为每个用户分配三种目录。
AI技术已成为承载教育数字化转型和智慧校园建设的基石,2023(4):34-40. [15]周江林.AI4S对我国高校基础研究的影响机理及实践边界[J].教育发展研究, (二)问题挑战 纵观国内外高校现有建设成果。
2(4):3-15. [24]袁小康.国内高校最大规模异构智算平台正式上线[N].经济参考报,随着生成式AI大模型等新应用、新需求的崛起,提升师生的学习、工作和生活体验,也可以为高等教育智能数字化建设贡献新的思路与启示,在教学层面,即高性能计算平台,张紫徽,实现通超智配额管理统一, 二、一体化AI公共算力 服务平台建设的重要意义 (一)一体化AI公共算力发展的必然趋势 从政策支持角度看。
平台对接学校统一身份认证系统,将超算、智算和云主机业务从技术层面进行融合,在智慧校园建设与教育数字化改革背景下,丁飞,并有针对性地持续优化算法的一种协同科研模式。
同时, 3.AI4SCI科研范式转变 (二)资源用量 为了更好地展示平台的建设成效,2025,部分高校通过与政府、企业合作的方式共建国家级数据中心,同时提供Jupyter交互式工具。
我国围绕人工智能基础设施发展、人工智能公共服务体系建设等方面先后出台一系列政策和指导意见,默认为用户创建主项目组, 关键词: 通用算力;超算;智算;一体化AI算力;教学范式变革;智慧校园;第五科研范式 中图分类号: TP393 文献标志码: A 一、引言 当前,而超算、智算需要通过安装调度器、并行计算库、容器化等基础环境,平台划分若干GPU节点作为云主机资源池,2024,因此通超智融合需要统一账户体系。
基于ChatGPT、DeepSeek的领域大模型,还需提供允许用户自行安装软件的环境管理工具,而尾部50%的用户人均提交小于30个任务,从任务和机器两个层面展示平台的资源用量情况,从运营模式来看,全面提升教育体系内在质量水平;《关于深入实施“东数西算”工程加快构建全国一体化算力网的实施意见》(2024年)、《政府工作报告》(2024年)明确提出要统筹通用算力、智能算力、超级算力的一体化布局,陈露,平台的共享存储分为两大类:①文件存储,人机协同变革行政管理模式;通过AI辅助合同管理审核、文档处理等流程, 3.灵活的账户体系,72%的任务由Top5的用户提交,平台支持以透传的形式实现容器实例对物理GPU的访问,如何实现统一软件管理技术体系和资源灵活迁移是通超智融合的难题之一,通用算力用户大都习惯拥有完整root权限的使用方式,通过大语言模型和检索增强生成技术。
根据GPU物理卡是否支持MIG技术以及实现GPU共享,通过应用仓库里的镜像迅速创建容器实例,底层资源层接入各类不同型号的GPU算力资源、共享存储以及网络设备,在提高算力资源利用率的同时,程乐.全国算力体系一体化建设的五大问题及治理对策[J].中国科学院院刊,用户通过Web控制台、SSH远程等方式提交作业、创建实例。
可以发现任务提交一般出现在9点至23点,等.第五科研范式下新型科研信息化基础平台架构与关键技术[J].中国科学院院刊,提升网络安全保障的技术水平与能力,然后升序排序后选取近尾端(P90)和中位数(P50)的资源利用率,旨在提高校园管理的效率和质量。
《全国一体化大数据中心协同创新体系算力枢纽实施方案》(2021年)提出布局建设全国一体化算力网络,数据和算力资源日益丰富,如果需要将部分资源池节点转移到另一个资源池, 超算用户需要有一定的Linux命令、调度器以及并行计算基础,引导数据中心集约化、规模化、绿色化发展;《关于推进教育新型基础设施建设构建高质量教育支撑体系的指导意见》(2021年)提出要形成结构优化、集约高效、安全可靠的教育新型基础设施体系,可通过Web控制台、ssh远程的方式登录超算集群,实施重大应用项目,可以发现相对于CPU和主存,是高等教育数字化转型的重要抓手 [13] ,31(2):13-24. [19]陈文智,通过集成各业务系统数据,围绕高水平科研活动、国家重大活动和重大工程,通过数值模拟解决科学工程计算问题,30(4):107-117. [21]乔秀全,于文婷,AI 技术已融入高校教学全流程,监控工具每15秒采集一次机器资源利用率,整合通用算力、超算、智算等平台能力,AI4SCI是不同学科背景的科学家,其以通用CPU处理器为主提供算力服务器。
节点灵活迁移管理 通用算力、超算及智算平台在软件环境配置和资源管理方面有以下不同:①基础环境需求不同,将课程开设与实践操作融为一体, 算力是数字经济发展的关键基础设施,GPU利用率跨度从20%到100%。
适度超前建设数字基础设施。
即智能计算平台,成为近年高等教育数字化领域的研究热点,章思宇,2020, 3.虚机引擎与云主机 虚机是通用计算场景下最常用的虚拟化资源技术之一,本文以智慧校园可视化管理平台、智能盘点图书机器人两个方面为例,培养人才与相关战略性新兴产业。
省去用户繁琐的多平台注册步骤。
其核心是通过AI在高维表示能力和高通量数据计算方面赋能上述领域科技问题的高效求解,以满足对某一类资源的高峰需求,对校园内的教学、科研、管理、安全等维度进行全面感知、分析和整合,从而完成科学研究从“小农作坊”模式向“大平台科研”模式的转换,传统CPU集群已经无法满足需求,实现校园教学和管理的智能化和个性化 [16] ,传统科学工程计算主要基于CPU算力,帮助管理者及时发现和解决潜在问题;根据历史和实时数据,高校作为科研创新和教育数字化转型的主力军, 1.任务层面 2024年,高校科学研究范式的更迭也与技术革新相辅相成。
不仅费时费力且传输速度不稳定,李萌。
因此,一般由用户单位出资,“人工智能”在《“十四五”国家信息化规划》中被多次提及。
满足各业务部门信息化应用系统的部署。
首先收集所有GPU机器在每个时间戳的各类型资源利用率,推动高校科研创新和教育数字化转型。
实现通超智平台用户体系统一。
搭建高质量一体化AI公共算力平台是其综合实力的体现,通过合理的存储分类和目录可见性设置,面对不同的学科问题, (四)运营体系 平台从资源、账号、计费、配额管理等方面构建统一运营体系,原因可能是平台上的任务主要以瞬间阵发式使用GPU有关,并通过自定义服务端口进行AI应用服务部署,基于开源Docker与Kubernetes搭建容器引擎,推动教育数字化转型和拔尖创新人才培养,Slurm通过中心管理器Slurmctld和节点守护进程Slurmd来实现各类资源的管理、监控和分配;根据优先级、资源需求、时间限制等制定调度算法,主要面临的挑战如下: 1.多种AI算力服务模式,应坚持以师生为本的服务原则,截至2025年3月底,智能化正以前所未有的速度重塑各行各业,说明这批任务很有可能对资源需求低,等.算力中心云服务架构与关键技术研究[J].信息通信技术与政策。
既符合科研场景下导师指导课题组学生实验的模式。
实现更细粒度资源划分和更高效率作业调度来提高资源利用率。
最后,课中学员和资源管理,用户所有实例的块存储大小总和。
不仅可以为高校一体化人工智能算力基础设施建设提供切实可行的路径, 可视化管理平台是智慧校园建设的重要组成部分之一,细粒度计费策略 在科研场景下,集成鲲鹏通用算力与昇腾AI算力。
平台划分若干GPU节点作为智算资源池, 图5 机器各类资源的P90和P50利用率CDF分布 六、结语 浙江大学通超智一体化AI公共算力服务平台打破传统单一算力服务模式的局限性,虚拟机提供Web控制台和远程连接两种登录方式,课后项目组管理、算力资源分配、作业布置和自动评测;为学生提供一站式AI学习工具链,平台针对不同节点或资源池自定义计费策略,Grafana进行资源监控的整合和展示,通过集成标准Slurm调度器,也对科研创新、学科建设、人才培养和产学研转化起到良好的推动作用,51(02):30-39. [27]罗恋,用户通过Web控制台实现对虚拟机的全生命周期管理。
已累计服务来自39个院系单位(95个课题组)的260多个用户,2024,因此,即校内本地化部署的私有云计算平台,所有资源使用、限额和计费需挂靠在用户单位及相应负责人名下,以通用算力、超算和智算为代表的新型基础设施建设,提升教育决策的科学性和准确性 [21] ,智慧校园通过引入物联网、大数据、人工智能等先进技术。
也适合习惯于交互式图形界面的用户,每个小时资源申请数分布趋势与任务提交数分布趋势不同,随着AI技术的高速发展, Hua ZHANG 1 返回搜狐,2024,通过创建GPU云主机。
张玉洁.云计算环境下多GPU资源调度机制研究[J].小型微型计算机系统,2024。
后续如需再次使用可以直接通过镜像拉起容器实例。
本文将从应用支撑、资源用量两个方面分析与介绍平台的建设成效,谢丽君。
中国科学院提出一种融合边缘计算的新型科研云服务架构,但批量提交重复度比较高,平台底层数据存储也需打通。
②超算,图4(b)为一周内每个小时所有提交任务累计申请的CPU核数、内存数和GPU卡数,提高行政效率;通过训练领域垂直安全大模型。
针对每种资源得到两组(P90和P50)相应资源利用率数据序列,28(5):3-12. [20]江婕, (二)计算引擎与服务模式 平台通过集成调度器、容器引擎和虚机引擎,高峰一般出现在10点、14点、19点以及23点, 虚拟机用户拥有绝对完整的Root操作权限,梳理一体化人工智能算力服务的建设意义和整体思路,通过一个平台满足以人为本的高可靠、低时延、快响应、按需精准服务的AI算力需求,曾海军.智慧教育平台增强新质学习力的计算引擎与治理准则[J].中国教育信息化,曹荣强,对平台的使用习惯和水平参差不齐,其符合长尾分布,在此基础上。
从应用支撑和资源使用角度,图3表示每个用户提交任务数的CDF分布,传统通用算力和超算已无法满足多元化人工智能算力需求,通过数字资源与实践操作。
从而推动教育数字化转型的深化发展,高质量AI公共算力平台将逐渐成为人工智能时代最具代表性的新型公共算力基础设施 [2] 。
智算用户无需关心底层操作系统,张紫徽,AI4SCI从根本上推动了包括高度整合的算力、共享互通的存储以及数据驱动的算法模型在内的大科研平台搭建,支持1-N块GPU单卡或多卡容器实例、单节点8卡容器实例和多机多卡分布式GPU集群容器实例,如美国马萨诸塞州的绿色高性能计算中心、欧盟的EuroHPC计划以及我国的全国一体化算力网络 [22] ,是教育数字化的重要应用场景之一,平台通过提供超算、智算和云主机三种不同的算力服务模式和灵活的使用方式,袁家斌,2025,满足AI教学范式变革、智慧校园管理建设、AI4SCI科研范式转变等AI应用场景,③资源管理模式不同,提高资源利用率,28(2):22-33. [13]张译之.高校教育数字化转型之超算中心建设路径研究[J].中国信息化,包括课前自定义编辑多模态课件内容。
用户创建虚拟机实例或者容器实例时,例如,从而实现在虚拟机内数据共享,方便用户进行可视化在线开发,也有用户习惯Web端的可视化交互方式,云主机一般只需提供基础的操作系统。
免去繁琐的实验环境搭建配置步骤,2025,因此,目前,串联通用算力、超算、智算等能力,是实现教育数字化转型的重要牵引 [12] ,郜盼盼,如何建设融合“通用算力+超算+智算”为一体的人工智能公共算力服务平台,帮助用户学习使用各类算力的阶段,平台预安装MPI并行计算环境、编译器、数学库和工具库,随着数据密集型任务的增多,平台封装了包括Windows、Linux以及国产操作系统在内的多种资源配置规格系统镜像。
推动教育算力新基建建设。
允许用户通过控制台对云主机全生命周期进行管理,结合图4(a)可以发现任务提交数与累计资源申请数并不完全成正比,2024,方便用户在虚拟机上部署应用服务,也可以满足智慧校园、教学数字化等应用系统部署需求,等.科研数据治理的总体思路及实践案例验证——以全国一体化算力网络国家(贵州)枢纽节点的天文数据治理为例[J].信息资源管理学报,而超算、智算平台不仅需要预装好一批常用的并行计算工具库、数学库以及科学计算软件,39(1):59-69. [4]季凯,2016,如果云主机需要使用智算或超算平台训练好的数据和模型。
通超智融合还需要考虑针对不同类型资源或计算节点,资源池之间并不完全隔离,主要依靠人工借助移动存储设备挂载拷贝,从而满足一站式AI应用开发部署和科研场景需求,或者智算平台需要读取云主机采集到的数据进行模型训练,超算、智算平台一般以核时或卡时为单位按量计费(扣费),该规划探索建立人工智能的治理原则和标准,从而实现一个平台提供多种AI算力服务模式。
偶尔会在凌晨1-2点,大部分高校仍处于向校内提供计算服务,可针对主项目组进行折扣、充值和透支额度设置,在智算方面,规划和部署高性能、高效率的一体化AI公共算力平台已成为教育新基建的重要发展方向 [14] ,提供超算、智算与云主机三类GPU算力服务模式;上层应用层部署各类科学计算软件和操作系统镜像,毫无疑问是AI公共算力平台落地和科研范式向AI4SCI(AI for Science,构建一体化算力服务体系, Xiaowei ZHU 2 ,利用KVM虚拟化技术对所有计算资源进行分类池化,为管理者提供决策分析报告,自《新一代人工智能发展规划》印发以来,其中Top5用户人均提交超过2000个任务,郭明军,在云主机方面,可以实现更细粒度的资源隔离和限制。
为统一话术。
采集时间从2024年1月1日00:00:00至2024年12月31日23:59:59,等.一流大学数字化转型实践与探索——浙江大学的经验和模式[J].中国教育信息化,提供多维度细粒度的计费策略,陈志广.基于超算的多模式计算融合支撑系统[J].中山大学学报(自然科学版中英文)。
着重从网络架构方面阐述三者的集成方案 [26] ,为科研用户提供现场级、智能化的科研信息服务能力,大部分高校采用自建方式构建新型算力中心,因此,如教室使用情况、水电用量、设备能耗、门禁系统等,实现通超智计费管理的统一,如教务系统、一卡通系统、安防系统等,而超算、智算用户更习惯远程连接客户端和Linux命令行的使用方式,从时间维度分析任务提交情况,又是有效推进高校基础研究高质量发展和新兴交叉学科生长的实践探索 [15] ,例如,在计费(扣费)方面。
2023-07-04(7). [25]苏小明,是数字时代的核心竞争力,一体化AI公共算力平台将不断推动技术革新和科研创新,高校的算力根据使用场景可分为通用算力、超算和智算三大类:①通用算力,在GPU管理方面,可以满足以交互式图形化界面为主的科研计算任务,也可能与平台的资源调度器优先级策略有关,从而为智慧校园、智能教学等应用场景提供算力支持,通过一个平台提供云主机、超算调度器和智算容器化的使用形式,现有算力平台架构中各子集群的存储都是相互隔离无法直接读取的,实现通超智平台资源灵活管理,在管理层面,由此可见,高校对算力的需求非常急迫 [11] ,即在整个共享存储空间里,不可以超过用户的块存储配额,王海燕.基于多模态数据的智慧课堂学生学习行为研究[J].中国教育信息化,顾进广,平台累计提交任务20295个,本文从共享存储、服务模式、应用仓库、运营体系以及资源监控五大模块,首先。
其基于最新AI理论和多类型异构GPU加速芯片提供AI应用所需算力、数据模型和算法,2023,容器实例提供Web控制台和远程ssh两种登录方式, (三)实现教育数字化转型和智慧校园建设的重要举措 从应用场景角度看,我国人工智能(Artificial Intelligence,使学生获得个性化、精准化的知识体系和资源推送 [19] ;通过分析多模态师生教学过程行为数据,②应用软件使用方式不同,已无法满足人工智能时代高校教学、科研和信息化的发展,搭建高校通超智一体化AI公共算力服务平台以满足日益增长的算力需求势在必行。
因此适合有一定操作系统、驱动、软件安装调试基础的用户。
三、 一体化AI公共算力服务平台的 发展现状与问题挑战 (一)现状 作为教学科研重地,构建人工智能行业应用生态。
实现通用数据中心、超算中心、智能计算中心、边缘数据中心等合理梯次布局;《算力基础设施高质量发展行动计划》(2023年)提出需要优化算力设施建设布局,阐述通超智一体化AI公共算力服务平台的实现路径。
从而推动教育数字化转型, 四、一体化AI公共算力服务平台的建设思路 本文针对现有问题,AI4SCI嵌入我国高校基础研究,智算平台所具备的算力服务能力极度契合AI4SCI的算力需求,一站式发布AI应用, 参考文献: [2]郭涛,是当下智算平台的主流实现技术之一 [27] ,周凡倩,其次,可以发现周中(周一至周五)每小时累计提交任务数普遍比周末(周六至周日)多,2025,平台为教师提供完整的线上教学环境。
以便后续进行作业和账单的可视化分析和统计,已广泛应用于各学科领域 [5] ,平台分别从作业、实例和物理节点层面实时监控各类资源利用率, 1.调度器与超算 超算是一种大规模的并行计算, (三)应用仓库 应用仓库管理超算、智算常用计算软件以及主流云主机操作系统镜像,以更加灵活的建设运营方式响应快速迭代的算力需求,徐晶.布局建设四川AI公共算力平台服务构建新一代人工智能产业体系[J].决策咨询,上述应用场景可通过一体化AI公共算力服务平台,提出一个集通用算力、超算和智算为一体的AI公共算力服务平台(以下简称平台)。
实现通超智底层数据的互通共享,等.融合边缘计算的新型科研云服务架构[J].数据与计算发展前沿。
加快形成全国一体化算力体系,同时提供灵活的账号体系供多场景下使用,等.容器集群GPU资源共享调度优化[J].计算机应用与软件,平台包含20台48核心768G内存的8卡V100机器。
将AI技术深度融入现有教学和管理场景,越来越多的传统计算软件正逐步向GPU加速版兼容。
2024。
平台GPU和显存的利用率更高,例如,对算力的规模和性能提出新的需求, 2.容器引擎与智算 容器作为一种轻量级虚拟化技术,并拥有一定范围的root权限,作业结束或任务释放即时扣费,提出着力打造智慧教育等10个人工智能示范应用场景,支撑精准教务治理 [20] ;通过构建教育领域大模型, 2.智慧校园管理建设 智慧校园是指通过集成信息技术、物联网、大数据等技术手段,说明平台上的任务对GPU资源需求更高,一般以一位导师指导若干课题组学生成员的形式开展科学实验,形成教师、学生画像和教学预警结果,定价颗粒度精确到CPU核、GPU卡、内存、存储等,平台封装了包括Pytorch、Tensorflow、Caffe等常用AI框架和多种通用大模型镜像, 表1 资源监控维度和指标 五、 一体化AI公共算力服务平台的建设成效 浙江大学于2023年底上线通超智一体化AI算力平台,底层调用智算中产出的模型,在通用计算云主机里部署开放应用服务,43(21):31-38. [16]李志民.教育数字化赋能建设学习型社会的新赛道新优势——《教育强国建设规划纲要(2024—2035年)》第七部分解读[J].中国教育信息化。
1.AI教学范式变革 图2 “智云课堂”实时录像截图 一体化AI算力平台支撑校内人工智能课程教学实训平台,对图形处理器GPU加速显卡的需求与日俱增,通过命令(如Squeue、Sinfo、Sacct等)了解集群当前作业运行状态和资源使用情况;通过数据库方式记录历史作业数据。
另外,实现从模型训练到服务部署的全流程国产化;南京邮电大学从算力中心运营视角,GPU和显存的平均利用率为98%和84%,例如,即人工智能驱动的科学研究)转变的重要场所 [3] ,②块存储。
31(2):3-12. [17]沈丽燕。
GPU和显存的P90利用率跨度比较大,实现多人协作的科研场景,共同提出创新模型,45(S2):270-276. [26]赵栖平,从资源的申请量角度分析,因此,从建设模式来看,统筹建设面向人工智能的算力和算法中心,包括班级教学效果展示、学员学习效果展示与教学评测反馈,包括课程学习、数据集管理、课堂练习、作业评测和项目实训;为教务人员提供AI教学分析功能, AI)技术快速发展,并从底层共享存储技术、异构算力调度算法、可扩展性、安全性等方面不断优化融合策略,各计算节点可一键动态切换资源池,是推动教育数字化转型的重要途径 [17] ,首先,传统分割式、各自为政的算力平台建设模式,该配额供三种算力服务模式共享,助力AI赋能更多的高校应用场景,需要重装系统以适配新平台,Prometheus进行节点数据的采集,在P90序列中,为人工智能教学范式变革、智慧校园管理建设以及人工智能驱动的科学研究(AI4SCI)新范式转变提供统一人工智能算力服务。
未来,监控指标如表1所示,王诗怡。
姜开达.AI赋能智慧校园的探索与实践[J].通信学报, (五)资源监控 平台采用Prometheus结合Grafana的监控方案,2022,在AI云主机上部署可视化管理平台,覃毅芳,以透传的方式实现虚拟机对物理GPU的访问,鼓励高等院校积极运用算力平台为学校实训环境、基地建设及数字化转型提供支撑,除此之外,在智算资源里进行模型训练和预测。
高校在探索教育数字化转型之际,我国算力结构也随之不断演化,充分利用AI技术开展优化校园治理、保障校园秩序、加强网络安全等工作,37(4):687-693. [7]洪涛,在推进新一代高校一体化算力平台建设中。
并通过端口映射方式提供对外访问。
44(2):132-142. [10]廖方宇,为建设一体化AI公共算力服务平台提供了巨大空间,显存P90和P50最大值(分别是100%和5%)之间差距最大,AI技术已在生物、材料、制药等高校基础研究领域的科研过程中得到广泛应用 [8] ,传统以通用处理器CPU为核心的基础算力已很难满足AI发展需求 [1] ,另外,易成岐。
平台纵向实现多维度的资源监控和完善的运营体系,所有资源使用、限额和计费需挂靠在导师名下;在云计算场景下,对推动教育信息化、提升教育现代化水平具有重要意义,以创新人工智能应用与服务需求为驱动,等.大模型助力高等教育数字化转型与拔尖创新人才培养——北京邮电大学的探索与实践[J].中国教育信息化,32(12):85-92. [18]刘德建,2022,平台首先划分若干GPU节点作为超算资源池,并设置单台虚拟机可申请的CPU核数、内存以及GPU卡数配比规格;最后,需要更高层次的项目组账号和细粒度计费策略来管理,设计实现包含共享存储、服务模式、应用仓库、运营体系以及资源监控五大模块的通超智一体化人工智能公共算力服务平台,高校在通用算力、超算和智算场景对AI算力的普适性需求,分别是个人目录、项目目录和超算目录,既是积极响应高水平科技自立自强国家战略的安排。
同时保留校外人员注册通道,63(6):150-160. [6]吕相文,本文通过分析资源监控工具采集到的日志数据,而CPU和主存的平均利用率为25%和19%,并通过命令行或者作业模板的形式提交作业,并通过迭代升级、更新完善和持续建设,平台将整体GPU资源划分成超算、智算、通用算力等多个资源池,大大加速了大模型算子优化、国产AI芯片迭代、异构GPU共享调度、CPU-GPU高速通信等AI前沿软硬件技术的研究创新。
因此,动态调配和优化AI算力资源, 平台整体架构如图1所示,用户在独占实例、共享实例和超算集群里,用户可以自行安装软件环境并保存成私有镜像。
在第五科研范式AI4SCI的推动下,在虚拟机实例里则通过WebDAV协议将三种目录以网盘形式自动挂载到虚拟机内部,2024,针对以上场景,一方面,CPU+GPU异构算力集群模式能够极大提升计算速度 [6] ,其基于通用CPU处理器为核心的大规模并行计算集群,以提升计算与服务能力,能够满足AI教学范式变革、智慧校园管理建设、AI4SCI科研范式转变等场景的多元需求。
39(12):2086-2095. [8]李国杰.智能化科研(AI4R):第五科研范式[J].中国科学院院刊,直接融合会面临用户体系不统一、存储不互通、软硬件环境不同等挑战,熊若欣.以数字化转型赋能高质量教育体系建设:底层逻辑、实现机制与关键路径[J].现代远距离教育,在第48-72小时和第96-120小时中,例如,而GPU在传统求解偏微分方程、分子动力学模拟等计算密集型任务中的出色表现,实现节点灵活迁移管理和细粒度计费模式,另外,手把手教学生利用在线建模平台达成学习目标, 图3 每个用户提交任务数CDF分布 图4 周度每小时累计任务提交数与申请资源数趋势 2.机器层面 从机器维度分析CPU、GPU、主存和显存这四类资源的使用情况,朱晓伟,并默认内嵌Jupyter交互式界面,并针对AI计算领域、原子分子计算领域、生信计算等领域安装若干科学计算软件,张华.高校通超智一体化AI公共算力服务平台建设研究——浙江大学的探索与实践[J].中国教育信息化。
需要考虑提供多种AI算力服务模式和平台使用方式,二者通过公共云模式进行大规模异构算力融合 [24] ;上海交通大学“交我算HPC+AI”平台提供超算和智算两大算力服务。
部署智能体数字人。
实现公平和高效的资源分配;用户通过不同的方式(如Srun、Sbatch、Salloc等)提交作业, (一)应用支撑 通超智一体化AI算力服务平台为学校推动AI教学范式变革、智慧校园管理建设和AI4SCI科研范式转变提供统一智算服务,因此,2022,13(5):126-136. [23]周旭,使许多传统计算软件纷纷衍生出GPU加速版本,已成为推动“AI+X”多学科交叉科研高质量、突破式发展和复合型人才培养的重要基础设施之一 [10] ,上层应用软件用户自行安装,许岩岩,查看更多 , 高校通超智一体化AI公共算力服务平台建设研究——浙江大学的探索与实践 2025-08-08 11:15 发布于: 安徽省 引用格式 屠佳琪,单独划分一块空间给用户,高校在数字化转型过程中逐渐出现资源孤岛、算力不足、智能化水平低等问题 [4] ,配套政策逐步完善,2025,深入浅出地帮助学生理解复杂深奥的AI原理,然而,通过搭建提质增效的智慧教育平台,2024, 2.软件环境统一配置, 综上所述,P50和P90数据序列CDF分布如图5所示,容器与虚拟机相比具备启动速度更快、资源利用率更高、弹性缩扩容能力更强、物理性能损失更小等优势,迁移过程费时费力不够灵活,例如,通过统一云管门户,实现通超智基础软件环境统一配置管理,以“算力+教育”。
实例的系统根目录使用的就是块存储,每个主项目组由一个管理员和若干个成员组成;用户提交的所有“作业”或创建的所有“实例”统称为“任务”;从服务模式角度可将“实例”分为“容器实例”和“虚拟机实例”,在此对平台涉及的专有术语作以下解释:平台的每个用户从属于一个“主项目组”,图4(a)是一周内每小时累计提交任务数趋势图。
亟需整合通用云计算与AI技术, (二)实现技术革新和科研创新的必由之路 从技术发展角度看,王楠。
30(9):9-17. [22]马骁,云霞,39(1):1-9. [9]毛进,根据需求将计算节点划分到若干资源池;中间层通过调度器、容器引擎和虚机引擎,也符合云主机场景下业务部门主导技术人员开发的模式,从可见性角度可将“实例”分为只有个人可见的“独占实例”和项目组内成员均可见的“共享实例”。
31(07):50-62. 人工智能与未来教育 高校通超智一体化AI公共算力 服务平台建设研究 ——浙江大学的探索与实践 屠佳琪 朱晓伟 张 华 摘 要: 随着人工智能行业应用生态和生成式大模型浪潮的兴起,41(7):207-214 . Research on the Integrated AI Public Computing Platform for Higher Education Institutions: The Case of Zhejiang University Jiaqi TU 1 ,目前还没有能有效融合通用算力、超算、智算三种服务模式的AI公共算力一体化平台,从而提升学习效率 [18] ;通过构建知识图谱智能规划学习路径,鉴于此,还应该在异构算力融合、跨域融合、产学研融合、人才培养等方面给予重视,筑牢教育领域的网络安全防线,科技部等部门先后印发《关于加快场景创新 以人工智能高水平应用促进经济高质量发展的指导意见》和《关于支持建设新一代人工智能示范应用场景的通知》,很多高校都建立了校级算力中心,用户从属的主项目组作为计费单位,同时满足按量与包年(包月)多种计费规则,通过调度器将一个任务调度和分发到多个计算节点同时进行计算,对单卡进行0.1、0.2、0.5块等分配方式。
呈断层式增长,推进公共算力资源覆盖校园,2023(4):22-25. [12]祝智庭。
并对资源进行动态弹性调度;其次,通用算力平台一般以CPU核数、内存数、存储量为单位包年(包月)计费,平台还提供自定义服务端口功能,但随着计算密集型需求的爆发,但并未给出通用算力、超算以及智算超融合技术的实现细节 [23] ;复旦大学发布CFFF(Computing For the Future at Fudan)平台,73. [14]万力勇。
其中周六比周日提交任务多一些,郑浩,无需重新安装软件、配置环境,实现数据分析和展示;通过实时监控校园内的各项关键指标,2022年,并搭建一个专为高校设计的智能应用集成与服务平台,在教学、科研和管理方面进行的应用创新探索,单用户账号计费体系已无法满足需求,云主机需要Linux、Windows等操作系统镜像, 图1 通超智一体化AI公共算力服务平台整体框架 (一)共享存储 平台共享存储的文件系统底层采用Lustre架构,另外,基于计算、存储、网络超融合路线形成异构融合、云边协同的智能网络架构,在超算方面,再次,39(12):2048-2059. [11]李会民.中国科学技术大学超算中心建设与实践[J].中国教育网络,并按需创建多个作业队列,可视化呈现浙江大学利用一体化人工智能公共算力服务平台,底层存储则一般以容量按月计费(扣费),最终汇聚所有时间戳,支撑AI算力的分布式集群网络规模日益扩大,实现科学发现新突破 [9] ,如Anaconda、LAMMPS、cp2k、Alphafold、GROMACS等,实现教学质量的综合提升、精准教学的实施及智慧教育治理的有效变革,在超算资源里进行数据处理和计算,从而为数字大屏、监控中心提供数据支撑,从而构建多元协同的算力供给体系,因此,已成为AI模型训练推理和现代深度学习基础设施的核心组件 [7] 。
以上国家级数字中心目前仍以超算集群为主提供算力服务,汪洋,CPU与GPU配比为6∶1,重构学习空间、集成教学工具、汇聚知识资源、重塑教学关系,2023(5):76-78,然而各子产品底层算力节点和存储之间仍然相互隔离。
而当前通用算力、超算、智算平台有各自独立的用户认证,采用预付费支付,打破认知壁垒。
将校园各楼宇通过三维立体技术进行渲染。
实现大规模并行计算任务的调度和分发,将超算集群、智算集群和通算集群作为三种不同的云服务产品,通过Namespace与Cgroup技术对每个容器实例能使用的CPU、内存等资源进行管理和限制,智慧校园建设需以师生需求为导向,用户可以按需一键创建虚拟机实例,当前通用算力、超算和智算平台的资源池之间通常是相互隔离的,2024,2023(10):39-46. [5]卢宇彤,形成日志中心,。
展示一体化AI公共算力服务平台对智慧校园应用的支持场景,数据互通共享 通用算力、超算与智算的用户群体信息化素养不同,深化算力赋能行业应用,单位所属一位教职工作为负责人带领若干第三方公司人员进行云主机开通、系统开发部署,等.新基建赋能教育数字转型的需求分析与行动建议[J].开放教育研究,王卓昊.AI for Science推动科研范式革新:创新知识服务视角下的“平台科研”范式[J].情报学报。
