
由北京大学计算中心/北极星计算团队联合捷通智慧科技集团、清华大学张武生教授团队共同建设,是面向高校及科研机构打造的大型智慧超算平台。平台团队具备独立自主的超算平台规划、部署与持续运维能力,在长期实践中沉淀形成了 COS 集群系统(又称 PUS,Polestar Unified System)的完整建设与运营经验。依托该系统,团队可独立完成共享文件系统、归档文件系统、集群自动化部署、安全防护体系构建以及异构资源统一调度等核心能力建设,能够为大规模科学计算、人工智能训练及数据密集型科研任务提供稳定、高效、可扩展的算力支撑。
(一)特色
可以像操作文件一样操作系统;任意添加节点无需安装驱动系统等,同样可以快速恢复节点;智慧控制集群系统
(二)功能
1、集群整体:满足集群实际使用场景的单一映像集群操作系统一体机,整个集群各类节点无需安装本地操作系统,支持由映像服务节点驱动整个集群运行对集群节点的统一监控管理、作业调度(slurm)及计费功能。
2、操作系统支持:节点支持多版本Linux、windows操作系统同时工作,并可按需动态调配不同的节点集合启用基于不同操作系统版本的运行环境。
集群各节点的映像实现强一致性,各节点的操作系统,驱动程序,环境配置实现版本和设置的一致性。提供功能截图证明。提供功能截图证明。
由节点统一定义和生成主机名、配置IP地址,加载配置文件,并根据主机名对节点进行任意分组。可预定义规则并在线修改节点角色,可实现节点角色生效后自动切换。
计算节点具备裸机加电条件即可工作,无需在计算节点上安装任何系统软件和应用软件。在操作系统基础上自动实现内核映像定制和优化
3、程序安装简化:节点支持通过系统包管理工具(如yum,dnf,rpm等)安装软件包,选定集群中的映像服务节点或任意计算节点安装后,能实时在全集群节点中生效,无需手工配置进程进行同步。
4、集群安全:能够控制操作系统关键目录对工作节点只读/读写。具备高安全性。能够针对操作系统目录、内核映像文件设置安全保护措施,对病毒入侵提供防护,并能有效避免病毒植入。
节点在正常关机或非正常关机的情况下,均不会导致映像损坏,重新启动后可以自动加载映像并正常启动操作系统。
支持节点快速恢复,当节点感染病毒或者宕机,重启节点后集群能快速恢复,维修/更换计算节点的主板、操作系统盘后,无需任何手工操作即可使集群节点恢复到与原始版本完全相同的运行状态。更换节点主板/系统盘后,恢复节点正常工作状态的时间不超过10分钟
5、提供节点CPU、GPU内存实时使用情况、提供节点CPU、GPU和内存实时使用和温度曲线,可动态调整曲线显示的时间(数分钟到数月),实现柱状图和曲线图互相转换,实现命令行获取GPU信息
6*、支持根据作业和市电状况(需采购提供UPS、市电和模块)自动开关机,特别是存储,支持和机房互动(需采购模块或者485接入)。
*为新增功能
集群部署使用手册下载
集群操作手册下载
系统基础文件chenfgo.zip下载
二次开发命令bin.zip下载
见附件
(注意:如果有将参数作为投标文件,不要完全照抄,修改下文字表述,图片可以不修改,否则后果自负)