存储评论网

第145期播客:为什么边缘人工智能很重要(俄勒冈州立大学)

企业版

如果您经常关注 StorageReview,可能已经实时看到了关于俄勒冈州立大学海洋研究的报道。我们采访了俄勒冈州立大学研究与学术计算主任克里斯·沙利文,以更好地了解技术如何帮助研究人员研究海洋生物,以及这对全球环境有何影响。

布莱恩在SC25大会上与克里斯会面,进一步探讨了这个话题。我们很少报道科技在现实世界中的应用,比如俄亥俄州立大学的浮游生物研究,所以这次专题报道和播客给了我们这样的机会。

布莱恩和克里斯在讨论俄勒冈州立大学正在进行的研究时,对科技进步如何支持海洋研究的进展感到由衷的兴奋。克里斯在俄勒冈州立大学工作超过24年,并在过去三年担任生物计算主任。

这段现场播客展现了克里斯对科学技术的热情。他称SC25为“糖果乐园”。

这是一场生动而坦诚的讨论(带有一些幽默),它真正深入地探讨了研究如何利用技术来提供实时结果。

这是一个值得一听的短播客,但如果您时间紧迫,我们提供了文字稿,您可以直接跳转到最相关的部分。

0:00 - 5:00

将科考船改造成一艘漂浮的超级计算机

俄勒冈州立大学的克里斯·沙利文解释了新技术如何从根本上改变海洋科学的开展方式,特别是大规模浮游生物研究,这些研究基本上都是在小型漂浮数据中心的船上进行的。

  • 科技不仅仅是“炫酷的装备”;它直接改变世界。 科学的可能性 以及结果中存在的偏差程度。
  • 科学偏见:样本有限或存在偏差导致结论不准确;解决方法是 更多数据点 在更多地点。
  • 目标:收集庞大、多样化的数据集,以避免仅对一个地点或一组条件进行抽样而导致统计分析出现偏差。
  • 传统的高性能计算配置迫使人们做出权衡:容量有限的快速本地 NVMe/SSD 与容量大但速度较慢的一流存储系统。
  • 对于大型实验,Chris 不得不依赖集群中的一级存储,因为节点上的(零级)存储太小,无法容纳海量数据集。
  • 为了给 GPU 提供足够的存储空间,大型共享存储“超级舱”变得必不可少,但它们价格昂贵,而且在野外或海上部署并不现实。

5:00 - 10:00

海洋机器人、浮游生物和百万美元游轮之旅

本节深入探讨船上实际发生的事情——他们如何拖曳仪器、捕获惊人的图像数据,以及为什么当船舶航行时间每次 10 天航程的成本约为 1 万美元时,半实时处理至关重要。

  • 这艘由美国国家科学基金会资助的新型研究船,建造得像一艘“迷你版星际迷航企业号”,船上装满了各种技术设备,在一艘 200 英尺长的船上铺设了大约 200 英里的电缆。
  • 之前,克里斯不得不滚动他的 将计算硬件安装到船上,在走廊里铺设光纤,然后在没有合适的船载数据中心的情况下运行。
  • 浮游生物系统:一个拖曳装置以 5 节的速度在水中上下移动,每秒抽取约 162 升水,并生成约 10 GB 的图像数据。 每分钟.
  • 一次为期 10 天的浮游生物实验:约 100 TB 的原始数据;经过处理、分割和分类后,可用数据量扩展至约 300-400 TB。
  • 他们必须以半实时的方式处理这些数据;否则,一艘价值 1 万美元、为期 10 天的游轮可能会带着错误或无用的数据返回,并且没有机会改变游轮的航线。
  • 浮游生物大多受洋流摆布(它们游泳能力不强),但它们至关重要:地球上约 50% 的氧气,约 25% 的碳汇,全球人均食物的约 17%,以及海洋食物网的基础。

10:00 - 15:00

海洋和森林中的边缘人工智能

关注点从船舶转移到更广泛的“边缘”问题:如何将计算推向数据产生的地方——在船上、护林站以及遍布自主传感器的森林中。

  • 新型高容量固态硬盘系统使他们能够构建 true 零级数据存储在单个设备上:存储数百 TB 的数据,进行半实时处理,并且永远不再移动数据。
  • 早期使用较小 NVMe 驱动器进行的测试需要不断卸载数据以腾出空间,这消耗了宝贵的 IO 带宽,并减慢了科学研究的速度。
  • 船上基本上没有专门的 IT 人员;只有一个人负责运行船上的系统,并且不参与实验,所以研究生和博士后必须自己管理硬件和流程。
  • 这就产生了一个设计要求:简单、稳健的管道和自包含的设备——没有脆弱的阵列、挂载点和卷网络。
  • 在森林边缘(例如猫头鹰项目),他们运行了约 5,000 个自主录音单元,仅凭声音就能识别约 130 种鸟类。
  • 痛点在于:仍然需要人工去收集SD卡;等到数据返回时,大部分时间价值已经消失。边缘处理旨在提取这些洞察。 立即 在捕获点。

15:00 - 20:00

为作业匹配合适的GPU和存储

在这里,他们详细阐述了 GPU 策略、基于 Omniverse 的训练,以及为什么大容量闪存对于人工智能和科学可视化来说与原始计算同样重要。

  • 克里斯强调使用 正确 GPU 的选择:大型、昂贵的加速器(例如 H100/Hopper,“蚱蜢”)应该专注于训练,而像 RTX 6000 这样的更具成本效益的显卡则处理大规模推理。
  • 从历史上看,存在着混乱:重叠的 GPU SKU 太多,“泳道”不清晰,以及在简单的推理上浪费了大量资金购买过剩的硬件。
  • RTX 6000 系列显卡赋予它们双重角色:高性能推理以及数据中心专用 GPU 所缺乏的图形和渲染能力。
  • 他们正在构建这艘飞船的Omniverse数字孪生体,目的是:
    • 船舶航行期间,通过线上方式培训学生和博士后。
    • 在狭小、移动的空间内规划物理布局和设备装载。
    • 避免将宝贵的舰船时间浪费在基础训练和反复试验的设置上。
  • 在航行的船上,任何带有运动部件的东西都存在风险;固态存储因其可靠性和弹性而成为首选。
  • 小功率封装的高容量固态硬盘可以释放电力预算,用于更多 GPU,减少对独立阵列的需求,并缩小硬件总占用空间。

20:00 - 25:00

从文件柜到光纤连接的海洋

从更宏观的角度来看,廉价存储如何开启了现代人工智能,海洋观测站如何将数据传输到岸上,以及网络和存储如何共同推动新型科学的发展。

  • 克里斯认为,人工智能真正的突破点不在于新的数学——大多数模型可以追溯到20世纪50年代到70年代——而在于…… 廉价硬盘 20 世纪 90 年代,数据从文件柜转移到可搜索、可计算的介质上。
  • 在“文件柜时代”,他们拥有大量数据,但却“信息匮乏”——没有搜索功能,没有冗余备份,也没有可扩展的处理能力。
  • 处理速度和数据可用性之间一直存在着一场军备竞赛;如今,大容量固态硬盘的出现再次打破了这种平衡,为现代 GPU 提供了更多的数据。
  • 俄勒冈州立大学是海洋观测计划 (OOI) 的网络基础设施牵头单位,该计划是由美国国家科学基金会 (NSF) 和伍兹霍尔海洋研究所 (WHOI) 共同资助的十亿美元项目,利用滑翔机、浮标和海底支架来传输海洋数据。
  • 它们存储着约 9 PB 的海洋海洋信息数据,光纤骨干网通过 Link Oregon 从 200 Gbps 升级到 400 Gbps,从而实现了从海洋到数据中心的实时数据传输。
  • 即使船上和陆地项目(如猫头鹰项目)都部署了 Starlink,卫星带宽和成本仍然限制了可以发送的数据量,因此他们正在测试 LoRaWAN 和其他网状网络,以便将数据推送回一个与 Starlink 连接的护林站。

25:00 - 27:52

企业经验教训:您的数据中心就是边缘

对话最后将这些研究成果应用于企业,并重点介绍了克里斯会从展会现场“偷走”的硬件。

  • 给企业的核心信息:如果不在边缘进行处理,就会浪费时间和人力来回传输原始数据,并错失实时处理的机会。
  • 边缘人工智能和代理应在本地进行预处理、过滤和分析,从而将人力从物流转移到更高价值的任务和决策中。
  • 现实世界的类似例子:
    • 零售业利用边缘分析技术在商店中跟踪客流量、提出建议并提供动态体验,这与林业利用边缘推理技术在保护濒危物种的同时进行伐木作业非常相似。
    • 渔业部门希望使用“智能蟹笼”和浮标,这样只有当蟹笼里真的有螃蟹时,他们才会派出渔船。
  • 对克里斯来说,理想的模式是建立在本地的数据中心,这些数据中心会变成 边缘 集成云技术的设施,可用于大规模训练和长期工作负载。
  • 展会上他最喜欢的硬件是戴尔的 PowerEdge 7745;他希望为 VR 实验室和现场部署购买更多这样的服务器,因为它们在性能和占地面积、灵活性和功能(渲染 + 推理 + 边缘计算)之间取得了合适的平衡。
  • 他认为像 7745 这样的系统是模板:足够灵活,可以在数据中心或恶劣的现场条件下运行,既支持传统的高性能计算,也支持边缘的高级人工智能/可视化。

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。