存储评论网

播客第148期:LinkedIn直播——人工智能是一个数据问题

企业版

StorageReview 发表了多篇评论文章和一个播客节目,这些文章和播客节目均基于俄勒冈州立大学的研究成果。您可以在本文档底部找到这些文章的链接。这些文章不仅在研究领域引起了广泛关注,也在供应商群体中引起了广泛讨论。随后,讨论扩展到教育工作者如何在课堂和考试中使用和追踪人工智能,重点关注他们如何衡量知识和学习质量。

讨论的重点是所有这些技术如何结合起来创造真正的 AI 成果,不仅在科学研究领域(我们将深入探讨),而且在俄勒冈州立大学的学生成果方面,以及这些组成部分如何结合起来创造非凡的解决方案。

鉴于与克里斯托弗·沙利文 (Christopher Sullivan) 共同进行的初步评估获得了热烈反响,我们决定举办一场 LinkedIn 直播活动,探讨人工智能在研究和教育领域的最新进展。我们的嘉宾包括:

  • 克里斯托弗·沙利文——俄勒冈州立大学地球、海洋和大气科学学院研究和学术计算主任。
  • Alan Bumgardner – Celadon Corporation 副规划和路径规划总监。
  • Seamus Jones – 戴尔公司计算、网络和可持续发展技术营销工程总监。

本次线上活动的参与者都曾参与俄亥俄州立大学的浮游生物研究,他们或是直接参与(例如 Chris),或是担任供应商相关角色。如果您还没有阅读过之前的报道或收听过后续播客,您会发现这项研究既有趣又与当今的环境议题息息相关。

虽然活动持续一小时,但没有任何营销或销售宣传,而且互动性强,内容丰富。如果您没有时间从头到尾收听播客,我们已将其分成五分钟的片段,方便您跳转到感兴趣的部分。

00:00–05:00 — 引言和背景介绍

  • Brian Beeler 首先进行了一场技术性的、不涉及销售的讨论,重点介绍了俄勒冈州立大学在研究和教育领域人工智能的实际成果。
  • 小组介绍环节旨在确立跨领域的专业知识,涵盖学术计算、存储创新和企业基础设施。
  • 俄勒冈州立大学的使命是:通过人工智能推进科学研究,同时提高学生的参与度。
  • 克里斯·沙利文强调了长期以来将研究与学术 IT 联系起来的参与,并着重强调了新兴技术的实际应用。
  • 早期框架将人工智能定位为以数据为中心的挑战,而不是纯粹的计算问题,为本次会议定下了基调。

05:00–10:00 — 数据规模和人工智能工作负载的现实

  • 大规模科学工作,例如浮游生物成像,每次实验都会产生数百TB的数据,需要快速处理。
  • 训练只占总工作量的一小部分;推理才是主要工作量,而且规模巨大,通常涉及数十亿个数据点。
  • 时间相关性决定了基础设施需求,因为延迟的见解会降低科学价值。
  • 持续的反馈循环将推理结果整合回训练模型,随着时间的推移提高准确率。
  • 模拟工作负载仍然至关重要,它们为人工智能管道提供数据,并进一步扩大计算需求。

10:00–15:00 — 边缘人工智能和基础设施灵活性

  • 从集中式训练集群转向边缘分布式推理,包括在船舶和远程环境中部署。
  • 灵活的平台,例如配备高容量 SSD 的高密度 GPU 服务器,可以实现多环境部署。
  • 高密度存储允许在本地处理 PB 级数据集,从而减少对集中式数据中心的依赖。
  • 实时处理能够实现自适应数据采集,从而提高效率并降低运营成本。
  • 边缘推理为加固性、可扩展性和模块化引入了新的设计考虑因素。

15:00–20:00 — 企业人工智能演进与GPU利用率

  • 行业正从早期人工智能投资侧重于训练转向广泛的推理驱动部署。
  • 传统企业应用正在向人工智能方向发展,利用GPU来提升性能。
  • 随着基于代理和多步骤人工智能流程的日益普及,令牌的使用和工作流程的复杂性显著增加。
  • 基础设施的设计必须能够应对突发性、不可预测的工作负载,而不是满足稳定状态的需求。
  • 即使是初始部署,规划可扩展性和未来增长也至关重要。

20:00–25:00 — 数据管理和 RAG 挑战

  • 数据可访问性成为主要瓶颈,由于元数据和可发现性差,大型数据集往往未得到充分利用。
  • 检索增强生成需要有意义的元数据,而不仅仅是文件级属性。
  • 科学和企业环境在理解和利用存储数据方面面临着类似的挑战。
  • 冗余数据集和缺乏可见性凸显了当前存储实践的低效性。
  • 有效的数据管理被认为是释放人工智能价值的基础。

25:00–30:00 — 教育中的人工智能和安全数据处理

  • 俄勒冈州立大学采用人工智能驱动的学生评价系统,利用视频提交和自动化评估。
  • FERPA 合规性和数据隐私要求驱动着本地基础设施决策。
  • 高容量本地存储能够安全地处理大量学生生成的内容。
  • 系统必须支持跨多个课程和时间段的持续摄取、处理和保留。
  • 人工智能能够实现可扩展的学生反馈,而不会增加教师的工作量。

30:00–35:00 — 云端部署与本地部署及代币经济学

  • 云成本和令牌消耗的不断上涨正促使工作负载(尤其是推理工作负载)回归本地。
  • 代币经济学成为一项关键的运营考量因素,尤其是在预算受限的学术环境中。
  • 混合策略应运而生,利用本地资源进行实验,利用云资源执行有针对性的高价值任务。
  • 查询优化和词元缩减技术对于成本控制至关重要。
  • 数据主权和合规性方面的考虑进一步强化了本地部署的趋势。

35:00–40:00 — 模型优化和分层人工智能架构

  • 分层模型策略利用较小的、专门的模型来处理常规任务,利用较大的模型来处理复杂的查询。
  • CPU 和 GPU 的协同工作能够提高跨工作负载的资源利用效率。
  • 本地部署系统允许进行迭代实验而无需承担成本损失,从而提高工作流程效率。
  • 缓存和内存优化可以减少重复计算,提高性能。
  • 未来的架构将越来越多地实现模型选择和编排的自动化。

40:00–45:00 — 基础设施智能和运营人工智能

  • 人工智能正被嵌入到基础设施管理中,从而实现预测性监控和自动修复。
  • 本地部署的人工智能代理监控校园系统,在故障影响运营之前识别故障。
  • 规模较小、目标明确的模型在作战情报应用案例中已被证明是有效的。
  • 硬件技术的进步,特别是GPU技术的进步,带来了性能的快速提升和效率的提高。
  • 电力限制正在影响系统设计,效率优先于规模。

45:00–50:00 — 电力、冷却和数据中心设计

  • 功率密度和散热现在是人工智能基础设施部署的主要限制因素。
  • 与风冷相比,液冷能够实现更高的性能、更低的噪音和更高的能源效率。
  • 对现有数据中心进行液冷改造是可行且经济高效的。
  • 存储效率的提高使得更多的电力可以分配给计算资源。
  • 冷却技术的创新,包括冷板冷却和浸入式冷却,显著降低了总能耗。

50:00–55:00 — 性能提升和实际部署

  • 液冷不仅可以提高效率,还可以通过BIOS调校实现更高的持续性能。
  • 降低声学影响使得人工智能系统能够在非传统环境中部署。
  • 大学和企业可以通过节约能源和提高性能获得可观的投资回报率。
  • 冷却策略的选择需要在复杂性、成本和运营目标之间取得平衡。
  • 实际应用验证了先进冷却方法的性能优势。

55:00–结束 — 采用策略和人工智能民主化

  • 降低准入门槛至关重要,而本地沙箱环境能够实现无风险的实验。
  • 与供应商和独立软件开发商建立合作关系对于集成硬件、软件和工作流程至关重要。
  • 硬件租赁系统等项目允许组织在正式部署之前测试人工智能基础设施。
  • 预先验证的软件堆栈简化了部署,加快了价值实现速度。
  • 广泛采用取决于让规模较小的机构能够从小规模开始,快速迭代,并根据需要进行扩展。

以下是与俄勒冈州立大学开展的研究相关的先前文章的链接。

人工智能在海洋中的应用:俄勒冈州立大学扬帆起航,实时研究海洋
第145期播客:为什么边缘人工智能很重要(俄勒冈州立大学)
Metrum AI 和俄勒冈州立大学如何构建学术评估新标准

参与 StorageReview

电子报| YouTube | 播客iTunes / Spotify | Instagram | Twitter | TikTok | RSS订阅

哈罗德弗里茨

自 IBM 创建 Selectric 以来,我一直在科技行业工作。 不过,我的背景是写作。 因此,我决定退出售前业务,回归本源,从事一些写作工作,但仍从事技术工作。