2026年8月20日,致力于在复杂环境中将 AI 技术应用于数据的 Cloudera 宣布,Cloudera Data Engineering 现已依托 NVIDIA CUDA-X 库 cuDF,原生支持 Apache Spark 4.1的 GPU 加速。NVIDIA cuDF Apache Spark 插件将支持刚刚发布的 Cloudera Anywhere Cloud™,后者旨在帮助企业无需重写现有 PySpark 或 SQL 代码,即可加速 Spark 工作负载,从而助力数据团队更快准备好可供 AI 使用的数据,同时降低混合环境中的云基础设施成本。
随着企业不断扩大 AI 项目的应用规模,数据准备速度已成为一项关键挑战。大规模 Spark 工作负载通常需要数小时才能完成,不仅会延缓分析和 AI 应用的进程,还会推高云计算成本。通过将 GPU 加速能力直接嵌入 Cloudera Data Engineering,企业可以在无需修改代码或运维工作流程的情况下,继续使用现有 Spark 应用并显著缩短数据处理时间。
加速 Spark,赋能企业级 AI
Apache Spark 为当今众多企业数据管道提供了核心支撑。Cloudera Data Engineering 内置原生 GPU 加速能力,可帮助企业在提升性能的同时,满足生产级工作负载所需的安全与治理要求。通过将 NVIDIA cuDF 应用于 Spark 工作负载,相比传统 CPU 基础设施,Cloudera 依托 NVIDIA GPU 的计算能力,有望实现高达 4 倍的工作负载性能提升,帮助企业有效优化数据处理效率。
Cloudera Data Engineering 与 NVIDIA CUDA-X™库相结合,可提供以下能力:
无需修改代码,即可加速 Apache Spark 4.1工作负载
加快 ETL 流程和数据准备,为分析与 AI 提供支持
通过缩短计算运行时间,降低云基础设施成本
内置部署能力,无需手动配置驱动程序
通过 Cloudera Unified Data Fabric提供企业级安全与治理
在公有云、私有云、主权云和本地部署环境中保持一致性能
与仅限于单一云服务商的 GPU 加速方案不同,Cloudera 将这些能力扩展至混合环境,同时确保治理和运维的一致性。无论数据位于本地、云端还是边缘,企业都可以就地加速 Spark 工作负载,而无需牺牲安全性或灵活性。
加速数据管道,降低基础设施成本
快速且经济高效地准备可信数据,是开展数据分析和 AI 应用的关键。Cloudera 最新发布的《AI 时代的数据架构大重构》调查显示,绝大多数(84%)受访者表示,AI 工作负载导致基础设施成本上升。通过加速 Spark 数据处理,企业可以更快获得经过清洗、可直接用于模型的数据,从而在降低基础设施成本的同时,提高数据工程、AI 和分析团队的生产力。
Cloudera 首席产品官 Leo Brunnick 表示:“对于许多企业而言,制约 AI 发展的并非模型,而是能否快速将原始数据转化为可信且可用的洞察。在 Cloudera Data Engineering 中加速 Spark数据处理,有助于消除这一瓶颈,使客户能够更快地从数据准备迈向数据分析和 AI 应用,同时将治理、安全和运维一致性置于整体战略的核心。”
NVIDIA 战略企业合作伙伴副总裁 Pat Lee 表示:“加速 AI 部署的有效路径,是与企业当前的运营方式相契合。随着 NVIDIA AI 基础设施和 CUDA-X 库原生集成至 Cloudera Data Engineering,企业无需修改任何一行 PySpark 或 SQL 代码,即可降低成本并显著加速Apache Spark 数据管道,将业务数据转化为支撑 AI 应用的坚实基础。”
Apache Spark GPU 加速能力将作为 2026 年 8 月 20 日在 EVOLVE Singapore 大会上宣布推出的 Cloudera Anywhere Cloud™的一部分,在 Cloudera Data Engineering 中提供。今年晚些时候举行的 NVIDIA GTC Berlin 和 Cloudera EVOLVE New York 大会上还将展示更多相关演示,并举办技术专题会议。