长期以来,企业一直在数据管理领域面临诸多难题,从访问控制、安全防护到数据卫生等。如今,随着企业竞相引入AI技术,这些挑战被进一步放大——AI的成效高度依赖于坚实的数据基础。

“变化越多,不变越多,”安永全球首席创新官Joe Depa对CIO Dive表示,“数据一直是高管层关注的关键议题……而现在,这一议题正变得更加突出。”

尽管关注度持续且紧迫性增强,数据缺口依然存在。根据Gartner于2025年2月发布的一项调查,近三分之二的组织缺乏或不确定自身是否具备适用于AI的正确数据管理实践。

专家向CIO Dive指出,CIO可以通过识别关键缺口及最佳弥补方式,帮助企业避免浪费性支出和试点项目失败,从而及时纠偏。但首先,企业应评估现有实践、让领导层参与并规划前进路径。

“挑战在于真正理解需要何种类型的数据,并能够使这些数据可用,”EG America首席数字官兼国内CIO Sorin Hilgen表示,“我认识的人中没有人会说‘是的,我们的数据已经完美就绪,可以开始了。’”

EG America是美国按门店数量计算的第五大便利店零售网络,旗下拥有Cumberland Farms和Kwik Shop等品牌。该公司一直致力于加速数字化转型,其中AI扮演着核心角色。

为缓解数据挑战,该公司依赖Databricks和Quorso等供应商。Hilgen表示:“AI对数据的需求极大。我们正在确保从各种内外部系统向AI平台提供准确的数据流,以便其能够妥善消费。”

这家零售商希望AI能够通过连接多种数据集,帮助优化门店的货架和空间布局,并预测供应需求。“我们仍处于早期阶段,”Hilgen说,但系统将需要访问本地活动、天气和人口统计数据等。例如,靠近少年棒球联赛的门店会增加水订单以应对客流,而犹太社区的门店则会增加犹太洁食选项。如果暴风雪来临,门店可增加牛奶供应。

数据卫生、管理和访问对于这些用例至关重要。无论行业如何,技术高管们都在就强化数据战略进行类似讨论。Aflac执行副总裁兼CIO Shelia Anderson在3月CIO Dive线上活动中表示,实际操作可能比最初预期更困难。

“当你开始看到数据质量——或数据质量的缺失——时,可能会让你有所退缩,因此你必须花一些时间处理数据质量问题,以确保能够获得所需的结果,”Anderson说。

组织常犯的错误

分析师指出,即使初衷良好,技术领导者及其企业往往以错误的方式强化数据战略。

Gartner研究发现,组织在考虑AI就绪数据时,通常优先考虑三个标准:治理、质量和性能。“我不会说这不正确,但他们最后想到的两个标准是血缘和数据多样性,而这两者对AI至关重要,”Gartner高级总监分析师Roxane Edjlali表示。数据缺乏多样性会导致输出中的偏见。

“想象一下,你正在训练一个简历筛选模型,”Edjlali说,“如果你只选择男性提交的简历,那么当收到女性简历时,就会出现数据偏见。”

理解数据血缘同样关键。“当我们审视企业犯下的许多失误或错误步骤时……他们往往无法清晰理解用于训练AI的数据模型是什么,”Data & Trust Alliance高级政策总监Kristina Podnar对CIO Dive表示,“我们此刻不能冒险的是,组织无法解释数据的来源。”

Data & Trust Alliance于2024年7月发布了数据溯源标准1.0.0版,按来源、溯源和使用分组。该标准由包括Nike、Walmart、American Express和Pfizer在内的19个成员组织共同制定,旨在建立统一方法,提高数据集透明度,并增强数据及其所用AI的信任与完整性。这些标准源自15个不同行业的用例,并由CTO、数据主管和其他领导者团队综合、完善和验证。

为促进采用,该联盟上个月与开源和标准组织OASIS Open合作成立了技术委员会。包括Cisco、IBM和Microsoft在内的五家技术供应商联合赞助了该委员会的启动。

“我们已经将这些标准提升到基线水平……但我们需要向配方中加水、混合,并真正开始烘焙松饼,”Podnar说。该组织表示,标准化溯源协议并开发自动化验证流程的工具将带来更好的管理。

“这将使这项工作区别于历史的数据治理努力,因为它不仅关乎我能告诉你什么……更关乎如何做,”Podnar说。

企业目前正面临对数据就绪含义的广泛误解。Gartner表示,未能认识到AI就绪数据要求与传统数据实践之间巨大差异的组织,正在危及AI项目的成功。

“你不可能一劳永逸地构建它,”Edjlali说,“你不能说‘哦,我们要制定数据战略,一旦实施并实践,所有数据就都AI就绪了。’事实并非如此,因为它高度依赖于你的AI用例和所使用的AI技术。”

纠正航向

无论组织当前的数据实践偏离多远,CIO都可以通过分步骤的方法帮助纠正方向。

“即使你从现在开始只采用良好实践,然后审视历史数据、确定优先级并逐步纳入,这也是将船转向正确方向的好方法,”Podnar说,“否则,操作会变得非常繁琐。”

方向明确的组织也更容易实现目标。Edjlali举例说,一个基础AI模型需要干净的数据和少量异常值才能正确预测。但如果组织想训练一个用于异常检测的模型,技术专家应包含异常值,否则模型将无法识别它们。

过去,组织担心的是数据量是否足够,而现在焦点已转向拥有正确类型的数据。

企业还可以考虑利用AI来支持更好的数据实践,Depa建议。例如,安永使用合成数据来试验数据集,同时降低合规风险。“我们相信,这对于未来建立数据基础将变得越来越重要,”Depa说。