分析:AI 数据增长已超过算力规划,存储正成为加密基础设施的新瓶颈
分析:AI 数据增长已超过算力规划,存储正成为加密基础设施的新瓶颈
在过去两年里,AI 基础设施的讨论几乎都被一个指标主导:GPU 容量。无论是 Web2 还是 Web3,团队都在争夺加速器访问权限、优化模型训练流水线,并寻求更便宜的推理方案。但有一个更安静的约束正在变得越来越难以忽视:数据存储。
Western Digital 近期的分析认为,AI 数据中心规划正从单纯的算力竞赛,转向一个更广泛的基础设施问题——在这个问题里,存储容量、性能、能耗和生命周期管理与 GPU 同样重要。IDC 也预测,到 2030 年,全球年度数据生成量可能达到 718 ZB,这进一步凸显了 AI 数据足迹增长的速度之快。
对于区块链和加密行业而言,这不仅仅是云基础设施问题。AI 智能体、链上分析、去中心化物理基础设施网络、去中心化存储、数据可用性层,以及合规工具,都依赖于一个不断扩大的机器生成数据宇宙。如果存储成为 AI 的限制因素,它也将重塑加密应用的构建方式、定价方式、安全方式和治理方式。
为什么 AI 数据不会在计算后消失
传统的算力规划通常假设:数据被处理、结果被生成,然后系统继续前进。AI 并不是这样运作的。
现代 AI 系统会持续积累以下内容:
- 原始训练数据集
- 清洗和标注后的数据
- 模型检查点
- 向量数据库
- 向量索引
- 提示词和响应日志
- 评估记录
- 微调数据集
- 推理轨迹
- 安全与合规审计日志
在加密应用中,这些数据可能会变得更加复杂。一个 AI 交易助手可能需要历史市场数据、钱包活动模式、订单簿快照、代币元数据、治理讨论、风险信号以及智能合约交互记录。一个链上安全系统可能会归档交易图谱、漏洞利用特征、钓鱼域名、合约字节码,以及事件发生后的取证数据。
关键在于,这些信息并不是临时性的。它们会成为模型改进、风险审查、监管报告和用户保护反馈循环的一部分。一旦 AI 系统被部署到金融环境中,过于激进地删除运营数据会削弱可审计性,并降低模型质量。但如果什么都保留,经济上又很快难以持续。
这就是为什么 AI 存储规划正从后台事务,变成一项战略性的基础设施决策。
加密行业也有自己的 AI 存储问题版本
加密建设者早已明白,数据可用性和持久性并不是抽象概念。公共区块链在某种意义上就是数据系统,只不过它们对复制、验证和状态转换有着严格规则。但 AI 引入了新类别的数据,这些数据更庞大、结构更松散,而且往往更难验证。
来看几个快速增长的领域。
AI 智能体需要记忆,而不仅仅是钱包权限
AI 智能体正越来越多地被讨论为未来加密市场的参与者。它们可能监控 DeFi 仓位、重新平衡投资组合、检测可疑交易,或根据用户设定的策略与智能合约交互。
但没有记忆的 AI 智能体是有限的。它需要上下文:过去的指令、风险偏好、之前的交易、执行结果、失败尝试,以及来自用户的反馈。这就产生了必须被安全存储并有选择性检索的持久化数据。
挑战不仅在于把这些记忆存到哪里,还在于谁来控制它。如果智能体的运行历史被锁定在一个中心化服务里,用户可能会失去可移植性和透明度;如果存储不当,隐私风险会上升;如果完全放在链上,成本和数据暴露又会变得不可接受。
链上分析正变得数据密集化
区块链分析本就需要索引海量的交易、地址、合约和事件。加入 AI 之后,存储需求又会进一步增加。模型可能会为地址生成嵌入向量,对钱包行为进行聚类,对智能合约进行分类,并维护用于欺诈检测的历史标签。
这一点尤为重要,因为监管机构和金融机构都在要求对数字资产流动进行更严格的监控。诸如 FATF 关于虚拟资产的指引 之类的框架,已经推动服务提供商加强合规控制;与此同时,用户仍然期待隐私和自我托管。要在这些目标之间取得平衡,需要精心设计数据架构,而不仅仅是增加算力。
去中心化存储和 DePIN 可能受益,但前提是经济模型成立
随着 AI 数据规模增长,对去中心化存储和 DePIN 系统的需求可能会增强,尤其是在归档数据集、开源模型资源、研究记录以及公共 AI 评测数据方面。专注于存储、检索和数据可用性的网络,可能会随着 AI 团队寻找替代中心化云依赖的方案而获得新的应用场景。
不过,AI 存储并不是单一市场。热训练数据、实时推理日志、长期归档和公共数据集有着不同的要求。有些需要低延迟访问;有些需要低廉的每 TB 成本;有些需要密码学验证;还有一些需要访问控制和删除策略。
这意味着,去中心化基础设施不能只靠理念竞争。它必须在性能、定价、可靠性和开发者体验上都具有可信度。
数据可用性层也是同一场讨论的一部分
在区块链扩容中,数据可用性已经成为一个重要的设计重点。以太坊通过 EIP-4844 引入的 proto-danksharding 升级,通过创建专门的 blob 交易格式,降低了发布 rollup 数据的成本。模块化区块链项目也将数据可用性视为核心层,而不是实现细节。
AI 基础设施不同于 rollup 基础设施,但其底层教训是相似的:数据传输和保留成本可能主导系统设计。
对于 rollup 来说,问题是:交易数据能否以足够低的成本提供,以便进行验证?
对于 AI 来说,问题是:训练记录、推理日志、嵌入向量和审计轨迹能否被高效存储和检索,从而支持持续的模型改进?
在这两种情况下,如果将数据视为次要问题,系统就会失效。
从 GPU 数量转向数据全生命周期成本
仅仅关注 GPU 利用率,可能会掩盖 AI 部署的长期成本。更成熟的衡量指标不只是「有多少 GPU 可用」,而是组织对数据生命周期各阶段的管理效率有多高。
对于构建 AI 驱动产品的加密公司而言,相关指标包括:
- 每 PB 留存数据的成本
- 存储能耗
- 故障后的恢复时间
- 模型训练和推理的延迟
- 数据完整性保障
- 保留与删除策略
- 加密与访问控制
- 敏感金融工作流的可审计性
例如,一个 DeFi 风险引擎不能只依赖快速推理。它还需要历史市场数据、清算记录、预言机更新、协议参数变更以及钱包行为模式。如果获取这些数据变得缓慢或昂贵,即便模型本身很强大,系统的实用性也会下降。
同样,交易所或托管平台若使用 AI 进行欺诈检测,也必须保留足够的证据来解释告警并复核过往决策。存储设计会直接影响调查质量和用户保护能力。
为什么分层存储对 AI 和 Web3 很重要
随着 AI 数据集从 TB 级增长到 PB 级,并最终达到 EB 级,没有一种存储架构能够满足所有用途。企业越来越可能采用分层存储策略。
一个实用的 AI 与加密数据栈可能如下所示:
- 用于活跃模型训练、特征生成和实时推理的高性能闪存存储
- 用于大型历史数据集和低频访问的高容量 HDD 系统
- 用于日志、归档、模型工件和合规记录的对象存储
- 用于公共数据集、可验证归档或抗审查资源的去中心化存储
- 用于证明、哈希、权限或结算逻辑,而非原始数据的链上承诺
这种分层方式很重要,因为区块链并不是为直接存储大规模 AI 数据集而设计的。在很多情况下,更好的模式是将大体量数据保留在链下,同时将完整性证明或访问权限锚定在链上。
这种架构既能支持可验证性,又不会让每个节点都承担不必要的存储负担。
安全视角:AI 数据本身也是攻击面
AI 系统存储的数据越多,对攻击者的吸引力就越大。
对于加密货币用户来说,这一点尤为重要,因为 AI 基础设施可能包含钱包行为、交易意图、身份验证记录、投资组合数据和安全告警等敏感信息。一旦泄露,这些数据可被用于钓鱼、社会工程、定向诈骗或市场操纵。
与钱包交互的 AI 智能体还会引入另一层风险。如果智能体不安全地存储提示词、权限和交易历史,攻击者可能据此推断出如何诱使系统签署恶意交易。
这正是自我托管原则依然至关重要的原因。AI 可以辅助决策,但私钥应始终由用户掌控。像 OneKey 这样的硬件钱包有助于将签名权限与在线 AI 工具和应用程序隔离开来。随着越来越多用户尝试自动化工作流、DeFi 仪表盘和由 AI 驱动的交易助手,这种隔离尤为重要。
可验证的 AI 需要可验证的数据
AI 与加密货币之间最重要的交叉点之一,就是可验证性。用户可能希望知道某个 AI 模型是否使用了声称的数据集,某次推理结果是否由特定模型生成,或者某个交易智能体是否遵循了预定义规则。
这正是密码学技术、零知识证明、可信执行环境和去中心化身份可能发挥作用的地方。但如果底层数据管理不善,这些方法都难以有效运作。
NIST AI 风险管理框架强调了 AI 系统的治理、度量和风险控制。在加密领域,由于交易不可逆以及市场条件具有对抗性,这些问题会被进一步放大。更好的存储架构不仅关乎成本,更关乎问责。
未来的 AI 驱动 DeFi 协议可能需要证明:
- 是哪个模型版本生成了某个推荐
- 训练或评估使用了哪个数据集
- 历史日志是否被篡改
- 是否尊重了用户权限
- 某项自动化操作是否符合已签署的策略
这一切都依赖于可靠的数据保留、完整性检查和访问管理。
构建者现在该做什么
将 AI 集成到加密项目中的团队,不应把存储当作后期优化再考虑。早期做出的决策,可能决定产品未来是否能够保持可扩展性和可信性。
一个实用的检查清单包括:
-
在扩展 GPU 使用之前,先梳理完整的 AI 数据生命周期
确认训练、推理、监控和用户交互过程中会产生哪些数据。 -
将热数据、温数据和冷数据分开
并非每个数据集都需要高速访问。只在能带来可衡量价值的地方使用高性能存储。 -
在不过度占用区块空间的前提下锚定完整性
将大规模数据存放在链下,但在需要可验证性时,可以考虑使用链上哈希、证明或承诺。 -
从一开始就围绕隐私进行设计
提示词日志、钱包元数据和行为数据都可能变得敏感。尽可能减少收集。 -
保护签名权限
AI 系统可以提出操作建议,但私钥不应暴露给联网代理或云环境。 -
将存储经济性作为产品指标进行跟踪
应将每个保留数据集的成本、检索延迟和恢复效率,与计算资源利用率一起监测。
结论:下一个 AI 瓶颈将是加密领域的机会
AI 基础设施正在进入新阶段。市场正在认识到,GPU 并不能单独定义能力。数据存储、检索、能源效率、可审计性以及生命周期管理,正在成为核心竞争因素。
对于加密行业而言,这一转变尤其相关。区块链围绕可验证数据构建,而 AI 会产生大量链下上下文,这些内容必须被智能地存储、保护,并与链上系统连接起来。最终的赢家不会只是算力最多的团队,而是能够将数据作为长期资产进行管理的团队。
随着 AI 代理、DePIN 存储、链上分析和可验证计算持续演进,用户也应记住一条基本安全原则:自动化不应取代密钥控制。如果 AI 工具成为你加密工作流的一部分,将私钥保持离线,并使用如「OneKey」这样的硬件钱包,有助于维持智能辅助与不可逆授权之间的边界。



