导语:🤖 当大模型从企业级工具升级为关键数字基础设施,“主权AI”也进入新的发展阶段。竞争焦点不再只是拥有多少芯片、建成多少智算中心,而是能否在国家层面统筹算力、数据、模型、能源与安全体系。与此同时,本土语料的合法来源、质量管理和文化适配,以及调用境外模型时可能发生的数据跨境传输,正成为政府、企业和开发者必须共同面对的新课题。
从“建设算力”走向“全国统筹”
过去,各地智算中心更多解决“有没有算力”的问题;如今,随着模型训练和推理需求快速增长,政策目标正在转向“算力能否跨区域、跨主体、跨架构高效调用”。国家发展改革委等部门发布的全国一体化算力网实施意见提出,统筹通用算力、智能算力和超级算力,推动东中西部协同布局,并加强算力、数据、算法及绿色电力之间的协同。换句话说,国家级算力体系不是简单增加服务器,而是要形成类似电网的资源调度能力。相关要求可参考全国一体化算力网实施意见。
这种转变能够缓解两个突出矛盾:一边是部分地区算力紧张、训练任务排队,另一边则可能存在设备利用率不足;一边是高实时性业务需要就近计算,另一边是离线训练、视频渲染和存储备份等任务具备跨区域迁移条件。因此,下一阶段的关键能力将包括统一标识、资源监测、任务编排、异构适配、网络传输和市场化结算,而不仅仅是数据中心建设规模。
国家级算力调度要解决三道难题
一是异构算力如何真正互联
不同芯片、框架和云平台之间存在接口差异,同一模型迁移到另一套环境后,可能面临算子不兼容、性能下降或重新适配等问题。国家级统筹需要建立统一的算力描述、任务接口和服务评价体系,让用户能够按时延、精度、成本及能耗选择资源,而不必逐一研究底层设备。⚙️ 对企业而言,也应减少模型对单一硬件和单一云平台的深度绑定,提前验证容器、推理引擎及模型格式的可迁移性。
二是算力调度如何兼顾网络与能源
算力可以远程调用,但数据传输并非没有成本。需要频繁交互的智能客服、工业控制和实时风控,通常更适合靠近业务侧部署;大规模预训练、批量推理等对时延不敏感的任务,则更适合结合网络条件与绿色能源供给进行跨区域调度。因此,合理路径不是把所有任务集中到少数节点,而是形成“中心训练、区域推理、边缘响应”的多层协同架构。
三是公共资源如何形成可持续服务
国家级算力平台既要支持科研机构和中小企业降低使用门槛,也要避免重复建设、低效补贴和资源闲置。可行机制包括按需计费、算力券、公共模型服务、任务撮合和透明化服务等级协议。评价重点也应从设备峰值性能转向有效利用率、服务稳定性、模型适配效率和单位任务综合成本。
本土语料治理成为主权AI的核心环节
📚 大模型是否理解本土语言、行业规则和社会语境,很大程度上取决于语料质量。本土语料并不是把中文网页简单汇总,而应覆盖公共知识、专业文献、行业术语、地方语言、多模态内容及经过授权的业务数据。《生成式人工智能服务管理暂行办法》要求训练数据具有合法来源,并强调知识产权、个人信息保护、真实性、准确性、客观性和多样性,详见官方管理办法。
企业建设语料库时,可以建立一套贯穿全生命周期的治理流程:
- 来源登记:记录数据提供方、授权范围、采集时间、使用期限和可否用于模型训练。
- 分类分级:区分公开数据、内部数据、个人信息、敏感个人信息、商业秘密及可能涉及重要数据的内容。
- 清洗去重:处理乱码、重复文本、低质量转载、错误标注和明显失实信息。
- 权利审查:核验知识产权、个人信息处理依据以及合同约定,不能把“网上可见”等同于“可以训练”。
- 质量评测:按行业、语言、地域和时间维度检查覆盖度,并持续测试模型的事实性、偏差与安全表现。
- 可追溯管理:保留语料版本、处理记录和模型使用关系,以便发现问题后定位、删除或重新训练。
本土语料治理还应避免两个极端:一是只追求数量,导致重复、过时和低可信内容进入训练集;二是为了安全而过度封闭,使模型缺少多样知识和跨文化理解能力。更成熟的思路,是通过可信数据空间、授权运营、脱敏处理和分级开放,让高质量数据在可控条件下流动。🔐
跨境模型调用为何成为新焦点
企业调用境外大模型API时,提交的提示词、附件、日志、用户标识乃至模型反馈,都可能形成跨境数据链路。风险不只在于“数据是否出境”,还包括境外服务商是否留存输入内容、是否用于模型改进、数据存储在哪个地区、哪些分包商可以访问,以及删除请求能否得到落实。
不过,跨境模型调用不能简单等同于一律禁止数据流动。国家网信办发布的促进和规范数据跨境流动规定,对数据出境安全评估、个人信息出境标准合同和个人信息保护认证的适用情形进行了明确,并设置了部分豁免条件。企业需要结合自身是否属于关键信息基础设施运营者、数据中是否包含个人信息或重要数据、处理规模及具体业务场景进行判断。
关键问题不是模型来自境内还是境外,而是企业能否看清数据流向、控制输入边界、落实必要程序,并在服务异常时快速切换。
企业可以立即落实的五项措施
- 建立模型调用清单:登记模型名称、服务地区、数据类型、接口用途、留存政策和责任部门。
- 设置输入防护:通过脱敏、字段过滤、敏感信息识别和最小必要原则,阻止机密数据被直接提交。
- 实行模型分级:公开信息可调用通用模型,内部资料使用受控服务,核心数据优先采用本地化或专有环境。
- 保留替代方案:采用多模型路由和标准化接口,降低对单一境外模型或云平台的依赖。
- 完善审计机制:记录调用主体、时间、数据类别和处理结果,同时控制日志中的个人信息与敏感内容。
总结:主权AI不是封闭AI
🌐 主权AI的核心并非排斥全球技术合作,而是在开放环境中保持关键能力可控、数据使用合规、模型服务可替代、文化表达有主体性。国家级算力统筹解决资源供给和调度问题,本土语料治理决定模型是否真正理解本国社会与产业,跨境模型调用规范则为国际技术合作划定清晰边界。
未来真正具有竞争力的AI体系,将不是单点性能最强的系统,而是能够把算力网络、可信数据、模型生态、绿色能源和治理规则连接起来的系统。对企业来说,与其等待所有标准完全成熟,不如从算力资产盘点、语料来源登记、模型调用清单和跨境数据评估做起,把主权AI从宏观概念转化为可执行、可审计、可持续的工程能力。