PART 05 · 算力平台与线下本地化部署

把双引擎能力装进
客户自己的机房

联合大模型平台与算力公司,交付私有化 AI 生产力:数据不出域、成本可预测、产能可掌控。三方共建、私有化交付、轻资产启动。

为什么必须做

公有云 API 模式必然失效的五个理由

×

公有云 API · 六条风险

数据合规风险(人脸/声纹/肖像/素材出域);成本不可预测(按 Token 计费);并发限流排队;依赖公网可用性;资产无法沉淀;与政策导向错配。

✓

本地化部署 · 六条收益

数据不出域(合规是底线);TCO 显著更低(三年低于持续 API,再削 70%+);并发可调度;离线可用可控;数字资产沉淀;政策红利承接(算力券/智算中心补贴)。

三方共建

大模型平台 + 算力公司 + 新智 AI

三方各投所长、各取所需,缺任何一环都只剩硬件或只剩演示。客户只签一份合同、只对接新智一方。

模

大模型平台方

投入:通用与多模态基础模型、商用授权、精调工具链、迭代与安全对齐。
收益:授权费、API 分成与行业落地案例。

算

算力公司方

投入:GPU 服务器与高速网络存储、机房与液冷、质保运维、融资租赁。
收益:硬件销售/租赁收入、运维服务费。

新

新智 AI

投入:双引擎软件、19 层编剧部门与 127 道工序、行业工作流、课程师资、真实订单与驻场。
收益:软件订阅、实施培训费、订单分成。

总体技术架构

四层解耦:硬件可换、模型可换、应用可持续升级

L4

应用层

Final Phrase 剧本系统、Final Scene 成片系统、素材资产库、审校工作台、教学实训后台、开放 API 网关。

L3

模型层

多模态基础模型池 + 自研剧本/组合/审核模型 + LoRA 微调仓库与版本管理。

L2

算力调度层

容器与 K8s、作业调度、算力池化、多租户配额、按卡时计量、任务队列与监控。

L1

基础设施层

GPU 服务器集群、高速网络、并行存储、UPS 与精密空调;支持国产与主流 GPU 混布。

三大支撑体系:安全合规(等保三级/堡垒机/内容审核/水印溯源)· 运维运营(7×24/驻场/季度扩容)· 信创适配(国产 GPU/OS/大模型)。

五种部署形态

从一台一体机到区域智算中心

不追求一步到位,按业务量分期扩容,首期投入可低至百万级。

部署形态硬件规模并发能力适用场景参考投资
形态 A · 单机一体机1–2 台 8 卡推理服务器,即插即用约 30 路单院系实验室、10–30 人工作室150–300 万
形态 B · 机房集群4–6 节点 + 机柜/UPS/100G 网络约 100 路校级实训中心、中型影视传媒公司600–1200 万
形态 C · 校级/园区智算中心16 节点以上、128 卡以上、液冷、PB 存储300 路以上区域共享、大型传媒集团2500 万起
形态 D · 混合云弹性本地基线 + 云端弹性溢出按需弹性项目/招生波动大的客户按用量结算
形态 E · 托管租赁算力公司投资部署在客户机房按合同约定预算紧张的民办高校与成长型传媒公司零 CAPEX

推荐路径:形态 A 或 E 起步 → B 扩容 → C 或 D 成熟(报价为参考区间,实际以设备选型与招标口径为准)。

场景化方案

按客户类型交付不同切入点

媒

场景 A · 传媒公司

痛点:未播素材与肖像不能上云、高峰期排队、成本不可控。
方案:内网一体机/机房集群(推荐 B/D),双引擎私有化,权重与素材留存客户侧。
产能:单集 10 分钟内、日均百集级;三年综合成本降 40%–60%。闲时还可对外接单变利润中心。

民

场景 B · 民办高校

痛点:预算有限、需先跑通再投入、招生波动。
方案:零首付算力租赁(形态 E)起步 + 微专业共建 + 订单下沉与收益分成。
价值:轻资产启动,用培训与承制收入覆盖算力成本。

公

场景 C · 公办高校

痛点:须走政府采购/招标、设备纳入国资、服务学科评估与双一流。
方案:立项→采购→建设→验收→成果 五步全流程陪伴;教学轨 + 科研轨双轨设计。
成果:联合申报重点实验室/示范基地/教学成果奖,产出论文专利软著。

配置清单

先算业务量,再配算力

卡数 ≈ 并发路数 × 单路显存占用 ÷ 单卡显存 × 冗余系数 1.3。

配置档位硬件规模并发与实训规模存储与网络参考投资
轻量版2 台推理服务器共 16 卡,显存约 768GB30 路生成 / 60 人实训存储 100TB,25G 网络150–300 万
标准版4–6 节点共 48–64 卡,显存 1.5–3TB100 路生成 / 200 人实训混合存储 500TB,100G RoCE600–1200 万
旗舰版16 节点以上共 128 卡以上,显存 6TB+300 路以上生成PB 级并行存储,200G InfiniBand,液冷2500 万起

软件栈:GPU 驱动与计算栈 / K8s 与作业调度 / vLLM 与 TensorRT-LLM 及国产推理引擎 / 多模态模型池 / 自研剧本与审核模型 / LoRA 微调仓库 / Final Phrase / Final Scene / 素材资产库 / 审校工作台 / 计量计费与审计。

五种商务模式

让不同预算的客户都能启动

商务模式模式说明适用客户现金流特征
模式一 · 买断(CAPEX)硬件+软件+实施一次性采购,产权归客户公办高校、预算充足大型传媒集团一次性大额支出
模式二 · 融资租赁分期3–5 年分期,首付比例灵活民办高校与成长型企业分期固定支出
模式三 · 算力租赁(OPEX)设备由算力公司投资部署在客户侧,按卡时/月费希望先跑通再投入的客户零 CAPEX,按用量付费
模式四 · 共建分成我方投软件与部分设备,客户出场地机房,按比例分成民办高校与园区风险共担,收益共享
模式五 · 政策资金申报协助申报算力券、智算中心/产教融合/新基建/新职业补贴所有客户类型补贴直接冲抵成本

推荐路径:形态 E 租赁起步 → 模式四分成共建 → 同步申报模式五政策资金 → 业务放量后升级为标准版或旗舰版。

交付实施

从需求勘察到运维托管,全周期可管控

1

需求勘察与测算

1–2 周:业务量盘点、并发测算、机房勘察

2

方案设计与概算

2 周:架构方案、配置清单、商务建议

3

立项与签约

4–12 周:民办决策 / 公办招标

4

机房改造与进场

4–8 周:供电制冷、布线、上架

5

系统部署与联调

3–4 周:模型本地化、工作流封装、压测

6

培训交付与首单

4 周:师资培训、学员实训、真实订单试产

长期运维承诺:7×24 监控 · 平台可用性 ≥ 99.5% · 故障 2 小时响应 · 备件 4 小时到场 · 季度扩容评估与模型升级。

投资回报测算示例

标准版 100 座 AIGC 实训中心

算力中心不是纯支出,而是三年内可回收、之后持续产出的经营资产。

800万
标准版算力平台建设投入
350万
年综合收益(测算,五项合计)
2.3年
计入补贴后静态回收期(不计补贴约 3 年)
150-300万
可申领政策补贴(一次性)

测算口径:200 名学员年均 3000 元 Token 消耗、200 人 × 8000 元培训、年 300 万订单按 30% 分成;单位万元。以上为测算示例,实际收益随招生规模、订单量与地方政策差异较大,需在立项阶段逐项核实。

安全与合规

本地化部署的底线工程

备

合规备案

依据《生成式人工智能服务管理暂行办法》完成备案,模型与服务上线流程合法合规。

保

等保与分级

按等保三级标准建设,数据分类分级,敏感数据本地留存不出域。

控

访问控制

堡垒机运维、最小权限、多因子认证、操作全量审计,日志留存不少于 6 个月。

审

内容安全

AI 生成内容显式与隐式双标识、内容安全审核工作流、水印与溯源。

权

授权链完整

肖像/声音/音乐/字体/IP 改编授权均需书面授权并纳入素材资产库台账。

创

信创与教育合规

支持国产 GPU/OS/大模型;学生人脸、声纹与作品数据校内留存,不用于未经授权商业用途。

面向政府与公办高校汇报时,本页建议提前讲 —— 合规往往是一票否决项。