资源管理 Kubernetes for AI
使用 Kubernetes 管理机器学习工作负载,包括训练 Job、推理 Service 和自动扩缩容,实现云原生 AI 平台。
17
0
0
2026-06-28
影子部署 Shadow Deployment
将新模型作为影子服务与现网模型并行运行,记录其预测但不返回给用户,安全积累评估数据。
25
0
0
2026-06-20
特征存储 Tecton
了解特征存储的架构,学习 Tecton 如何统一管理离线与在线特征,确保训练与服务阶段特征的一致性。
19
0
0
2026-06-20
MLflow 模型注册与版本
使用 MLflow Tracking 记录实验参数与指标,通过 Model Registry 管理模型版本并一键部署到不同平台。
20
0
0
2026-06-20
TFX TensorFlow Extended
使用 TensorFlow Extended 搭建端到端的 ML 生产流水线,包括数据验证、转换、训练、评估与模型推送。
23
0
0
2026-06-20
机器学习流水线 Kubeflow
在 Kubernetes 上部署 Kubeflow,构建可复现的 ML 流水线,涵盖数据预处理、训练、调参与模型部署。
26
0
0
2026-06-20
MLOps 机器学习运维体系
建立标准化的机器学习流水线,涵盖实验跟踪、模型注册、自动化部署和性能监控,实现 ML 的持续交付。
28
0
0
2026-06-12