“Checkpoint(检查点)”在不同领域含义不同,常见场景包括:深度学习训练、数据库系统、流式计算(如Flink)、大模型推理。下面分别给出优化思路和实操建议,你可以对照自己的使用场景。
torch.save 配合子进程)state_dict,不保存整个模型对象fp16 / bf16 权重torch.distributed.checkpointcheckpoint_timeoutmax_wal_sizecheckpoint_completion_target(PG)✅ 异步化
✅ 增量 / 分片
✅ 压缩 / 量化
✅ 频率可控
✅ 存储分离
如果你能说明是 哪个系统 / 框架 / 场景(例如“PyTorch 训练”或“Flink 作业”),我可以给你更具体的配置示例。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。