“Checkpoint(检查点)”在不同领域含义不同,最常见于机器学习/深度学习训练、数据库/分布式系统和流式计算(如Flink)。下面分别给出各类最佳实践。
示例(PyTorch):
torch.save({
'epoch': epoch,
'model': model.state_dict(),
'optimizer': optimizer.state_dict(),
'best_acc': best_acc
}, 'checkpoint.pth')
resume 参数控制torch.distributed 同步checkpoint_timeoutmax_wal_sizeenv.enableCheckpointing(30000);
env.getCheckpointConfig().setCheckpointingMode(CheckpointingMode.EXACTLY_ONCE);
✅ 明确目的(恢复 / 调试 / 部署)
✅ 自动 + 手动结合
✅ 可复现、可验证
✅ 存储隔离、生命周期管理
✅ 恢复路径必须测试
如果你指的是某一具体框架(如 PyTorch、TensorFlow、Flink、Spark、数据库),可以告诉我,我可以给更针对性的方案。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。