“Checkpoint(检查点)”在不同技术领域含义不同,下面分别说明常见场景下的检查点备份方法,你可以对照自己的使用场景:
检查点通常指模型权重、优化器状态等。
# 保存
torch.save({
'epoch': epoch,
'model_state_dict': model.state_dict(),
'optimizer_state_dict': optimizer.state_dict(),
'loss': loss,
}, 'checkpoint.pth')
# 恢复
checkpoint = torch.load('checkpoint.pth')
model.load_state_dict(checkpoint['model_state_dict'])
optimizer.load_state_dict(checkpoint['optimizer_state_dict'])
备份建议
model.save_weights('ckpt.weights.h5')
model.load_weights('ckpt.weights.h5')
或使用 tf.train.Checkpoint + CheckpointManager
检查点是恢复点,用于崩溃恢复。
checkpoint_timeout 控制CHECKPOINT;
备份方式
检查点用于故障恢复。
state.checkpoints.dir: hdfs:///checkpoints/
flink savepoint <jobId> hdfs:///savepoints/
如果你能说明是哪种系统或框架(如 PyTorch / Flink / 数据库),我可以给你更具体的备份方案。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。