“Checkpoint(检查点)”在不同领域设置方法差别很大,下面按常见场景给你分别说明:
目的:保存模型权重、优化器状态,方便断点续训或回滚。
PyTorch 示例
# 保存
torch.save({
'epoch': epoch,
'model_state_dict': model.state_dict(),
'optimizer_state_dict': optimizer.state_dict(),
'loss': loss,
}, 'checkpoint.pth')
# 加载
checkpoint = torch.load('checkpoint.pth')
model.load_state_dict(checkpoint['model_state_dict'])
optimizer.load_state_dict(checkpoint['optimizer_state_dict'])
常见设置策略
目的:记录一致状态,故障恢复用。
Flink 示例
env.enableCheckpointing(5000); // 每 5 秒一个检查点
env.getCheckpointConfig().setCheckpointingMode(CheckpointingMode.EXACTLY_ONCE);
设置要点
steps 或 epochoptimizer / lr_scheduler / rng_statetorch.distributed 同步如果你说的是某一个具体框架或场景(比如 TensorFlow、Ray、数据库、游戏引擎),告诉我,我可以直接给你对应代码和配置。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。