“Checkpoint(检查点)如何恢复”取决于你所指的具体场景,因为不同系统/框架中 Checkpoint 的机制和恢复方式差别很大。下面按常见场景分别说明:
保存:
torch.save({
'epoch': epoch,
'model_state_dict': model.state_dict(),
'optimizer_state_dict': optimizer.state_dict(),
'loss': loss,
}, 'checkpoint.pth')
恢复:
checkpoint = torch.load('checkpoint.pth')
model.load_state_dict(checkpoint['model_state_dict'])
optimizer.load_state_dict(checkpoint['optimizer_state_dict'])
epoch = checkpoint['epoch']
loss = checkpoint['loss']
model.train() # 或 model.eval()
✅ 恢复后可直接继续训练或推理。
保存:
model.save_weights('ckpt.weights.h5')
# 或
checkpoint = tf.keras.callbacks.ModelCheckpoint('ckpt.h5')
恢复:
model.load_weights('ckpt.weights.h5')
--load checkpoint_dir
--resume
框架会自动:
作用:
恢复过程(自动):
✅ 用户一般无需手动操作
手动恢复:
flink run -s hdfs:///checkpoint/path job.jar
常见格式:
.bin / .safetensorsfsdp_* / mp_rank_*Checkpoint 恢复 = 加载模型状态 + 优化器状态 + 训练进度,然后继续运行
如果你能告诉我:
我可以给你更精确的步骤或代码。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。