“触发 Checkpoint(检查点)”具体方式取决于你使用的技术场景。下面按常见领域分别说明,你可以对号入座:
checkpoint_timeout(默认 5 分钟)或 max_wal_size 阈值CHECKPOINT;
CheckpointInterval 周期执行env.triggerCheckpoint();
或通过 REST 接口:
POST /jobs/:jobid/checkpoints
streamingContext.checkpoint("hdfs://path")
torch.save({
'epoch': epoch,
'model_state': model.state_dict(),
'optimizer_state': optimizer.state_dict()
}, "ckpt.pth")
model.save_weights("ckpt.ckpt")
# 或
checkpoint_callback = tf.keras.callbacks.ModelCheckpoint("model.h5")
model.fit(..., callbacks=[checkpoint_callback])
zfs snapshot pool/fs@checkpoint1
常用于断点续跑:
if os.path.exists("ckpt.pkl"):
load_checkpoint()
else:
run_and_save_checkpoint()
触发条件通常是:
我可以给你更精准的示例和配置。
免责声明:本站发布的内容(图片、视频和文字)以原创、转载和分享为主,文章观点不代表本网站立场,如果涉及侵权请联系站长邮箱:is@yisu.com进行举报,并提供相关证据,一经查实,将立刻删除涉嫌侵权内容。