[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-99742":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"99742","ai","技巧与观点","Nathan Lambert",64,"Nathan Lambert 完成 RLHF 书籍与配套课程","Nathan Lambert 完成 RLHF 书籍及配套课程，涵盖微调与对齐基础。","Nathan Lambert 宣布完成《Reinforcement Learning from Human Feedback》一书，并附带超过 10 小时的完整课程、幻灯片、训练代码和示例模型补全库。\n· 该书旨在传授微调、对齐及后训练模型的基础知识，适合希望深入 RLHF 的读者。\n· 实体书将于 1-2 周内从 Manning 发货，亚马逊稍晚上架。\n· 配套课程包含功能代码和示例库，提供实践学习资源。\n影响\u002F看点：这本书和课程为 RLHF 领域提供了系统学习资源，有助于推动 AI 对齐技术的普及和发展。","https:\u002F\u002Fx.com\u002Fnatolambert\u002Fstatus\u002F2079570020485718317",null,"2026-07-21 22:11:44"]