ChatGPT原理与架构——大模型的预训练、迁移和中间件编程
内容简介:本书共分11章内容:第1章介绍了ChatGPT等大模型的发展历程、技术演化和技术栈等基础知识;第25章讲解了Transformer的架构原理,并从GPT1的生成式预训练到GPT3的稀疏注意力机制描述了GPT系列的架构演进;第68章从底层技术实现的角度讲解了大语言模型的训练策略、数据处理方法,以及如何利用策略优化和人类反馈来进一步提升模型的表现;第910章首先讲解了大语言模型在垂直领域的低算力迁移方法,并给出了医疗和司法领域的迁移案例,然后讲解了大模型的中间件编程;第11章对GPT的未来发展趋势进行预测,探讨数据资源、自回归模型的局限性,以及大语言模型时代具身智能的可行路线。
登录后可荐购