← 返回

从零开始写大模型:从神经网络到Transformer

著者王双, 牟晨, 王昊怡编著
ISBN9787302695080
分类号TP18 自动化技术、计算机技术
学科工学
版次第1版
出版社清华大学出版社
丛书名
出版年2025
价格¥69.80
页码xi, 232页
类型 📄 纸质书
核心评分9.5/10
读者对象
主题词人工智能
内容简介:本书共20章, 分为5篇。第1篇神经网络快速入门, 介绍神经网络的基础和结构; 第2篇Transformer架构基础, 介绍几种经典的编解码架构、Tokenization基础知识、Transformer架构涉及的数学概念; 第3篇Transformer模型剖析, 首先介绍大语言模型的概念和参数规模, 然后介绍Transformer的词汇输入模块、注意力机制模块和输出模块, 最后介绍基于Transformer架构的模型训练过程、推理过程、优化方法和超参数; 第4篇Transformer进阶, 首先介绍如何使用Python实现一个简单的Transformer架构, 然后介绍BERT和GPT两种经典大语言模型, 最后给出国内一些大公司的高频面试题; 第5篇GPT模型完全体验之MiniMind, 详细介绍一个开源极简大语言模型MiniMind的项目情况、代码结构, 以及安装、训练、微调与推理过程等, 帮助读者上手体验大语言模型的完整构建过程。
登录后可荐购