开发入门已解决
什么是大语言模型(LLM)?
用最直白的方式解释大语言模型的工作原理、能力边界和它为什么突然这么重要。
问题正文
它到底是什么
大语言模型本质上是一个超大规模的文本预测器:它读入一段文字,然后一个 Token 一个 Token 地预测接下来最可能出现的文字。因为训练数据覆盖了互联网级别的文本,这种"预测"表现出了理解指令、写代码、做翻译、总结文档等能力。
为什么现在才火
Transformer 架构、海量数据和大算力三者凑齐后,模型能力出现了质的飞跃。2018 年之前的模型只能算玩具,而今天的大模型已经能通过很多专业考试、写出可运行的程序。
它的边界在哪
它不是数据库,也不联网(除非接了工具);它可能一本正经地说错话(幻觉);它没有真正的记忆,只有当前对话的上下文。理解这三点,就理解了大模型应用的绝大部分设计取舍。
