ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

大语言模型LLM

大语言模型LLM

1、大语言模型的基本介绍

大语言模型 (英文:Large Language Model,缩写LLM) 是一种人工智能模型,旨在理解和生成人类语言. 大语言模型可以处理多种自然语言任务,如文本分类、问答、翻译、对话等等。你可以把它看作一个通过海量文本数据训练出来的“超级语言大脑”--1,它的核心能力是理解、生成和推理人类语言。

image

几乎所有现代大语言模型都建立在 Transformer 架构之上

LLM分类一般分为三种:

  1. 自编码模型(AutoEncoder model,AE)
    • 核心逻辑:“完形填空”。模型在预训练时,会随机遮挡(Mask)输入文本中的一部分Token,然后让模型根据双向(左右两侧)的上下文来预测被遮住的词。
    • 代表模型:BERT、RoBERTa、ALBERT。
    • 最佳场景:文本分类、情感分析、命名实体识别(NER)、信息抽取、语义相似度计算等自然语言理解(NLU)任务。
  2. 自回归模型(Autoregressive model,AR)
    • 核心逻辑:“预测下一词”。模型根据已经生成的左侧上文,逐字(Token)预测下一个最可能的词,生成的新词会加入上下文,继续预测下下个词。

    • 代表模型:GPT 系列(GPT-1/2/3/4)、LLaMA、Claude、Gemini(主流版本)。

    • 最佳场景:文本生成、代码编写、创意写作、复杂逻辑推理、通用对话助手。
  3. 序列到序列模型(Sequence to Sequence Model)
    • 核心逻辑:“理解再复述/转换”。输入数据由编码器(Encoder)进行双向理解,提取核心语义,生成一个中间向量;然后交给解码器(Decoder)以自回归的方式逐字生成全新的输出序列。
    • 代表模型:T5、BART、Google的早期Transformer(如用于翻译)。
    • 最佳场景:机器翻译、文本摘要(特别是长文档摘要)、语法纠错、问题生成等输入输出结构差异较大的转换任务。

现代的大语言模型几乎都是自回归架构。但目前在当下的多模态或混合模型中,边界也在模糊。例如 Google 的 Gemini 和 OpenAI 的 GPT-4,虽然在宏观上被视为Decoder-Only,但在内部的 MoE(混合专家)或多模态编码层中,也融合了类似编码器的双向理解模块。此外,GLM(清华智谱) 等模型采用的“自回归空白填充”范式,则介于AE和AR之间,融合了两者的优点。

 

常见主流大语言模型:ChatGPT、Qwen大模型、DeepSeek大模型等。

 

返回列表