Large language Model
deepseek原理笔记(1)
deepseek原理综述🔢 核心思想:下一个词的预测大型语言模型的本质是一个概率模型。给定一个词序列(即上下文或提示),其根本任务是预测下一个最可能出现的词。基本设定:设有一个词序列(w_1, w_2, w_3, \dots, w_{t-1}),其中每个(w_i)来自一个庞大的词汇表 (V)。核心目标:计算在给定上文的情况下,下一个词 (w_t) 是词汇表中任意一个词的条件概率:$$ P(w_t ...