解释大语言模型如何把提示词、历史对话和用户问题转成 token 与向量,经过 Transformer、自注意力和位置编码完成上下文建模,再通过概率采样逐 token 生成回答,并给出上下文控制、多 Agent 拆分等工程实践建议。