大模型精度:从定点数到浮点数

一、定点数 与 浮点数(核心区别) 1. 什么是定点数(Fixed Point) 定义 定点数表示方式的核心特点是: 小数点位置是固定的 计算机内部存的是一个整数,而真实数值由一个固定的比例关系解释。 表示方式(直觉) 真实值 = 存储的整数 × 缩放因子 例如规定: 缩放因子 = 0.1 那么: 存 15 → 表示 1.5 存 1 → 表示 0.1 INT8 / INT16 / INT32 都属于定点数体系。 本质特点 所有数共用一个尺度 精度和范围无法同时兼顾 数值分布一旦变化就容易失真 在神经网络中的问题 神经网络中同一 tensor 内: 可能同时存在非常小的数和非常大的数 固定尺度无法适配这种变化 2. 什么是浮点数(Floating Point) 定义 浮点数的核心思想是: 允许小数点“浮动”,让数值大小和精细程度分开表示 基本结构 [ 符号位 ][ 指数位 ][ 尾数位 ] 符号位:正 / 负 指数位:数量级(决定“有多大”) 尾数位:有效数字(决定“有多准”) 直觉理解 浮点数本质等价于科学计数法: ...

2026年7月29日 · 2 分钟 · 331 字 · Kairos

熵、交叉熵、KL 散度

用一组具体数字,把这三个概念一次讲透 1. 固定场景 有两个分布: Teacher 分布 (P):老师认为的真实概率 Student 分布 (Q):学生学出来的概率 假设有 3 个类别:A / B / C 类别 Teacher P Student Q A 0.7 0.6 B 0.2 0.3 C 0.1 0.1 数组表示: P = [0.7, 0.2, 0.1] Q = [0.6, 0.3, 0.1] 2. 熵 (Entropy) 定义 $$H(P) = -\sum_i P_i \log P_i$$ 计算 已知: $\log 0.7 \approx -0.357$ $\log 0.2 \approx -1.609$ $\log 0.1 \approx -2.303$ 代入: $$ \begin{aligned} H(P) &= -(0.7 \times -0.357 + 0.2 \times -1.609 + 0.1 \times -2.303) \ &= 0.250 + 0.322 + 0.230 \ &\approx 0.802 \end{aligned} $$ ...

2026年7月20日 · 3 分钟 · 629 字 · Kairos