外观
NLP常用技巧:类别不平衡与长序列处理
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 怎么处理类别不平衡?
类别不平衡问题可以通过多种方法解决,主要策略如下:
| 方法类别 | 具体方法 | 说明 |
|---|---|---|
| 过采样 | 随机过采样、SMOTE | 增加少数类样本数量 |
| 欠采样 | 随机欠采样、Tomek Links | 减少多数类样本数量 |
| 生成新样本 | GAN、VAE | 通过生成模型合成少数类样本 |
| 集成学习 | Bagging、Boosting | 通过多模型集成平衡分类效果 |
提示:实际应用中常组合使用多种方法,如 SMOTE + Tomek Links 先过采样再清洗边界样本。
2. 解决长度限制的方案
2.1 问题背景
BERT 模型的长度限制问题主要由 Transformer 结构中的自注意力机制和位置嵌入导致。这些机制使得 BERT 对较长序列处理非常耗时且占用大量内存,从而限制了 BERT 在处理长序列任务上的性能。
2.2 改进型模型对比
| 模型 | 核心技术 | 优势 |
|---|---|---|
| Longformer | Sliding Window Attention(滑动窗口注意力) | 缓解长序列的计算和存储成本 |
| Reformer | Hashing Attention(哈希注意力) | 有效处理长序列,在部分 NLP 任务上表现良好 |
| Performer | FFT(快速傅里叶变换) | 可处理长序列,计算效率高 |
| Sparse Transformer | 稀疏注意力机制 | 减少长序列处理的计算和存储成本 |
核心思路:这些模型均通过改进自注意力机制来降低长序列的计算复杂度,从原始的 O(n²) 降低到接近 O(n log n) 或更低。