Skip to content

Latest commit

 

History

4 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

OA-LAMA: An Outlier-Adaptive LLM Inference Accelerator with Memory-Aligned Mixed-Precision Group Quantization

This codebase utilizes lm_eval to evaluate perplexity and zero-shot accuracy. Code segments from SmoothQuant, GPTQ, and Atom are integrated to reproduce results.

OA-LAMA

The current release features:

  • Simulated quantization for accuracy evaluation.
  • Perplexity and zero-shot accuracy evaluation

Installation

conda create -n OA-LAMA python=3.10
conda activate OA-LAMA
pip install -r requirements.txt

Usage

Accuracy Evaluation

We provide several scripts to reproduce our results in the paper: To run our W4A4 perplexity evaluation, please execute

bash scripts/eval_ppl.sh 

To get our W4A4 zero shot accuracy on common sense tasks, please execute

bash scripts/eval_zeroshot_acc.sh

About

No description, website, or topics provided.

Resources

Stars

6 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages