Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

9 Commits
 
 
 
 
 
 

Repository files navigation

Red Teaming Portfolio

This repository documents structured red teaming work focused on large language model (LLM) reliability, safety testing, and evaluation design.

The emphasis is on:

  • Adversarial prompt testing (sanitized)
  • Rubric-based evaluation and calibration
  • Consistency and regression analysis
  • Practical mitigation strategies

All artifacts are intentionally sanitized to prevent misuse while preserving technical insight and methodological rigor.

  • Writeups: clear problem framing, approach, and outcomes

  • Artifacts: sanitized prompts, notes, and reports

  • Evals: rubric-based reasoning and consistency checks

  • Featured Artifact

Professional Notes

  • All examples are sanitized and designed to avoid enabling misuse.
  • Focus is on methodology, reproducibility, and reliability under variation.
  • This repository reflects ongoing structured experimentation in LLM safety and evaluation design.

For collaboration or discussion, feel free to connect via GitHub.

About

Red teaming portfolio: LLM safety testing, prompt attack/defense, eval design, and rubric-based analysis. Artifacts include writeups, sanitized examples, and lessons learned—focused on real-world reliability and responsible disclosure.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors