# LLM04 - Data and Model Poisoning

> Attackers manipulate training or fine-tuning data to compromise model integrity.

- **Category**: Owasp Llm
- **Subcategory**: top10_2025
- **Canonical URL**: https://designpattern.fyi/owasp_llm/llm04_data_model_poisoning/

---

## Description
'**Intent**: Protect the integrity of data used for training, fine-tuning, and embedding from malicious manipulation.

**Context**: Adversaries can inject malicious data into training sets, fine-tuning datasets, or embedding databases to alter model behavior, introduce biases, or create backdoors.

**Solution**: Validate and sanitize all training data. Implement data provenance tracking. Use anomaly detection on training pipelines. Monitor model behavior for drift. Maintain clean reference datasets for comparison.'



## Use Cases
Use when collecting training data, fine-tuning models, or building embedding/vector databases.





## Trade-offs


### Advantages

- Maintains model reliability

- Prevents behavior manipulation

- Ensures data quality

- Protects against backdoors




### Considerations & Drawbacks

- Poisoned data can be subtle

- Detection is computationally expensive

- Requires clean baseline data







---
**Reference**: [Original Source](https://genai.owasp.org)

