-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathevaluate-generated.py
More file actions
72 lines (55 loc) · 2.29 KB
/
Copy pathevaluate-generated.py
File metadata and controls
72 lines (55 loc) · 2.29 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
import math
import os
from typing import List, Dict, Any
import pandas as pd
import torch
import valohai
from transformers import AutoModelForCausalLM, AutoTokenizer, PreTrainedModel, PreTrainedTokenizer
# Model and tokenizer initialization
model_name: str = "nferruz/ProtGPT2"
tokenizer: PreTrainedTokenizer = AutoTokenizer.from_pretrained(model_name)
model: PreTrainedModel = AutoModelForCausalLM.from_pretrained(model_name)
sequences: str = valohai.inputs("sequences").path()
# Load CSV from valohai input
df: pd.DataFrame = pd.read_csv(sequences)
device: torch.device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
def calculatePerplexity(
sequence: str,
model: PreTrainedModel,
tokenizer: PreTrainedTokenizer
) -> float:
"""
Calculate perplexity of a given sequence using the provided model and tokenizer.
Args:
sequence (str): Input sequence (amino acid sequence).
model (PreTrainedModel): HuggingFace Causal LM model.
tokenizer (PreTrainedTokenizer): HuggingFace tokenizer.
Returns:
float: Perplexity score of the sequence.
"""
input_ids: torch.Tensor = torch.tensor(tokenizer.encode(sequence)).unsqueeze(0)
input_ids = input_ids.to(device)
with torch.no_grad():
outputs = model(input_ids, labels=input_ids)
loss, logits = outputs[:2]
return math.exp(loss)
if __name__ == "__main__":
model.to(device)
results: List[Dict[str, Any]] = []
for index, row in df.iterrows():
seq: str = row['generated_text']
ppl: float = calculatePerplexity(seq, model, tokenizer)
results.append({"sequence": seq, "perplexity": ppl})
print(f"Sequence: {seq}\nPerplexity: {ppl}\n")
results_df: pd.DataFrame = pd.DataFrame(results)
work_dir: str = os.environ.get("WORK_DIR", "./outputs")
if not os.path.exists(work_dir):
os.makedirs(work_dir)
print(f"Directory '{work_dir}' created.")
results_path: str = os.path.join(work_dir, "results")
if not os.path.exists(results_path):
os.makedirs(results_path)
results_csv_path: str = os.path.join(results_path, "predicted_properties.csv")
results_df.to_csv(results_csv_path, index=False)
print(f"Predicted properties saved to {results_csv_path}")
print("Inference completed successfully.")