Skip to content
STIMSMITH

Direct Preference Optimization

Technique
First seen 7/16/2026
Last seen 7/16/2026
Evidence 1 chunks

NEIGHBORHOOD

No graph connections found for this entity yet. It may appear in future ingestion runs.

explore full graph →

RELATIONSHIPS

2 connections
GoldenFuzz ← uses 100% 1e
GoldenFuzz applies Direct Preference Optimization (instantiated as SimPO) to refine instruction generation policy.
SimPO ← extends 90% 1e
SimPO is a variant/extension of Direct Preference Optimization used for policy updates in GoldenFuzz.