<?xml version="1.0" encoding="UTF-8"?>
<?xml-stylesheet type="text/xsl" href="https://media.rss.com/style.xsl"?>
<rss xmlns:podcast="https://podcastindex.org/namespace/1.0" xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:psc="http://podlove.org/simple-chapters" xmlns:atom="http://www.w3.org/2005/Atom" xml:lang="en" version="2.0">
  <channel>
    <title><![CDATA[Preference Optimization]]></title>
    <link>https://rss.com/podcasts/preference-optimization</link>
    <atom:link href="https://media.rss.com/preference-optimization/feed.xml" rel="self" type="application/rss+xml"/>
    <atom:link rel="hub" href="https://pubsubhubbub.appspot.com/"/>
    <description><![CDATA[<p>To help understand literature in preference optimization </p>]]></description>
    <generator>RSS.com 2026.401.141116</generator>
    <lastBuildDate>Fri, 17 Apr 2026 12:03:12 GMT</lastBuildDate>
    <language>en</language>
    <copyright><![CDATA[Sai Krishna 2024]]></copyright>
    <itunes:image href="https://assets.rss.com/images/no-cover-1400.jpg"/>
    <podcast:guid>c4cf00c0-291e-5f33-88f6-ac9603cfd414</podcast:guid>
    <image>
      <url>https://assets.rss.com/images/no-cover-1400.jpg</url>
      <title>Preference Optimization</title>
      <link>https://rss.com/podcasts/preference-optimization</link>
    </image>
    <podcast:locked>yes</podcast:locked>
    <podcast:license>Sai Krishna 2024</podcast:license>
    <itunes:author>SaiKrishna Rallabandi</itunes:author>
    <itunes:owner>
      <itunes:name>SaiKrishna Rallabandi</itunes:name>
    </itunes:owner>
    <itunes:explicit>false</itunes:explicit>
    <itunes:type>episodic</itunes:type>
    <itunes:category text="Education"/>
    <podcast:medium>podcast</podcast:medium>
    <item>
      <title><![CDATA[ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood]]></title>
      <itunes:title><![CDATA[ASFT: Aligned Supervised Fine-Tuning through Absolute Likelihood]]></itunes:title>
      <description><![CDATA[<p>This paper proposes a new method for fine-tuning large language models (LLMs) called Aligned Supervised Fine-Tuning (ASFT). ASFT addresses limitations of existing Direct Preference Optimization (DPO) methods by optimizing the absolute likelihood of generating human-preferred responses rather than relying on relative likelihoods. Unlike DPO, ASFT does not require a reference model and is less sensitive to the initial state of the model, leading to more efficient and robust training. The authors demonstrate the effectiveness of ASFT through extensive experiments on various benchmark datasets, showing significant performance improvements compared to existing methods.</p>]]></description>
      <link>https://rss.com/podcasts/preference-optimization/1691868</link>
      <enclosure url="https://content.rss.com/episodes/293529/1691868/preference-optimization/2024_10_08_11_55_06_b7317950-eda6-40b8-9020-e8dcc5178781.mp3" length="10846502" type="audio/mpeg"/>
      <guid isPermaLink="false">2d109c46-fd7a-4d8e-8503-8c6fd2214ee0</guid>
      <itunes:duration>677</itunes:duration>
      <itunes:episodeType>full</itunes:episodeType>
      <itunes:season>1</itunes:season>
      <podcast:season>1</podcast:season>
      <itunes:episode>1</itunes:episode>
      <podcast:episode>1</podcast:episode>
      <itunes:explicit>false</itunes:explicit>
      <pubDate>Tue, 08 Oct 2024 11:55:24 GMT</pubDate>
    </item>
  </channel>
</rss>