World Model · podcast knowledge graph

From Prompts to Policies: How RL Builds Better AI Agents with Mahesh Sathiamoorthy - #731

2025-05-13 · 61 min · episode 731 · 16 entities

Asserted relationships

  • evidence rules-v4
    From Prompts to Policies: How RL Builds Better AI Agents with Mahesh Sathiamoorthy - #731
  • → hosted by Sam Charrington person
    0.55
    evidence rules-v4
    Feed author/publisher: Sam Charrington
  • → works at Bespoke Labs company
    0.50
    evidence rules-v4
    CEO of Bespoke Labs
  • → works at Bespoke Labs company
    0.50
    evidence rules-v4
    CEO of Bespoke Labs
  • → discusses Science concept
    0.40
    evidence rules-v4
    Feed category: Science
  • → discusses Technology company
    0.40
    evidence rules-v4
    Feed category: Technology
  • → discusses News concept
    0.40
    evidence rules-v4
    Feed category: News
  • → discusses Tech News concept
    0.40
    evidence rules-v4
    Feed category: Tech News
  • → hosted by TWIML company
    0.40
    evidence rules-v4
    Feed author/publisher: TWIML

Entities found in this episode

companys 7

  • mentioned TWIML company
    0.70
    evidence rules-v4
    Feed author/publisher: TWIML
  • mentioned Bespoke Labs company
    0.62
    evidence rules-v4
    CEO of Bespoke Labs
  • mentioned Technology company
    0.50
    evidence rules-v4
    Feed category: Technology
  • works at Bespoke Labs company
    0.50
    evidence rules-v4
    CEO of Bespoke Labs
  • works at Bespoke Labs company
    0.50
    evidence rules-v4
    CEO of Bespoke Labs
  • discusses Technology company
    0.40
    evidence rules-v4
    Feed category: Technology
  • hosted by TWIML company
    0.40
    evidence rules-v4
    Feed author/publisher: TWIML

concepts 5

  • mentioned Science concept
    0.50
    evidence rules-v4
    Feed category: Science
  • mentioned Tech News concept
    0.50
    evidence rules-v4
    Feed category: Tech News
  • discusses Science concept
    0.40
    evidence rules-v4
    Feed category: Science
  • discusses News concept
    0.40
    evidence rules-v4
    Feed category: News
  • discusses Tech News concept
    0.40
    evidence rules-v4
    Feed category: Tech News

persons 3

  • mentioned Mahesh Sathiamoorthy person
    0.72
    evidence rules-v4
    From Prompts to Policies: How RL Builds Better AI Agents with Mahesh Sathiamoorthy - #731
  • mentioned Sam Charrington person
    0.70
    evidence rules-v4
    Feed author/publisher: Sam Charrington
  • hosted by Sam Charrington person
    0.55
    evidence rules-v4
    Feed author/publisher: Sam Charrington

podcasts 1

Episode description as stored
Today, we're joined by Mahesh Sathiamoorthy, co-founder and CEO of Bespoke Labs, to discuss how reinforcement learning (RL) is reshaping the way we build custom agents on top of foundation models. Mahesh highlights the crucial role of data curation, evaluation, and error analysis in model performance, and explains why RL offers a more robust alternative to prompting, and how it can improve multi-step tool use capabilities. We also explore the limitations of supervised fine-tuning (SFT) for tool-augmented reasoning tasks, the reward-shaping strategies they’ve used, and Bespoke Labs’ open-source libraries like Curator. We also touch on the models MiniCheck for hallucination detection and MiniChart for chart-based QA. The complete show notes for this episode can be found at https://twimlai.com/go/731.