Trajectory-aware guardrails for LLM chatbots: catches the gradual delusion reinforcement that turn-local safety filters miss - nwjang/psychosis-guard
0 comments
No comments yet.
Read the full thread on Hacker News →
Related stories
- I have some questions for Mark Zuckerbergtheverge.comThe Verge · 0 points · 6 days ago
- Hacker News · 1 points · 8 days ago
- AI safety conversations have gotten unbelievabletechcrunch.comHacker News · 5 points · 11 days ago
- Hacker News · 1 points · 10 days ago
- Hacker News · 1 points · 2 days ago
- Hacker News · 1 points · 10 days ago