Publications
You can find my latest publications here
2026
- Keeping Agents on Track: Using Context-Induced Failures as a Learning SignalIn AI4GOOD Workshop at ICML, 2026
- Position: Safe Models Do Not Guarantee Safe Societies: The Case for Sociopolitical RiskIn International Conference on Machine Learning (ICML), Position Paper Track, 2026
- TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and TamperingarXiv preprint arXiv:2602.06911, 2026
2025
-
Improving Large Language Model Safety with Contrastive Representation LearningarXiv preprint arXiv:2506.11938, 2025 - Causal AI Scientist: Facilitating Causal Data Science with Large Language ModelsIn AI for Science Workshop at NeurIPS, 2025
-
Accidental Vulnerability: Factors in Fine-Tuning that Shift Model SafeguardsarXiv preprint arXiv:2505.16789, 2025