Research Interests

AI Safety & Alignment  ·  Natural Language Processing (NLP)  ·  Mechanistic Interpretability  ·  Large Language Models (LLMs)  ·  Geometric Deep Learning  ·  Explainable & Trustworthy AI  ·  AI Deception Detection  ·  Cross-cultural & Multilingual AI  ·  Privacy-Preserving Federated Learning  ·  Healthcare NLP


Core Research: Belief Vector Field & Geometric Alignment

My primary research develops information-geometric frameworks to measure how LLMs encode, propagate, and transform beliefs across transformer layers — and how alignment (DPO/RLHF), fine-tuning, and cultural merging alter that internal geometry. Core finding: torsional geometry provides the most statistically significant separation (highest Cohen's d effect size) between safe and harmful prompts across SFT & DPO model variants.

Models: LLaMA-3.2, OLMo-7B, Gemma-2, Mistral-7B, Zephyr-7B, Qwen3  |  Datasets: LITMUS, HarmfulQA, hh-rlhf  |  Metrics: 17 geometric metrics (torsion, spectral curvature, thermodynamic length, DTW)


Semantic Helix of LLMs (nDNA) — Cross-cultural & Multilingual AI

Unifies fine-tuning, alignment, distillation, and model merging as measurable deformations of the same depth-wise semantic flow via spectral curvature κ and thermodynamic length ℒ. Investigates epistemic inheritance in merged LLMs — emergent cultural “neural DNA” across African, Latin American, South Asian, East Asian, Arabic, European, and Pacific Islander cultures.

Publications

  1. Preprint
    No Unique Minimizer, No Problem: On the Consistency of Robust Neural Classifiers
    Subhabrata Majumdar, Anand Deo*, Partha Pratim Saha*, Abhik Ghosh
    *Equal contribution  ·  Establishes a consistency theory for robust neural classifiers trained via the S-divergence family under label noise and adversarial contamination, requiring no parameter-identifiability assumption. Proves empirical S-divergence minimizers converge to the population-optimal equivalence class and that robust training reaches stationary points, with vision & language experiments showing clean-data accuracy competitive with existing robust methods.
  2. Preprint
    MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion Across Four Language Models
    Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das
    Under Review  ·  8 new torsion metrics, full LITMUS benchmark, DPO suppression 44.4% (Cohen's d=0.741, p=7.7×10⁻¹³), entropy–torsion bridge ρ=−0.387
    Contribution: Conceived idea; ran all experiments, plots, coding, and paper writing.
  3. ICML 2026
    GRAFT: Geometric Representations of Alignment's Fingerprint in Transformer Belief Trajectories
    Partha Pratim Saha
    ICML 2026 Workshop on Mechanistic Interpretability  ·  Poster  ·  T2 torsion 8× more concept-discriminative than CKA (AUC 0.89); 3 pre-registered hypotheses confirmed on LITMUS (20,439 prompts)
    Contribution: Sole author — idea, experiments, plots, coding, paper writing.
  4. Preprint
    SPINAL: Scaling-law and Preference Integration in Neural Alignment Layers
    Arion Das, Partha Pratim Saha, Aman Chadha, Vinija Jain, Amitava Das
    Contribution: Model experiments and paper writing.
  5. NeurIPS 2025
    Prompting Away Stereotypes? Evaluating Bias in Text-to-Image Models for Occupations
    Shaina Raza, Maximus Powers, Partha Pratim Saha, Mahveen Raza, Rizwan Qureshi
    NeurIPS 2025 Workshop on Algorithmic Fairness  ·  Empirical bias audit of DALL·E, Midjourney, Stable Diffusion
    Contribution: End-to-end pipeline design, full dataset annotation, paper writing.
  6. Journal
    Enhancing Human Empathy in Conversations Using Transformer-Based Models
    Cherishma Kumar Subhasa, Endriyas Zenagebriel, Partha Pratim Saha, Zarah Rezaei, Joseph Akinyemi
    Sciencematch  ·  Impact Scholar Program 2025  ·  DOI: 10.5281/ZENODO.15126395
    Contribution: Top contributor — all technical ideas and process-pipeline.
  7. SpringerNature
    Collaborative Federated Learning Cloud Based System
    Partha Pratim Saha, Naresh K. Sehgal, Miad Faezipour
    ICOMP'24  ·  Computer Engineering & Applied Computing (CSCE), USA  ·  SpringerNature

Awards & Achievements

Research & Work Experience

Lecturer in CS & Head of Department Dec 2021 – Present
Nalhati Government Polytechnic College (Govt. of West Bengal), India
Teaching ML, Deep Learning, IoT, Python, and Java. Project supervisor for 50+ final-year students on AI, NLP, Agentic AI, and Empathetic Chatbot projects. Administrative HoD responsibilities. Active research on AI Safety & Alignment (GRAFT/MENTIS), Semantic Helix of LLMs (nDNA), Cultural LLMs, and Neural Robustness.
Lead Data Scientist — Conversational Dialog System May 2021 – Nov 2021
Wipro Limited & IBM Research (Joint Project), Bangalore, India
Led a team of 5 to build a conversational chatbot removing query ambiguities. Implemented 50+ custom intents, entities, and dialog flows with IBM Watson. Impact: 0.3 million users worldwide. Tools: DialogFlow, IBM Cloud, NodeJS.
Senior Data Scientist — Medical Search Engine (J&J R&D) Dec 2017 – Aug 2019
BirlaSoft · Johnson & Johnson R&D, New Delhi, India
Built medical search engine using SciBERT and SciSpacy NLP pipeline for healthcare queries. Impact: 0.1 million+ J&J product users. Tools: Python, Word2Vec, SciSpacy, Fuzzy Search, Flask.
Project Engineer — Threat Intelligence System Nov 2016 – Jul 2017
Indian Institute of Technology (IIT) Kanpur, Computer Science Dept., India
Developed a secure threat management system for academic institutions. Researched cyber-security defences against integrity, confidentiality, and non-repudiation attacks. Tools: Python, Drupal, Django.
Senior Systems Engineer — Alignment & Cancer Genomics in AI Jan 2011 – Jul 2015
Infosys Technologies Limited, Chennai, India
Applied Edit Distance and Needleman-Wunsch algorithms on DNA sequences (FASTQ) to identify gene insertions/deletions. Identified top 10 genes driving Multiple Myeloma blood cancer; implemented 3 research papers. Impact: biological hierarchy determination, drug design, life expectancy improvement.

Teaching Assistantships

Teaching Assistant (M.Tech Programme) 2021 – 2023
BITS Pilani, India
TA for three graduate courses: NLP Applications [Winter 2023], Deep Learning [Fall 2021], Deep Reinforcement Learning [Spring 2021]. Responsibilities: webinar demonstrations, labs, quizzes, exam preparation, student mentoring. Honorarium: USD $2,513.11 across all three courses.

Education

M.Tech in Data Science & Engineering
Birla Institute of Technology and Science (BITS Pilani), Pilani, India — 2019–2021
GPA: 9.08/10  ·  Distinction  ·  Top 5% out of 600
Courses: NLP, Machine Learning, Deep Learning, Data Science, Mathematics, Statistics, Data Mining, Big Data Systems
Dissertation: Collaborative Federated Learning (CFL) cloud system separating PHI/PII for privacy-preserving GPT-like systems (published SpringerNature)
B.Tech in Computer Science & Engineering
West Bengal University of Technology (WBUT), Kolkata, India — 2006–2010
GPA: 8.49/10  ·  Top 5% out of 70
Courses: Mathematics, Statistics, Algorithms, AI, Probability, Data Structures, Programming

Technical Skills

AI Safety: Belief Change under AI Alignment, Mechanistic Interpretability, Model & Activation Steering, Recursive Self-Improvement Risks, LLM Deception, Manipulation & Sycophancy, Bias Mitigation & AI Misalignment, Catastrophic Risk Reduction in Frontier Models, Safety-Relevant Behavioral Evaluation, Belief & Knowledge Editing, Explainable & Trustworthy AI (XAI)
NLP: Foundation Models, LLM Alignment, AI Agents, Conversational AI Systems, Generative AI, Fine-tuning via HuggingFace, Hybrid & Multi-hop Retrieval-Augmented Generation (RAG)
LLMs (hands-on): DeepSeek, GPT, LLaMA, Gemma, Mistral, Qwen, OLMo — base & instruct variants; model fine-tuning, reasoning, NeuroSymbolic AI, ethics & trustworthiness, evaluation & benchmarking
Deep Learning: Transformer, GPT, Autoregressive Generative Models, CNN, RNN, Neural Networks
ML & Data Science: Text & Multimodal Data curation, Regression, Classification, Clustering, Tree-Based Algorithms, Bagging, Boosting
Programming: Python, Java, C, Objective-C
Frameworks & Tools: PyTorch, LlamaIndex, LangChain, Scikit-learn, NumPy, Pandas, NLTK, SpaCy, TensorFlow, Keras, Flask, NodeJS, Docker, Kubernetes, Git, PostgreSQL, MySQL
Cloud: AWS (EC2), Azure, IBM Cloud, Watson ML; inference deployment systems
Domains: Cancer Genomics, Bioinformatics, Healthcare AI, Real Estate, Finance & Banking

Contact

I am actively seeking fully-funded PhD positions in AI Safety, NLP, and LLM Alignment.
I welcome contact from faculty and researchers working on interpretable, responsible, and safe AI systems.

Email: technical.partha@gmail.com
LinkedIn: linkedin.com/in/partha121
GitHub: github.com/pps121
CV: Download PDF