- Published on
Building real-time intent recognition achieving sub-500ms latency with 70% accuracy improvement, and implementing Query AutoComplete using Ghosting approach with N-gram models and fine-tuned GPT-2.
Building production ML systems at scale. 5+ years delivering NLP, Computer Vision, and MLOps solutions.
Intent Detection, Transformers, GPT Fine-tuning
SageMaker, MLFlow, Kubernetes, CI/CD
YOLOv8, SAM, Object Detection
TensorRT, Quantization, Model Optimization
Deep dives into ML systems, architecture decisions, and lessons learned.