Computer Vision skills for AI agents
10 practitioner-grade computer vision skills, each a focused Markdown document your agent loads into context on demand. Search them from Claude Desktop, Cursor or any MCP client, or pull one with the CLI.
All 10 skills
- Dataset Annotation
Expert guidance for building computer vision datasets, annotation workflows, data augmentation, and quality assurance. Covers annotation tools, synthetic data, dataset formats, versioning, and active learning loops. Trigger: dataset, annotation, labeling, data collection, CVAT, Label Studio, Roboflow, data augmentation, albumentations, synthetic data, dataset format, COCO format, YOLO format.
408 lines - Edge Deployment
Expert guidance for deploying computer vision models on edge devices. Covers model optimization, quantization, TensorRT, OpenVINO, TFLite, ONNX, Jetson, and complete edge CV pipelines. Trigger: edge deployment, model optimization, quantization, TensorRT, ONNX, OpenVINO, Jetson, edge inference, model compression, TFLite, deploy model on device, real-time inference.
396 lines - Face Recognition
Expert guidance for face detection, recognition, alignment, and analysis systems. Covers ArcFace, InsightFace, DeepFace, face embeddings, anti-spoofing, and ethical deployment. Trigger: face recognition, face detection, facial recognition, face ID, face verification, face embedding, ArcFace, InsightFace, face matching.
323 lines - Generative Vision
Expert guidance for generative image and video models including diffusion models, Stable Diffusion, ControlNet, GANs, super-resolution, and fine-tuning techniques. Trigger: image generation, Stable Diffusion, diffusion model, ControlNet, DreamBooth, LoRA, text-to-image, inpainting, super-resolution, GAN, generative AI images.
275 lines - Image Classification
Expert guidance for building image classification pipelines with deep learning. Covers CNN architectures, Vision Transformers, transfer learning, training loops, evaluation metrics, and deployment. Trigger: image classification, classify images, CNN, ResNet, EfficientNet, ViT, transfer learning, fine-tune image model.
240 lines - Image Segmentation
Expert guidance for semantic, instance, and panoptic segmentation. Covers U-Net, DeepLab, Mask R-CNN, SAM/SAM2, loss functions, evaluation metrics, and domain-specific strategies. Trigger: image segmentation, semantic segmentation, instance segmentation, pixel-level, mask, U-Net, SAM, Segment Anything, panoptic.
248 lines - Object Detection
Expert guidance for building object detection systems. Covers YOLO family, Faster R-CNN, DETR, Ultralytics ecosystem, custom training, evaluation metrics, and real-time deployment. Trigger: object detection, YOLO, bounding box, detect objects, Faster R-CNN, DETR, mAP, Ultralytics.
252 lines - Ocr Document
Expert guidance for OCR, text detection/recognition, and document understanding pipelines. Covers Tesseract, EasyOCR, PaddleOCR, document layout analysis, table extraction, and LLM-powered document parsing. Trigger: OCR, text recognition, document parsing, text extraction, PDF extraction, receipt parsing, invoice, handwriting recognition, document understanding.
310 lines - Pose Estimation
Expert guidance for human pose estimation, body tracking, and gesture recognition. Covers OpenPose, MediaPipe, HRNet, ViTPose, 3D pose, hand tracking, and applications in fitness, sports, and AR. Trigger: pose estimation, body tracking, skeleton detection, keypoint detection, hand tracking, gesture recognition, MediaPipe Pose, OpenPose, human pose, body keypoints.
288 lines - Video Analysis
Expert guidance for video understanding, object tracking, action recognition, and real-time video processing. Covers SORT, DeepSORT, ByteTrack, SlowFast, optical flow, and scalable video pipelines. Trigger: video analysis, object tracking, multi-object tracking, action recognition, video classification, optical flow, surveillance, video processing, MOT.
319 lines