
Vision & Multimodal
Building AI capable of understanding visuals, video, and combinations of various information types.
LEARNING
Image Processing, Image Classification, Object Detection, Image Segmentation, Image Recognition, Feature Extraction, Image Embedding, Face/Object Analysis, Visual Tracking.
Framework/Tools
OpenCV, PyTorch, TensorFlow, YOLO.
OUTPUT
Object detection, Image classification, Visual recognition, Computer vision research, AI prototype.
LEARNING
Image Preprocessing, Text Detection, Text Recognition, Document Understanding, Handwritten Text Recognition, OCR Pipeline. (Example: Highly relevant for projects like the digitization of Nusantara scripts).
LEARNING
Video Processing, Object Tracking, Action Recognition, Temporal Analysis, Video Classification, Video Object Detection, Video Understanding.
LEARNING
Vision + Language, Image + Text, Video + Text, Multimodal Embedding, Vision-Language Models, Multimodal LLM, Multimodal RAG.
OUTPUT
Image understanding system, OCR system, Video AI, Vision-language application, Multimodal AI research.
