Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Duration 21 hours
Course Outline
Foundations of Audio Classification
- Sound event categories: environmental, mechanical, and human-generated.
- Overview of practical use cases: surveillance, monitoring, and automation.
- Distinguishing between audio classification, detection, and segmentation.
Audio Data and Feature Extraction
- Overview of audio file types and formats.
- Considerations for sampling rates, windowing, and frame sizes.
- Extraction of MFCCs, chroma features, and mel-spectrograms.
Data Preparation and Annotation
- Utilizing UrbanSound8K, ESC-50, and custom datasets.
- Labeling sound events along with their temporal boundaries.
- Strategies for dataset balancing and audio augmentation.
Building Audio Classification Models
- Applying convolutional neural networks (CNNs) to audio data.
- Input variations: raw waveforms versus extracted features.
- Selection of loss functions, evaluation metrics, and managing overfitting.
Event Detection and Temporal Localization
- Implementing frame-based and segment-based detection strategies.
- Refining detections through thresholding and smoothing techniques.
- Visualizing predictions across audio timelines.
Advanced Topics and Real-Time Processing
- Leveraging transfer learning for scenarios with limited data.
- Model deployment using TensorFlow Lite or ONNX.
- Managing streaming audio processing and latency constraints.
Project Development and Application Scenarios
- Designing an end-to-end pipeline from data ingestion to classification.
- Developing proof-of-concept solutions for surveillance, quality control, or monitoring.
- Integrating logging, alerting, and dashboard or API connectivity.
Summary and Next Steps
Requirements
- Solid grasp of machine learning principles and model training procedures.
- Proficiency in Python programming and data preprocessing workflows.
- Foundational knowledge of digital audio concepts.
Target Audience
- Data scientists.
- Machine learning engineers.
- Researchers and developers specializing in audio signal processing.