智能監控與
物件追蹤系統

整合電腦視覺、多模態 AI 與物聯網雷達技術,打造全方位居家智能監控與個人物品管理助手。五大模式一鍵切換,從找鑰匙到守護家人安全,一套系統搞定。

系統已部屬上線
無需安裝,開啟瀏覽器即可完整體驗所有功能
YOLO26n 推論引擎 Google Gemini AI MediaPipe 姿態偵測 藍牙 BLE 雷達 AI 人臉識別 Edge-TTS 語音 Telegram 推播 FastAPI + PWA
83%
尋物時間縮短
315 秒 → 53 秒
手動尋找 vs. AI 定位(鑰匙)
<1.5s
緊急警示反應時間
跌倒偵測:快速下墜
+倒地 1.5 秒確認
$15.6
硬體成本(美元)
NT$493
7 項自行採購組裝零件
270°
藍牙雷達掃描範圍
MG996R 伺服馬達帶動天線
以 RSSI 判斷方向與距離
TEYI 世界青少年發明展台灣選拔賽・銀牌 GSIC Global Sustainability Innovation Competition・金牌 Global Future Innovation Special Award 第二屆生成式 AI 智慧居家照護競賽・第三名 宜蘭縣第十八屆青少年發明展・第三名

研究目的

為什麼需要這套系統?

現代生活中,物品遺失、安全疏失與溝通盲點是居家管理的三大痛點,傳統監控系統僅能「被動記錄」,無法主動預防。

01 — 物品難以尋找
日常物品(鑰匙、錢包、眼鏡)頻繁失蹤,現有解決方案依賴人工記憶或單一藍牙標籤,無法主動辨識與定位。本系統透過 YOLO 視覺偵測 + BLE 雷達融合,實現精準追蹤。
02 — 兒童安全盲點
無法全天候人工看守危險物品或敏感區域(藥箱、廚房刀具、保險箱)。本系統的開櫃警示與安全監控模式,結合年齡辨識,實現智能化分級管控。
03 — 出門百密一疏
出門前遺漏物品、忘記帶傘是高頻困擾。系統整合人臉識別離家偵測、CWA 即時氣象資料與自定義攜帶清單驗證,讓每次出門萬無一失。

「我們不只是想做監控攝影機——我們想打造一個真正懂得家庭需求、能主動守護每個成員的 AI 管家。」

一套系統,五種智能場景

所有模式可一鍵切換,各自保留獨立設定狀態,透過主控台與觸控面板雙介面操作。

模式 II — 出門提醒

出門提醒模式

人臉識別觸發離家偵測,自動比對自定義攜帶清單,整合 CWA 氣象 API 判斷降雨機率,提醒攜帶雨具,視覺驗證確保萬無一失。

人臉識別 CWA 天氣 攜帶清單驗證 Edge-TTS 語音

操作流程圖

模式 III — 開櫃警示

開櫃警示模式

專用 YOLO 模型偵測指定區域的門扉開閉狀態,結合 Hybrid 人臉 + 年齡識別進行白名單 / 黑名單驗證,杜絕未授權人員存取藥箱等危險區域。

虛擬圍籬 年齡識別 權限管理 白名單驗證

操作流程圖

模式 IV — 安全監控

安全監控模式

MediaPipe 手部追蹤 + Hysteresis 遲滯演算法,精確判定危險物品拿取行為。雙閾值機制大幅降低誤判率,對兒童或特定對象的危險操作即時發出警告。

MediaPipe 手勢 Hysteresis 演算法 即時警報 雙閾值機制

操作流程圖

模式 V — 智慧管家

智慧管家

喚醒詞「智慧管家」啟動語音交互。Gemini AI 整合攝影機、雷達、SQLite 行為日誌,提供物品社交網絡分析、智慧推薦與週度遺失風險評估。

語音喚醒 社交網絡圖譜 風險預測 智慧推薦

操作流程圖

多模型協同 × 感測融合

採用 Multi-Model Inference 與 Sensor Fusion 架構,各層技術協同運作,兼顧效能與精確度。

系統運作流程

技術層級架構

介面層
PWA 模式儀表板 Phone Viewer FastAPI REST + WebSocket
AI 推論層
YOLO ONNX ×11 (瀏覽器推論) Gemini 3.5 Flash API MediaPipe Pose + Hand face-api.js Face Recognition
演算法層
Hysteresis 取放判定 Misplacement 亂放偵測 RSSI 三角定位 ItemSocialNetwork Fall-Detection State Machine
通訊層
WebSocket 中繼 (視訊/控制/ESP32) Telegram Bot API CWA 氣象 API
儲存層
SQLite (Zeabur Volume) IndexedDB Model Cache 事件影片自動錄製
視覺偵測
YOLO26n (ONNX)
11 個自訓練模型轉 ONNX,ONNX Runtime Web 瀏覽器內並行推論,針對物品、開門、年齡分別優化
多模態 AI
Gemini 3.5 Flash
高層次場景理解、語音意圖辨識、物品位置合宜性評估,API 金鑰由伺服器端代理保管
姿態追蹤
MediaPipe
Pose + Hand 3D 動作捕捉,跌倒偵測採時間序列狀態機(快速下墜 + 倒地 1.5 秒確認)
人臉識別
face-api.js
128 維特徵向量、多樣本註冊、0.45 門檻雙幀確認防誤認
語音合成
Edge-TTS
微軟神經網路 TTS,自然流暢中文語音回饋
語音識別
Web Speech API
瀏覽器即時語音辨識,喚醒詞「智慧管家」,可切換 ESP32-S3 外接麥克風收音
資料視覺化
Canvas + SVG
270° 極坐標雷達圖 Canvas 即時繪製、物品社交網路 SVG 圖譜
Web UI
FastAPI + PWA
Service Worker 離線快取、七語介面、依模式切換的專屬儀表板

核心演算法

Hysteresis 遲滯取放判定
採用雙閾值機制避免誤判手部晃動:
距離閾值 PICKUP_THRESHOLD = 350px
穩定閾值 STABILITY_THRESHOLD = 50
動作必須持續至少 PICKUP_DURATION = 0.3s 才判定為有效拿取,大幅降低誤報率。
物品亂放偵測
結合 Stationary Timer(靜止計時器)與 Gemini 的位置合宜性評估:物品靜止超過 5 秒,AI 判定位置異常時觸發警示。

配合 trigger_count / reset_count Hysteresis,防止警示閃爍。
物品社交網絡 (ItemSocialNetwork)
NetworkX 建構物品共現矩陣,追蹤每次外出的攜帶組合模式。SmartRecommender 根據外出場景推薦必帶清單,LossPredictor 提供週度遺失風險評估報告。
多租戶資料隔離
早期版本曾出現跨帳號資料互見與覆蓋——A 帳號的模式、追蹤物品、語言、警報、人臉與攜帶紀錄,B 帳號全部讀得到且一寫就蓋掉。

修正後以專用迴歸測試逐項鎖住每張表的擁有者條件。這類問題不會拋出錯誤、只會靜默外洩,因此必須用測試防止日後重構把隔離拿掉。

分散式硬體協同架構

家用主機瀏覽器負責 AI 推論,本機橋接程式經雲端 WebSocket 協調 ESP32-C3/S3 雷達掃描與伺服馬達指向,掃描結果即時回傳儀表板。

Master PC
PWA 儀表板
ONNX 瀏覽器推論
ESP32-C3 / S3
BLE 掃描
伺服馬達控制
即時連線狀態
目標裝置
手機 / AirTag
藍牙信標
雙攝影機陣列
Camera 1 + Camera 2 同時推論,物品消失前 5 秒自動截取影片並轉碼為 WebM (VP9)
Telegram 即時推播
asyncio 非同步廣播,支援多使用者訂閱,警報截圖即時推播至 Telegram
語音即時回饋
Edge-TTS 中文語音提示,async 音頻緩衝,喚醒詞「智慧管家」語音指令

原型展示

系統已完整實作並可即時運作,以下呈現實際系統操作介面與自製硬體模組。

40+
自訓練 YOLO
專用模型
8,000+
主程式碼行數
(單一 .py 檔)
5
智能操作
模式
2
雲端網頁
電腦+手機
尋找物品模式操作介面
尋找物品模式
出門提醒模式操作介面
出門提醒模式
開櫃警示模式操作介面
開櫃警示模式
安全監控模式操作介面
安全監控模式

手機遠端監控 App

手機遠端監控 App 操作介面
獨立手機介面(Port 7863,可安裝為 PWA)透過 WebSocket 即時同步主控台的警報狀態、雙攝影機即時影像與運作模式,支援遠端快照、警報解除與 5/30 分鐘暫緩,讓使用者外出時也能隨時掌握家中狀況。
即時影像同步 遠端警報控制 雙攝影機切換

自製硬體模組

BLE 雷達掃描裝置
BLE 雷達掃描裝置
ESP32 搭配伺服馬達驅動 BLE 天線進行 270° 旋轉掃描,透過 RSSI 定位計算目標物品方向與距離。3D 列印底座與外殼均自行設計製作。
MG996R 伺服馬達 BLE RSSI 270° 掃描 3D 列印
Smart Voice-Radar Hub
Smart Voice-Radar Hub
3D 列印外殼整合喇叭與 ICS43434 麥克風模組,作為語音助理的音訊輸出入中樞,支援喚醒詞「智慧助理」與即時 TTS 語音回饋。
ESP32-C3 / S3 MAX98357AR 喇叭模組 ICS43434 麥克風 Edge-TTS 3D 列印

硬體成本明細

全部硬體皆為自行採購組裝,總成本遠低於市售智慧監視器。

物品名稱 USD(美金預估)
ESP32-S32.82 dollar
ESP32-C31.89 dollar
MG996R (伺服馬達)1.52 dollar
ICS-43434 (麥克風)3.14 dollar
MAX98357A (放大器)0.82 dollar
喇叭1.26 dollar
定向藍牙接收器4.09 dollar
總額15.62 dollar

設計理念

系統的核心目標不是「功能最多」,而是讓家裡的每個人都能真正受益。設計時從不同家庭成員的實際需求出發,確保系統是幫助人的,而不是增加麻煩的。

01 — 長者友善
記憶困難的長輩不需要學習複雜操作,系統主動提醒、主動報告物品位置,完全被動使用即可,大幅提升長者自主尊嚴。
02 — 兒童安全
安全監控模式為家中幼兒提供額外保護,避免接觸危險物品或進入禁止區域,即時警示讓家長隨時掌握現場狀況。
03 — 減輕焦慮
出門提醒與天氣整合,解決「出門才發現忘了什麼」的日常焦慮,讓每次出門都從容不迫。
04 — 越用越聰明
系統以 SQLite 長期記錄行為習慣,透過物品共現分析學習使用者模式,推薦與提醒越來越貼近個人需求。
05 — 上手零門檻
系統內建兩套導覽:教學導覽以七種語言逐步說明每個功能怎麼用,簡報導覽則以 34 張卡片串成完整解說動線,讓第一次接觸的人不需要有人在旁邊講解也能看懂。

社會影響與 SDG 3

UN SDG 3 良好健康與福祉

以約 $15.62 美元(NT$493) 的硬體成本,讓科技照護不再是少數家庭的專利。研究邀請 80 名受訪者進行問卷調查,結果確認本系統符合聯合國永續發展目標 SDG 3「良好健康與福祉」的精神,讓每個家庭都能負擔得起高品質的居家安全防護。

89.5%
受訪者認為 AI 提醒能提升長輩自主尊嚴
100%
受訪者支持低成本硬體架構
100%
受訪者預期使用後焦慮感減少

除此之外,大多數的 AI 推論在本地端執行,僅必要時呼叫外部 API,確保使用者的隱私安全,也讓系統能在沒有穩定網路的環境下持續運作。

歷程與展望

開發歷程

從發現問題到獲得國際肯定,歷經約一年的研發歷程,持續迭代改進每一個核心模組。

2025
6 月
專案啟動
確立三大核心問題:找物品困難、兒童安全盲點、出門遺忘。開始收集物品影像資料集、訓練第一批 YOLO 模型。
2025
下半年
系統研發歷程 及其他 2 項
系統整合與硬體研發
完成 40+ YOLO 模型訓練、BLE 雷達硬體自製、Gradio 雙 UI 架構、語音助理與 Gemini 多模態整合。Smart Voice-Radar Hub 3D 列印完成。
視覺辨識引擎替換
初期採用 Google Gemini 進行即時辨識,但速度過慢。改用 YOLO 邊緣運算模型,以 Roboflow 標註資料進行訓練,大幅提升辨識速度。
介面從本地遷移至 Web
原先使用 Tkinter 本地介面,佔用大量電腦效能。改採 Gradio Web 介面後降低主機負擔,並支援手機瀏覽器開啟操作。
2025
11月 9日
宜蘭縣第十八屆青少年發明展
參加宜蘭縣青少年發明展,獲得評審肯定系統整合創新性。
第三名
宜蘭縣第十八屆青少年發明展獎狀
2026
1月 29日
TEYI 世界青少年發明展台灣選拔賽
參加世界青少年發明展台灣選拔賽,評審肯定系統整合度與創新性。
銀牌
TEYI 世界青少年發明展台灣選拔賽獎狀
2026
上半年
系統研發歷程 及其他 2 項
BLE 雷達從 Raspberry Pi 換成 ESP32
原使用 Raspberry Pi(體積大、成本 $120 USD),改用 ESP32-C3/S3(體積小、成本僅 $1.89 USD),大幅降低硬體成本並縮小裝置尺寸。
推播從 LINE 改為 Telegram
LINE 僅限台灣使用、每月免費訊息 200 則。改用 Telegram 後支援全球用戶,且訊息發送無上限,大幅提升系統通用性。
介面從中文擴展為多語言
系統原為中文介面,改版後新增英文支援,現已擴增至七種語言(繁中/簡中/英/韓/西/法/印地文)可於設定切換,提升國際展覽適用性。
2026
4月 17日
GSIC 全球永續創新競賽
Global Sustainability Innovation Competition,獲評為對 SDG 3 健康與福祉具有高度貢獻的創新方案。
金牌 Global Future Innovation Special Award
GSIC 2026 Gold Medal Certificate GSIC 2026 Global Future Innovation Special Award Certificate
2026
上半年
系統研發歷程 及其他 3 項
系統從本地版遷移至雲端版
原本的 Gradio 本地版受限於主機效能,流暢度取決於電腦好壞,也難以快速分享給他人試用。改為部署至雲端後,AI 推論移到瀏覽器內以 WebGPU / WASM 執行,只要打開網址就能使用,對電腦效能的需求大幅降低。
網站架設至 Zeabur
將評審展示網站部署至 Zeabur 雲端平台,實現自動從 GitHub 部署,讓評審可隨時透過網址瀏覽系統介紹。
安全監控擴充為三項可並行的偵測
安全監控模式從單一的物品拿取偵測,擴充為拿取偵測、跌倒偵測、危險區警示三項可獨立勾選並同時運作;跌倒與危險區以 MediaPipe 姿態估測實作,提升系統對居家安全事件的應對能力。
手機遠端監控介面
新增獨立運行的手機介面(可安裝為 PWA),透過雲端 WebSocket 同步雙鏡頭即時影像與警報狀態,使用者在外也能遠端查看畫面、切換運作模式、解除警報或暫緩通知。
2026
6月 10日
第二屆生成式 AI 智慧居家照護虛擬代理人創新應用競賽
羅東高工電機科周少鏞、羅東高中曹詠哲、興中國中周睦承跨校組隊「智慧監控系統」隊伍,參加長榮大學主辦競賽,榮獲高中職組第三名。
第三名
第二屆生成式 AI 智慧居家照護虛擬代理人創新應用競賽獎狀
2026
8月 14日
SVIIF 矽谷國際發明展
代表台灣參加 Silicon Valley International Invention Festival(美國加州),展示智能居家監控與物品管理系統。

未來展望

系統目前已穩定運作,支援多攝影機、多使用者與多種警示情境。以下是未來希望持續改進的方向:

01 — 自適應模型微調
根據每個家庭的實際物品與環境,在本地對 YOLO 模型進行增量訓練,提升對家庭專屬物品的辨識準確率,無需重新收集大規模資料集。
02 — 跨設備行為圖譜
擴展 ItemSocialNetwork 至多人家庭場景,建構每位成員的個人攜帶習慣模型,結合時序分析提供更精準的個人化遺失風險預警。
03 — 更精準的雷達定位
整合更多感測器資料,結合 AI 優化藍牙訊號處理演算法,讓目標物品的方向與距離判斷更加精準可靠,從 270° 擴展至完整環境覆蓋。
04 — 普及化部署
探索更低成本的硬體組合與容器化部署流程,讓這套系統更容易進入一般家庭。保留本地 AI 推論以保護隱私,僅將警報事件上傳雲端。

「居家智能化不應只是高端消費品的特權——透過開源硬體與 AI 技術的結合,每個家庭都能擁有屬於自己的智能守護者。」

常見問題

Q&A 常見問題

以下整理評審與訪客最常提出的疑問,協助您快速掌握系統的設計考量與實際運作方式。

為什麼同時使用 YOLO 與 Gemini 兩套 AI?會不會太複雜?
兩者分工明確:YOLO26n 在本地端做即時、低延遲的物件偵測與追蹤;Gemini 則在需要「理解場景」時(例如判斷物品擺放是否合宜)才呼叫雲端 API 輔助判讀。這樣既能維持毫秒級反應速度,又能兼顧複雜情境的智慧判斷,同時降低雲端 API 呼叫頻率與成本。
系統會不會經常誤判,發出太多不必要的警報?
我們透過 Hysteresis(遲滯)演算法與雙閾值機制過濾短暫或不穩定的偵測結果,唯有持續觸發達到設定次數才會發出警報,大幅降低誤判率,避免「狼來了」式的警報疲勞。
使用者的居家影像會不會被上傳到雲端,隱私安全嗎?
系統絕大多數 AI 推論皆在本地端執行,攝影機畫面不會持續上傳;僅在觸發警報時,才會將相關截圖上傳至雲端用於推播通知,最大程度保護使用者隱私。
這套系統與市售智慧監視器(如小米、Google Nest)有何不同?
市售監視器多半只能「被動錄影」;本系統整合五種主動模式(尋找物品、出門提醒、開櫃警示、安全監控、語音管家)於單一平台,並以約 20 美元的自製硬體達成,強調主動預防而非事後回放。
如果家中網路不穩定或斷線,系統還能正常運作嗎?
可以。核心偵測功能(YOLO、MediaPipe、face-api.js 人臉辨識、BLE 雷達)皆在本地端運算,網路僅用於 Gemini 進階場景判讀與 Telegram 推播通知,斷網時核心監控與警示功能仍可持續運作。
這套系統未來有機會量產或商業化嗎?
我們正朝「普及化部署」方向努力,探索更低成本的硬體組合與容器化部署流程,目標是讓一般家庭都能以親民價格享有這套智能居家防護系統。
為什麼「尋找物品模式」要同時使用視覺辨識(YOLO)與藍牙(BLE)雷達,不能只用其中一種嗎?
兩者互補、缺一不可:攝影機視覺辨識能「認出」物品是什麼(例如錢包、鑰匙),但若物品被遮擋、放入抽屜或位於鏡頭死角就無法偵測;BLE RSSI 訊號能穿透障礙物做全屋範圍定位,卻只能得知訊號強弱、無法辨識物品外觀與狀態。透過 BLE 三角定位結合視覺比對雙重驗證,即使物品不在攝影機視野內,系統仍能準確導引使用者找到物品,同時修正單靠訊號強度定位常見的誤差。
這套系統和其他用大型視覺模型(VLM)的方案,差別到底在哪裡?
差別在四個地方。第一是隱私優先:YOLO 即時偵測全部在本機完成,只有手機端影像轉發與 Gemini 視覺問答會經過伺服器,居家畫面不需要持續上傳雲端。第二是多模型架構:11 個模型並行運作,再搭配自製 BLE 雷達完成 270° 物品定位,視覺與訊號互相補位,物品被遮擋時仍能定位。第三是系統定位:我們不只回答「畫面裡有什麼」,而是整合物品社交網路與遺失風險預測,主動判斷你這次出門可能會忘記什麼。第四是硬體門檻:同類 VLM 方案通常需要 A100 等級 GPU,本系統在 MacBook 等級的一般筆電上就能即時運行,這才是能真正落地到一般家庭的成本結構。

團隊分工

開發團隊

本專案由三位成員共同開發,各自負責的模式與任務分工如下。

曹詠哲 Cao Yung-Zhe
安全監控模式 評審網站開發 模型訓練
周睦承 Chou Mu-Cheng
出門提醒模式 開櫃警示模式 模型訓練 報告撰寫
周少鏞 Chou Shao-Yong
主要統籌 尋找物品模式 硬體設備 模型訓練 海報內容撰寫 系統說明書撰寫