点一下就能抠图Segment Anything 图像分割从零到上手【免费下载链接】segment-anythingThe repository provides code for running inference with the SegmentAnything Model (SAM), links for downloading the trained model checkpoints, and example notebooks that show how to use the model.项目地址: https://gitcode.com/GitHub_Trending/se/segment-anything如果你被图像标注拖住过进度Segment AnythingSAM大概值得看一眼点一下、框一下就能拿到像素级掩码不用逐张画标注。它到底解决了什么问题以前想拿到一张图里某个对象的分割结果基本两条路标注员手工描多边形或者给每个新类别单独训一个模型。换批数据前面这些活就白干了。SAM 的做法是把分割做成基础模型先在 1100 万张图、11 亿个掩码上把通用分割能力练出来再接受你的提示点、框、甚至文本现算结果零样本就能用。实测下来它对没见过的场景和物体基本都能直接出活。架构上它分三层各干各的事图像编码器负责把输入图压成一份 image embedding提示编码器把点、框、文本统一编码掩码解码器拿这两路信号生成多个候选掩码并给每个候选打出质量分。三个最实用的用法点一下只要那个东西标注员挑图时最常用的姿势鼠标点在目标上出掩码不满意就加一个负点把多出来的部分剔掉。鸵鸟、背包、招牌这种零样本对象都能切连鸟头背包带这种局部细节也能点到。核心就四行from segment_anything import SamPredictor, sam_model_registry sam sam_model_registryvit_h predictor SamPredictor(sam) predictor.set_image(image) masks, scores, _ predictor.predict(point_coords[[x, y]], point_labels[1])整图自动切预标注直接出数据团队做预标注时最省事不喂任何提示让模型把整张图能切的都切出来。自动掩码生成器会自己排布提示点批量产出掩码每个都带 predicted IoU 和 stability score方便你按质量过滤。from segment_anything import SamAutomaticMaskGenerator, sam_model_registry sam sam_model_registryvit_h generator SamAutomaticMaskGenerator(sam) masks generator.generate(image)人多的街景也 hold 住密集街景是分割的硬骨头SAM 把画面切成一堆互不重叠的区域车、树、建筑、行人各归各位。不用写脚本仓库里带了命令行入口整个文件夹丢进去就能批量跑python scripts/amg.py --checkpoint sam_vit_h.pth --model-type vit_h --input 图片文件夹 --output 输出目录3分钟跑通装依赖、拉代码、装包一次装齐git clone https://gitcode.com/GitHub_Trending/se/segment-anything cd segment-anything pip install -e . pip install opencv-python pycocotools matplotlib然后从仓库的 Model Checkpoints 一节下好对应版本的权重加载即可from segment_anything import SamPredictor, sam_model_registry sam sam_model_registryvit_h predictor SamPredictor(sam) predictor.set_image(cv2.imread(notebooks/images/truck.jpg)[:, :, ::-1])装完之后第一件事打开notebooks/predictor_example.ipynb对着仓库自带的卡车图把框提示和点提示各跑一遍几分钟就能感受到交互修正的效果。demo/目录还有个 React 单页应用把导出的 ONNX 掩码解码器直接跑在浏览器里配合多线程实现鼠标一移就刷新掩码——适合给前端同学演示纯客户端也能做图像分割。选哪个版本一张表说清版本规模速度适用场景vit_hdefault1280 维 / 32 层最慢单卡 GPU 友好追求最高掩码质量默认选项vit_l1024 维 / 24 层居中质量与吞吐的折中档vit_b768 维 / 12 层最快CPU 可跑显存紧张或大批量吞吐大多数场景直接选 defaultvit_h就行除非你显存不够、或者要在线上高并发跑批那再降级到 vit_b。谁该用它怎么开始做数据集和论文的研究者拿它当零样本分割基线第一个该试的动作是跑一遍automatic_mask_generator_example.ipynb看自动掩码在你领域图上能不能直接当预标注。开发抠图、换背景功能的工程师把SamPredictor接进管线第一个该试的动作是用一正一负两个点把边界交互调准。业务和数据同学不用写代码拿一个现成图像文件夹跑scripts/amg.py看批量产出的掩码质量够不够直接入库。SAM 把标注加训练这条长链路压缩成了加载模型、给提示、拿掩码三步而且零样本就能上手。刚装好的话先把三个示例 notebook 从仓库里跑一遍如果你手上已有标注流程下一步就是把自动掩码生成器接进管线让标注员只干复核的活 【免费下载链接】segment-anythingThe repository provides code for running inference with the SegmentAnything Model (SAM), links for downloading the trained model checkpoints, and example notebooks that show how to use the model.项目地址: https://gitcode.com/GitHub_Trending/se/segment-anything创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考