Bundle
xby-pic
包括通用文本识别、手写识别、车牌识别、身份证识别、日常物体检测、昆虫识别、植物识别、护照识别、港澳台通行证识别、银行卡识别、营业执照识别、驾驶证识别、行驶证识别、动物识别、电动自行车检测、手机检测、手势检测、火焰检测、香烟检测、人头人体检测、野生动物检测、鸟类识别、宠物情绪识别、菜品识别、安全帽人体检测、行人检测、反光衣检测、车辆检测、图像分类、目标检测、旋转目标检测、人体姿态估计和万物识别。
- Source
- xby-skill
- License
- MIT
- Updated
- Updated 6 days ago
Readme
# xby-pic DeepSeek Harness (DSH) 的插件:图片工具集 包括通用文本识别、手写识别、车牌识别、身份证识别、日常物体检测、昆虫识别、植物识别、护照识别、港澳台通行证识别、银行卡识别、营业执照识别、驾驶证识别、行驶证识别、动物识别、电动自行车检测、手机检测、手势检测、火焰检测、香烟检测、人头人体检测、野生动物检测、鸟类识别、宠物情绪识别、菜品识别、安全帽人体检测、行人检测、反光衣检测、车辆检测、图像分类、目标检测、旋转目标检测、人体姿态估计和万物识别。 ## 功能 - **set_xby_apikey** — 在聊天中设置 API 密钥(自动持久化,重启有效) - **ocr** — 兼顾速度与精度的文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件链接。 - **ocr_for_data_base64** — 兼顾速度与精度的文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件的BASE64编码。 - **ocr_for_data_file** — 兼顾速度与精度的文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件的文件路径。 - **ocr_pro** — 高精度文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件链接。 - **ocr_pro_for_data_base64** — 高精度文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件的BASE64编码。 - **ocr_pro_for_data_file** — 高精度文字识别。输入包含文本的图像,自动检测并识别内容。适用于各类文档、广告牌、屏幕截图等场景。 需要输入图片文件的文件路径。 - **ocr_handwriting** — 输入包含手写文本的图像,自动检测文本行并识别内容。适用于手写笔记、签名、手写表单等。 需要输入图片文件链接。 - **ocr_handwriting_for_data_base64** — 输入包含手写文本的图像,自动检测文本行并识别内容。适用于手写笔记、签名、手写表单等。 需要输入图片文件的BASE64编码。 - **ocr_handwriting_for_data_file** — 输入包含手写文本的图像,自动检测文本行并识别内容。适用于手写笔记、签名、手写表单等。 需要输入图片文件的文件路径。 - **plate_recognition** — 识别车牌号、车牌颜色、单/双层车牌、位置框。 需要输入图片文件链接。 - **plate_recognition_for_data_base64** — 识别车牌号、车牌颜色、单/双层车牌、位置框。 需要输入图片文件的BASE64编码。 - **plate_recognition_for_data_file** — 识别车牌号、车牌颜色、单/双层车牌、位置框。 需要输入图片文件的文件路径。 - **ocr_bank_card** — 识别银行卡号、发卡银行和卡类型,使用 Luhn 算法校验卡号有效性。 需要输入图片文件链接。 - **ocr_bank_card_for_data_base64** — 识别银行卡号、发卡银行和卡类型,使用 Luhn 算法校验卡号有效性。 需要输入图片文件的BASE64编码。 - **ocr_bank_card_for_data_file** — 识别银行卡号、发卡银行和卡类型,使用 Luhn 算法校验卡号有效性。 需要输入图片文件的文件路径。 - **ocr_biz_license** — 识别营业执照的统一社会信用代码、名称、法定代表人、注册资本、成立日期、经营范围、登记机关和住所地址。 需要输入图片文件链接。 - **ocr_biz_license_for_data_base64** — 识别营业执照的统一社会信用代码、名称、法定代表人、注册资本、成立日期、经营范围、登记机关和住所地址。 需要输入图片文件的BASE64编码。 - **ocr_biz_license_for_data_file** — 识别营业执照的统一社会信用代码、名称、法定代表人、注册资本、成立日期、经营范围、登记机关和住所地址。 需要输入图片文件的文件路径。 - **ocr_driver_license** — 识别驾驶证主页(证号、姓名、性别、国籍、住址、出生日期、准驾车型、初次领证日期、有效期限)和副页(档案编号)。 需要输入图片文件链接。 - **ocr_driver_license_for_data_base64** — 识别驾驶证主页(证号、姓名、性别、国籍、住址、出生日期、准驾车型、初次领证日期、有效期限)和副页(档案编号)。 需要输入图片文件的BASE64编码。 - **ocr_driver_license_for_data_file** — 识别驾驶证主页(证号、姓名、性别、国籍、住址、出生日期、准驾车型、初次领证日期、有效期限)和副页(档案编号)。 需要输入图片文件的文件路径。 - **ocr_vehicle_license** — 识别机动车行驶证的号牌号码、车辆类型、所有人、住址、品牌型号、发动机号码、车辆识别代号等信息,支持自动方向检测和主副页过滤。 需要输入图片文件链接。 - **ocr_vehicle_license_for_data_base64** — 识别机动车行驶证的号牌号码、车辆类型、所有人、住址、品牌型号、发动机号码、车辆识别代号等信息,支持自动方向检测和主副页过滤。 需要输入图片文件的BASE64编码。 - **ocr_vehicle_license_for_data_file** — 识别机动车行驶证的号牌号码、车辆类型、所有人、住址、品牌型号、发动机号码、车辆识别代号等信息,支持自动方向检测和主副页过滤。 需要输入图片文件的文件路径。 - **ocr_id_card** — 识别身份证正面(姓名、性别、民族、出生日期、住址、身份证号)和背面(签发机关、有效期限),自动判断正反面并校验身份证号有效性。 需要输入图片文件链接。 - **ocr_id_card_for_data_base64** — 识别身份证正面(姓名、性别、民族、出生日期、住址、身份证号)和背面(签发机关、有效期限),自动判断正反面并校验身份证号有效性。 需要输入图片文件的BASE64编码。 - **ocr_id_card_for_data_file** — 识别身份证正面(姓名、性别、民族、出生日期、住址、身份证号)和背面(签发机关、有效期限),自动判断正反面并校验身份证号有效性。 需要输入图片文件的文件路径。 - **ocr_pass** — 识别港澳通行证、台湾通行证的通行证号码、姓名、性别、出生日期、有效期、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件链接。 - **ocr_pass_for_data_base64** — 识别港澳通行证、台湾通行证的通行证号码、姓名、性别、出生日期、有效期、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件的BASE64编码。 - **ocr_pass_for_data_file** — 识别港澳通行证、台湾通行证的通行证号码、姓名、性别、出生日期、有效期、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件的文件路径。 - **ocr_passport** — 识别护照号码、中文姓名、英文姓名、性别、国籍、出生日期、签发日期、有效期至、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件链接。 - **ocr_passport_for_data_base64** — 识别护照号码、中文姓名、英文姓名、性别、国籍、出生日期、签发日期、有效期至、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件的BASE64编码。 - **ocr_passport_for_data_file** — 识别护照号码、中文姓名、英文姓名、性别、国籍、出生日期、签发日期、有效期至、签发地点等信息,支持MRZ机读码解析。 需要输入图片文件的文件路径。 - **daily_object_detection** — 输入一张图像,对其中的人/宠物/车/火焰/纸箱进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **daily_object_detection_for_data_base64** — 输入一张图像,对其中的人/宠物/车/火焰/纸箱进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **daily_object_detection_for_data_file** — 输入一张图像,对其中的人/宠物/车/火焰/纸箱进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **insect_recognition** — 识别昆虫或其他节肢动物名称(或所属目, 科, 属, 种)。 需要输入图片文件链接。 - **insect_recognition_for_data_base64** — 识别昆虫或其他节肢动物名称(或所属目, 科, 属, 种)。 需要输入图片文件的BASE64编码。 - **insect_recognition_for_data_file** — 识别昆虫或其他节肢动物名称(或所属目, 科, 属, 种)。 需要输入图片文件的文件路径。 - **plant_recognition** — 识别植物名称(或所属科, 属, 种或亚种)。 需要输入图片文件链接。 - **plant_recognition_for_data_base64** — 识别植物名称(或所属科, 属, 种或亚种)。 需要输入图片文件的BASE64编码。 - **plant_recognition_for_data_file** — 识别植物名称(或所属科, 属, 种或亚种)。 需要输入图片文件的文件路径。 - **animal_recognition** — 对含有动物的图像进行标签识别,无需任何额外输入,输出动物的类别标签。 需要输入图片文件链接。 - **animal_recognition_for_data_base64** — 对含有动物的图像进行标签识别,无需任何额外输入,输出动物的类别标签。 需要输入图片文件的BASE64编码。 - **animal_recognition_for_data_file** — 对含有动物的图像进行标签识别,无需任何额外输入,输出动物的类别标签。 需要输入图片文件的文件路径。 - **cellphone_detection** — 输入一张图像,对其中的手机进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **cellphone_detection_for_data_base64** — 输入一张图像,对其中的手机进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **cellphone_detection_for_data_file** — 输入一张图像,对其中的手机进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **ebike_detection** — 输入一张图像,对其中的电动自行车进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **ebike_detection_for_data_base64** — 输入一张图像,对其中的电动自行车进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **ebike_detection_for_data_file** — 输入一张图像,对其中的电动自行车进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **fire_detection** — 检测各类通用场景中出现的火焰,最佳使用场景:安防摄像头、交通摄像头视角。 需要输入图片文件链接。 - **fire_detection_for_data_base64** — 检测各类通用场景中出现的火焰,最佳使用场景:安防摄像头、交通摄像头视角。 需要输入图片文件的BASE64编码。 - **fire_detection_for_data_file** — 检测各类通用场景中出现的火焰,最佳使用场景:安防摄像头、交通摄像头视角。 需要输入图片文件的文件路径。 - **general_recognition** — 对包含主体物体的图像进行标签识别,输出主体物体的类别标签,目前已经覆盖了5万多类的物体类别。 需要输入图片文件链接。 - **general_recognition_for_data_base64** — 对包含主体物体的图像进行标签识别,输出主体物体的类别标签,目前已经覆盖了5万多类的物体类别。 需要输入图片文件的BASE64编码。 - **general_recognition_for_data_file** — 对包含主体物体的图像进行标签识别,输出主体物体的类别标签,目前已经覆盖了5万多类的物体类别。 需要输入图片文件的文件路径。 - **gesture_detection** — 输入一张图像,对其中的手势进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **gesture_detection_for_data_base64** — 输入一张图像,对其中的手势进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **gesture_detection_for_data_file** — 输入一张图像,对其中的手势进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **head_person_detection** — 输入一张图像,对其中的人头人体进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **head_person_detection_for_data_base64** — 输入一张图像,对其中的人头人体进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **head_person_detection_for_data_file** — 输入一张图像,对其中的人头人体进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **smoking_detection** — 输入一张图像,对其中的香烟目标进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **smoking_detection_for_data_base64** — 输入一张图像,对其中的香烟目标进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **smoking_detection_for_data_file** — 输入一张图像,对其中的香烟目标进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **wild_animals_detection** — 输入一张图像,输出图像中所有识别到的野生动物的检测框、置信度及标签。 需要输入图片文件链接。 - **wild_animals_detection_for_data_base64** — 输入一张图像,输出图像中所有识别到的野生动物的检测框、置信度及标签。 需要输入图片文件的BASE64编码。 - **wild_animals_detection_for_data_file** — 输入一张图像,输出图像中所有识别到的野生动物的检测框、置信度及标签。 需要输入图片文件的文件路径。 - **bird_detection** — 检测并识别图片中的鸟类。 需要输入图片文件链接。 - **bird_detection_for_data_base64** — 检测并识别图片中的鸟类。 需要输入图片文件的BASE64编码。 - **bird_detection_for_data_file** — 检测并识别图片中的鸟类。 需要输入图片文件的文件路径。 - **pet_emotion_recognition** — 识别宠物面部表情,输出 4 类情绪: Angry / Happy / Relaxed / Sad。 需要输入图片文件链接。 - **pet_emotion_recognition_for_data_base64** — 识别宠物面部表情,输出 4 类情绪: Angry / Happy / Relaxed / Sad。 需要输入图片文件的BASE64编码。 - **pet_emotion_recognition_for_data_file** — 识别宠物面部表情,输出 4 类情绪: Angry / Happy / Relaxed / Sad。 需要输入图片文件的文件路径。 - **dish_recognition** — 菜品识别,输出可能的菜品名称及概率。 需要输入图片文件链接。 - **dish_recognition_for_data_base64** — 菜品识别,输出可能的菜品名称及概率。 需要输入图片文件的BASE64编码。 - **dish_recognition_for_data_file** — 菜品识别,输出可能的菜品名称及概率。 需要输入图片文件的文件路径。 - **helmet_head_person_detection** — 输入一张图像,对其中的人体、头部和安全帽进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **helmet_head_person_detection_for_data_base64** — 输入一张图像,对其中的人体、头部和安全帽进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **helmet_head_person_detection_for_data_file** — 输入一张图像,对其中的人体、头部和安全帽进行检测,输出图片中所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **detect_pedestrian** — 输入一张图像,检测图像中的行人,输出所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **detect_pedestrian_for_data_base64** — 输入一张图像,检测图像中的行人,输出所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **detect_pedestrian_for_data_file** — 输入一张图像,检测图像中的行人,输出所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **detect_reflective_vest** — 输入一张图像,检测人员是否穿戴反光衣,输出图片中所有目标的检测框、置信度和标签(safe/unsafe)。 需要输入图片文件链接。 - **detect_reflective_vest_for_data_base64** — 输入一张图像,检测人员是否穿戴反光衣,输出图片中所有目标的检测框、置信度和标签(safe/unsafe)。 需要输入图片文件的BASE64编码。 - **detect_reflective_vest_for_data_file** — 输入一张图像,检测人员是否穿戴反光衣,输出图片中所有目标的检测框、置信度和标签(safe/unsafe)。 需要输入图片文件的文件路径。 - **detect_vehicle** — 输入一张图像,检测图像中的车辆类型(car/truck/bus/motorbike/tricycle/carplate),输出所有目标的检测框、置信度和标签。 需要输入图片文件链接。 - **detect_vehicle_for_data_base64** — 输入一张图像,检测图像中的车辆类型(car/truck/bus/motorbike/tricycle/carplate),输出所有目标的检测框、置信度和标签。 需要输入图片文件的BASE64编码。 - **detect_vehicle_for_data_file** — 输入一张图像,检测图像中的车辆类型(car/truck/bus/motorbike/tricycle/carplate),输出所有目标的检测框、置信度和标签。 需要输入图片文件的文件路径。 - **yolo26_classify** — 对图像进行ImageNet 1000类分类,返回Top-5类别和置信度。 需要输入图片文件链接。 - **yolo26_classify_for_data_base64** — 对图像进行ImageNet 1000类分类,返回Top-5类别和置信度。 需要输入图片文件的BASE64编码。 - **yolo26_classify_for_data_file** — 对图像进行ImageNet 1000类分类,返回Top-5类别和置信度。 需要输入图片文件的文件路径。 - **yolo26_detect** — 检测图像中的80类COCO目标(人、车、动物、日常物品等),输出边界框、置信度和类别标签。 需要输入图片文件链接。 - **yolo26_detect_for_data_base64** — 检测图像中的80类COCO目标(人、车、动物、日常物品等),输出边界框、置信度和类别标签。 需要输入图片文件的BASE64编码。 - **yolo26_detect_for_data_file** — 检测图像中的80类COCO目标(人、车、动物、日常物品等),输出边界框、置信度和类别标签。 需要输入图片文件的文件路径。 - **yolo26_obb_detect** — 检测图像中的旋转目标,输出旋转边界框、角度、置信度和类别标签。支持15个目标类别:plane, ship,storage tank,baseball diamond,tennis court,basketball court,ground track field, harbor, bridge,large vehicle,small vehicle, helicopter, roundabout,soccer ball field,swimming pool。 需要输入图片文件链接。 - **yolo26_obb_detect_for_data_base64** — 检测图像中的旋转目标,输出旋转边界框、角度、置信度和类别标签。支持15个目标类别:plane, ship,storage tank,baseball diamond,tennis court,basketball court,ground track field, harbor, bridge,large vehicle,small vehicle, helicopter, roundabout,soccer ball field,swimming pool。 需要输入图片文件的BASE64编码。 - **yolo26_obb_detect_for_data_file** — 检测图像中的旋转目标,输出旋转边界框、角度、置信度和类别标签。支持15个目标类别:plane, ship,storage tank,baseball diamond,tennis court,basketball court,ground track field, harbor, bridge,large vehicle,small vehicle, helicopter, roundabout,soccer ball field,swimming pool。 需要输入图片文件的文件路径。 - **yolo26_pose_estimate** — 检测图像中的人物,输出边界框和关键点坐标。每人有 17 个关键点,每个点代表人体不同的部位,依次为鼻子、左眼、右眼、左耳、右耳、左肩、右肩、左肘、右肘、左腕、右腕、左髋、右髋、左膝、右膝、左脚踝、右脚踝。 需要输入图片文件链接。 - **yolo26_pose_estimate_for_data_base64** — 检测图像中的人物,输出边界框和关键点坐标。每人有 17 个关键点,每个点代表人体不同的部位,依次为鼻子、左眼、右眼、左耳、右耳、左肩、右肩、左肘、右肘、左腕、右腕、左髋、右髋、左膝、右膝、左脚踝、右脚踝。 需要输入图片文件的BASE64编码。 - **yolo26_pose_estimate_for_data_file** — 检测图像中的人物,输出边界框和关键点坐标。每人有 17 个关键点,每个点代表人体不同的部位,依次为鼻子、左眼、右眼、左耳、右耳、左肩、右肩、左肘、右肘、左腕、右腕、左髋、右髋、左膝、右膝、左脚踝、右脚踝。 需要输入图片文件的文件路径。 - **yolo26_segment** — 实例分割比目标检测更进一步,不但要识别图像中的单个对象,还要将其从图像的其余部分中分割出来。对图像中的80类COCO目标进行实例分割,输出边界框、掩膜、置信度和类别标签。 需要输入图片文件链接。 - **yolo26_segment_for_data_base64** — 实例分割比目标检测更进一步,不但要识别图像中的单个对象,还要将其从图像的其余部分中分割出来。对图像中的80类COCO目标进行实例分割,输出边界框、掩膜、置信度和类别标签。 需要输入图片文件的BASE64编码。 - **yolo26_segment_for_data_file** — 实例分割比目标检测更进一步,不但要识别图像中的单个对象,还要将其从图像的其余部分中分割出来。对图像中的80类COCO目标进行实例分割,输出边界框、掩膜、置信度和类别标签。 需要输入图片文件的文件路径。 ## 安装 ### 方式一:从 GitHub 直接安装(推荐) ```bash # 格式: dsh plugin --profile <profile> add github:<owner>/<repo> dsh plugin --profile web add github:xby_skill/xby-pic ``` ### 方式二:从本地目录安装(开发模式) ```bash # 仅用于本地开发调试 dsh plugin --profile web add /absolute/path/to/xby-pic ``` ### 方式三:通过 cordis.patch.yml 开发调试 ```bash dsh web --profile web --patch /absolute/path/to/dsh-ocr-plugin/cordis.patch.yml ``` ## 配置 ### 获取 API 密钥 前往 [小笨羊官网](https://xiaobenyang.com) 注册并获取 API 密钥。
Install
dsh plugin --profile web add github:xby-skill/xby-pic
Profile: web
With the hub plugin installed, ask your agent to install it by name — it resolves the same plan shown here.
dsh plugin --profile web add github:stvlynn/dsh.fish#path:packages/dsh-plugin-hub
install xby-pic from the hub
- This package builds from source on install. pnpm will ask you to allow its build script — that is permission to run the package’s code on your machine, outside the agent sandbox. Only allow sources you trust.
- This source has no pinned commit, so a later push upstream changes what installs. Prefer pinning a commit.